物化生水平比肩人类博士,OpenAI发布o1推理模型,碾压GPT-4o!

seekdeep9个月前AI资讯432

对于复杂的推理任务来说,o1 代表了当前人工智能(AI)能力的新水平。

就在刚刚,OpenAI 的“草莓”模型正式发布,名为“o1”,这是一系列新的人工智能模型,旨在花更多时间思考后再做出回答。

与以前的科学、编码和数学模型相比,o1 模型可以推理复杂的任务,解决更难的问题。

就像人类一样,o1 系列模型会用更多时间思考问题,然后再做出回答。通过训练,这些模型学会了完善思考过程、尝试不同的策略,并认识到自己的错误。

据 OpenAI 介绍,在测试中,o1 的下一个更新模型在物理、化学和生物等具有挑战性的基准任务上的表现达到了博士生的水平。

他们还发现,这一模型在数学和编码方面表现出色。在国际数学奥林匹克(IMO)的资格考试中,GPT-4o 只正确解决了 13% 的问题,而 o1 模型的得分率则高达 83%。

此外,o1 模型的编码能力也在竞赛中得到了评估,在 Codeforces 竞赛中达到了第 89 个百分点。

作为早期模型,o1 还不具备 ChatGPT 的许多实用功能,如浏览网页信息、上传文件和图片等。对于许多常见情况,GPT-4o 在短期内会有更强的功能。

但 OpenAI 表示,o1 模型更擅长解决科学、编码、数学和类似领域的复杂问题。例如,医疗保健研究人员可以使用 o1 为细胞测序数据添加注释,物理学家可以使用 o1 生成量子光学所需的复杂数学公式,所有领域的开发人员都可以使用 o1 构建和执行多步骤工作流。

以下三个视频 demo 展示了o1 模型在解决复杂推理问题方面的强大能力。

视频|o1 解决了一个复杂的逻辑难题。

视频|o1 根据提示为视频游戏编码。

视频|o1 翻译了一个损坏的句子。

此外,在安全性方面,OpenAI 提出了一种新的安全训练方法,利用 o1 模型的推理能力,使它们遵守安全和对齐准则。通过在上下文中对安全规则进行推理,o1 模型可以更有效地应用这些规则。

衡量安全性的方法之一,是测试当用户试图绕过安全规则(即“越狱”)时,模型能在多大程度上继续遵循其安全规则。在最难的越狱测试中,GPT-4o 得分为 22 分(0-100 分),而 o1-preview 得分为 84 分。

此外,为了向开发人员提供更高效的解决方案,OpenAI 还同时发布了 o1-mini,这是一种速度更快、成本更低的推理模型,在编码方面尤为有效。作为一个较小的模型,o1-mini 比 o1-preview 便宜 80%,因此对于需要推理但不需要广泛世界知识的应用程序来说,它是一个经济高效的模型。

目前,o1 的预览版本和 o1-mini 已经在 ChatGPT(Plus 和 Team)和 API 上线。未来,o1-mini 将提供给所有 ChatGPT 免费用户使用。

相关文章

6小时收藏破5000次,利好国产GPU。DeepSeek开源第一弹!

6小时收藏破5000次,利好国产GPU。DeepSeek开源第一弹!

2月24日,在上周DeepSeek宣布本周将是开源周(OpenSourceWeek),并将连续开源五个软件库后。今日上午9:30时许,DeepSeek宣布开源了本次开源周首款代码库——针对Hopper...

MedGPT凭借精确性成为医生“好帮手”,筑牢安全防线!

MedGPT凭借精确性成为医生“好帮手”,筑牢安全防线!

近日,国家卫生健康委办公厅、国家中医药局综合司、国家疾控局综合司联合发布《卫生健康行业人工智能应用场景参考指引》,指出各地要积极推进卫生健康行业“人工智能+”应用创新发展,在医学影像智能辅助诊断及质控...

是数据不够,还是能力太强?ChatGPT-5为何按下“暂停键”。

是数据不够,还是能力太强?ChatGPT-5为何按下“暂停键”。

关于ChatGPT-5的发布延迟,行业内外的猜测可谓五花八门。人们不仅期待新一代模型的问世,也在揣测它背后的迟滞原因。是数据量不足的技术困局,当前数据量的增长遇到了瓶颈?还是AGI(通用人工智能)的控...

AI创业者的辛酸谁懂?砸1个亿,投入400人,2款产品落地!

AI创业者的辛酸谁懂?砸1个亿,投入400人,2款产品落地!

正值新春佳节,整个互联网都被DeepSeek塑造的AI成功学氛围所笼罩,处处洋溢着对AI领域斐然成就的热烈讨论与展望。就在当天傍晚,我刷微信朋友圈时,一条长文闯入眼帘,与这喜气洋洋的氛围形成鲜明反差。...

GPT-4正接管人类数据专家:先验知识让LLM大胆预测,准确率堪比传统方式

终有一天,LLM可以成为人类数据专家,针对不同领域进行数据分析,大大解放AI研究员。在数据科学中,AI研究员经常面临处理不完整数据集的挑战。然而,许多已有的算法根本无法处理「不完整」的数据序列。传统上...

微软Copilot全面升级OpenAI GPT-4 Turbo模型,免费用户同样享受!

在经过一系列工作之后,微软现已针对 Copilot 用户群全面升级为 OpenAI 最先进的 GPT-4 Turbo 模型。IT之家提醒,CopilotPro 用户如果不习惯的话还可以切换回标准 GP...