OpenAI发布最新推理模型o3-mini

server/2025/2/5 21:25:14/

OpenAI于周五推出了新的AI"推理"模型o3-mini,这是该公司o系列推理模型家族的最新成员。

OpenAI此前在12月份就预告过这个模型,同时还展示了一个能力更强的系统o3。此次发布恰逢OpenAI面临诸多机遇与挑战的关键时刻。

目前,OpenAI正在应对外界对其在AI竞赛中可能落后于DeepSeek等中国企业的质疑。与此同时,该公司正在努力巩固与华盛顿的关系,推进其雄心勃勃的数据中心项目,据报道还在为史上最大规模融资之一做准备。

在这样的背景下,o3-mini应运而生。OpenAI将这款新模型定位为既"强大"又"实惠"的选择。

OpenAI发言人在接受采访时表示:“今天的发布标志着[…]在实现我们使先进AI更易获取的使命道路上迈出的重要一步。”

更高效的推理能力

与大多数大语言模型不同,o3-mini这样的推理模型在输出结果之前会进行彻底的事实核查。这种方式可以帮助模型避免一些常见的错误。虽然这些推理模型需要更多时间得出解决方案,但回报是它们在物理等领域往往更可靠——尽管仍非完美。

o3-mini专门针对STEM问题进行了优化,特别是在编程、数学和科学领域。OpenAI表示,该模型在能力上基本与o1系列(o1和o1-mini)相当,但运行更快,成本更低。

据公司称,外部测试者在超过一半的情况下更倾向于选择o3-mini的答案而非o1-mini。在A/B测试中,o3-mini在处理"复杂的现实问题"时,"重大错误"比o1-mini减少了39%,同时能提供更清晰的回答,响应速度提升了约24%。

部署和定价详情

o3-mini从周五开始通过ChatGPT向所有用户开放,但ChatGPT Plus和Team计划的付费用户每天可获得更高的150次查询限制。ChatGPT Pro订阅者将获得无限访问权限。一周后,o3-mini将向ChatGPT Enterprise和ChatGPT Edu用户开放。

付费计划用户可以通过ChatGPT的下拉菜单选择o3-mini。免费用户可以点击聊天栏中的新"推理"按钮,或让ChatGPT"重新生成"答案。

从周五开始,o3-mini也将通过OpenAI的API向特定开发者开放,但初期不支持图像分析。开发者可以根据使用场景和延迟需求选择"推理努力程度"(低、中、高)。

在定价方面,o3-mini的缓存输入令牌费用为每百万个0.55美元,输出令牌为每百万个4.40美元(约一百万个令牌相当于75万个词)。这比o1-mini便宜63%,与DeepSeek的R1推理模型定价相当具有竞争力。

性能与局限性

需要说明的是,o3-mini并非OpenAI迄今最强大的模型,也并不是在所有基准测试中都超越了DeepSeek的R1推理模型。

o3-mini在AIME 2024(一个测试模型理解和响应复杂指令能力的测试)上确实超过了R1,但仅限于高推理努力程度设置下。在编程相关的SWE-bench Verified测试中也略胜一筹(高出0.1分),同样需要在高推理努力程度下才能实现。在低推理努力程度设置下,o3-mini在测试博士级物理、生物和化学问题的GPQA Diamond上落后于R1。

不过,o3-mini确实能以具有竞争力的低成本和延迟来回答许多查询。OpenAI在其公告中详细比较了它与o1系列的表现,并强调了其在安全性方面的优势。

注:文中涉及的AI服务测试基于ChatShare技术平台完成,该平台提供ChatGPT/Claude/Midjourney等AI服务的国内支持,访问服务介绍页

文章来源:GPTCard科技


http://www.ppmy.cn/server/165236.html

相关文章

(1)Linux高级命令简介

Linux高级命令简介 在安装好linux环境以后第一件事情就是去学习一些linux的基本指令,我在这里用的是CentOS7作演示。 首先在VirtualBox上装好Linux以后,启动我们的linux,输入账号密码以后学习第一个指令 简介 Linux高级命令简介ip addrtou…

C++和Python实现SQL Server数据库导出数据到S3并导入Redshift数据仓库

用C实现高性能数据处理,Python实现操作Redshift导入数据文件。 在Visual Studio 2022中用C和ODBC API导出SQL Server数据库中张表中的所有表的数据为CSV文件格式的数据流,用逗号作为分隔符,用双引号包裹每个数据,字符串类型的数据…

Android 9.0 mtk默认浏览器Browser下载app不能安装问题的解决办法

1.前言 在系统9.0的ROM定制化开发中,在开发mtk平台的时候,在系统默认浏览器Browser中发现在下载某些app的时候,结果显示的确实 在下载到内部存储的时候,点击安装的时候安装失败,所以就需要从Browser的下载流程中出发分析相关源码来实现具体的功能 2.mtk默认浏览器Browser…

使用python实现与本地ollama部署的deepseek对话

专栏总目录 按照ollama官方doc的example操作,没有成功与本地ollama上的deepseek-r1:1.5b通讯后,发现vscode可以调用本地ollama上的deepseek模型。 为了实现与ollama上的deepseek模型通讯,我使用wireshark对本地回环地址进行侦听后&#xff0c…

15JavaWeb——Maven高级篇

Maven高级 Web开发讲解完毕之后,我们再来学习Maven高级。其实在前面的课程当中,我们已经学习了Maven。 我们讲到 Maven 是一款构建和管理 Java 项目的工具。经过前面 10 多天 web 开发的学习,相信大家对于 Maven 这款工具的基本使用应该没什…

(动态规划路径基础 最小路径和)leetcode 64

视频教程 1.初始化dp数组&#xff0c;初始化边界 2、从[1行到n-1行][1列到m-1列]依次赋值 #include<vector> #include<algorithm> #include <iostream>using namespace std; int main() {vector<vector<int>> grid { {1,3,1},{1,5,1},{4,2,1}…

Shell基础:中括号的使用

在Shell脚本中&#xff0c;中括号&#xff08;[ ... ] 和 [[ ... ]]&#xff09;是一种常见的条件测试结构。它们用于进行文件类型检查、值比较以及逻辑判断。通过了解它们的不同特点和用法&#xff0c;能够帮助你编写更加高效、安全且易读的脚本。本文将详细介绍Shell中单中括…

ZZNUOJ(C/C++)基础练习1051——1060(详解版)

1051 : 求数列的和 题目描述 数列的定义如下&#xff1a; 数列的第一项为item&#xff0c;以后各项为前一项的平方根&#xff0c;求数列的前n项的和。 输入 由两个整数item&#xff08;item<10000&#xff09;和n(n<1000)组成&#xff0c;item和n的含义如前所述。 输出…