OpenAI发布GPT-6 Sol和Luna:API价格较GPT-5.6促销价直降50%,主打高性价比 - 果核剥壳

9月23日消息,OpenAI今日发布GPT-6系列模型的最新成员GPT-6 Sol和GPT-6 Luna。

OpenAI官方表示,两款模型采用与GPT-6 Astra类似的方法进行训练,将Astra在专业工作、事实性、编码、计算机使用和对齐等方面最先进的性能带入更快、更经济的模型。两款模型的API价格相比GPT-5.6促销价降低50%。不过官方也强调,GPT-6 Astra依然是其整体上最优秀的模型,如果想要最佳效果和无妥协的体验,仍建议选择GPT-6 Astra。

OpenAI发布GPT-6 Sol和Luna:API价格较GPT-5.6促销价直降50%,主打高性价比

性能表现方面:

在AutomationBench跨应用业务流程测试中,GPT-6 Sol在xhigh强度下表现优于Claude Opus 5,成本仅为Opus 5每任务成本的9%;GPT-6 Luna在high强度下比前代提升5.4%,每项任务成本降低58%。

在评估智能体的Last Exam测试中,GPT-6 Sol在max effort状态下得分56.4%,高于Claude Opus 5在评估中的最高分,每任务成本降低60%。

事实可靠性方面,在OpenAI基于去标识化真实世界对话的测试中,GPT-6 Sol的错误率约为前代的一半,接近Astra级可靠性且成本更低;GPT-6 Luna的事实可靠性也大幅提升。

编程方面,两款模型均针对AI Coding Agent工作负载进行了优化。在FrontierCode 1.1 Main测试中,GPT-6 Sol相比GPT-5.6 Sol明显提升,并以更低成本达到与Claude Fable 5.1 xhigh相当的水平。在DeepSWE v1.1软件工程测试中,GPT-6 Sol在max effort下取得68.8%,距Claude Fable 5的最高成绩69.9%仅差1.1个百分点,而单任务成本低约80%;GPT-6 Luna取得66.6%,接近Opus 5和Fable 5的medium effort,单任务成本分别低约93%和96%。

计算机操作能力方面,OpenAI表示Astra仍是其最强模型,但Sol和Luna能以更低成本完成任务。在OSWorld 2.0 offline测试中,GPT-6 Sol在xhigh effort下取得60.5%,与Claude Opus 5 medium effort的60.3%接近,单任务成本约低80%;GPT-6 Luna在max effort下超过GPT-5.6 Sol medium effort,成本约为后者的十分之一。

其他改进:

OpenAI还将GPT-6 Astra改进后的沟通风格带入Sol和Luna:在技术和编程对话中更清晰、术语更少、措辞更自然、低价值细节更少、回答更简短,同时不损失实质内容。针对开发者,官方改进了GPT-6的提示缓存,默认提供更高缓存命中率,帮助智能体重用更多上下文、实现更快响应。此外,两款模型在对齐评估中较GPT-5.6版本均有改进,包括编码工作中误导性声明发生率降低。

可用性方面:

GPT-6 Sol和GPT-6 Luna自今日起已在ch*tg*t Work和Codex中向所有Plus、Pro、Business、Enterprise和Edu用户开放;免费用户和Go用户可在桌面应用中使用GPT-6 Luna。这些模型目前尚未在Chat中提供。API中以gpt-6-sol和gpt-6-luna的形式提供。

 

如果您喜欢本站,点击这儿不花一分钱捐赠本站

这些信息可能会帮助到你: 下载帮助 | 报毒说明 | 进站必看

修改版本安卓软件,加群提示为修改者自留,非本站信息,注意鉴别

(0)
上一篇 1天前
下一篇 1天前

相关推荐

发表回复

评论问题之前,点击我,能帮你解决大部分问题

您的电子邮箱地址不会被公开。 必填项已用*标注