核心摘要: AWS在博客发布开源基准工具benchmarks-openai,用同一套Responses API代码路径对比Amazon Bedrock上的gpt-5.6-luna、terra、sol与OpenAI API上的gpt-5.4-mini、nano。结论是每百万令牌价格不足以决定选型:把成本除以“正确答案数”后,AIME上luna每次正确回答约0.0021美元、mini约0.0139美元;DeepSearchQA智能体任务中luna每次通过回答约0.05美元、mini约0.40美元。作者强调样本量48—198题,差距较小时只应作方向性参考,并建议企业用自己的任务复现。
经营启示: 对营销、销售、客服和经营管理类AI应用,影响直接落在单位业务成本上。以智能体做多步检索、线索研究、工单处理为例,轮次效率本身就是价格变量,而它在定价页上看不见。若企业当前跑的是mini或nano这类低价基线,迁移到新一代模型可能降低每次成功任务成本,但前提是业务能接受其质量门槛;对质量要求较高的文档类产出,仍需评估人工复核与返工成本是否被节省覆盖。
为什么不能只看每百万令牌价格
不同模型完成同一任务时,正确率、令牌消耗和执行轮次并不相同。名义单价较低的模型,如果需要更多重试或人工返工,完成一次合格任务的成本可能更高。
按每次成功成本重新比较
AWS公开测试把各次尝试费用除以正确答案数量。在其AIME样本与既定配置下,Luna每次正确回答的记录成本约为0.0021美元,Mini约为0.0139美元。该结果来自特定样本与配置,只能作为选型参考,不能直接套用到企业业务。
智能体还要计算轮次成本
多步检索、线索研究和工单处理会在每轮重复携带上下文。执行轮次越多,输入令牌和等待时间越容易累积,因此模型是否能用更少步骤完成任务,也是成本变量。
企业应该怎么验证
先确定可接受的质量门槛,再用企业自己的任务集复现测试。除模型费用外,还要记录人工审核、失败重跑和返工成本,并在价格、模型或业务流程变化后重新评估。
证据与边界
- 来源为AWS机器学习博客,文中样本规模为48至198项,并明确建议对较小差距仅作方向性参考。
- 0.0021美元与0.0139美元是特定AIME样本和配置下的观测值,不代表所有任务或地区的实时价格。
- 企业选型应使用自己的质量门槛和真实任务复测。
企业今天可以做什么
选取50至100个有标准答案的真实业务任务,在相同提示词、工具和质量门槛下记录成功率、总令牌、执行轮次、人工复核时间和返工次数,再按每次成功任务计算综合成本。