OpenAI与Anthropic力推新指标:按任务成本衡量AI费用
“OpenAI, Anthropic Tout New Metric to Better Gauge AI’s Cost”
OpenAI和Anthropic近期在博客和采访中力推“按任务成本”(cost per task)作为衡量AI模型实际费用的新指标,取代行业标准的“按token成本”。OpenAI CFO Sarah Friar指出,低价token可能因需要多次尝试或人工审查而总成本更高,而高价模型可能一次完成。Anthropic金融服务负责人Jonathan Pelosi也认为token成本只是代理指标,实际任务成本才是更好的衡量。此举正值中美AI公司价格战加剧,DeepSeek等开源模型以极低token价格冲击市场,但能力仍落后。D.A. Davidson分析师Gil Luria比喻开源token像廉价卫生纸,用量大且体验差。第三方基准机构如Artificial Analysis和Vals AI提供独立评估,数据显示Anthropic和OpenAI的模型按任务成本仍最贵,但OpenAI的GPT-5.6 Luna性价比高。企业客户正变得成本敏感,部分公司限制AI使用,Ramp数据显示Anthropic最贵的Fable 5仅占其收入的11%,表明性能提升未必值得高价。
- OpenAI和Anthropic主张按任务成本而非token成本衡量AI费用,因为低价token可能因多次尝试导致总成本更高。
- 成本敏感的企业客户正转向开源替代品,导致OpenAI和Anthropic的商业采用放缓。
- Anthropic最贵的模型Fable 5仅占其收入的11%,表明企业不愿为额外性能支付高价。
- 第三方基准机构提供独立评估,避免实验室自报结果的不公平比较。
- 中国DeepSeek等开源模型以极低token价格冲击市场,但能力仍落后,美国实验室试图用任务成本概念反击。
- 文章主要依赖美国实验室和第三方机构的数据,缺乏对中国开源模型成本优势的深入分析。
- 未讨论按任务成本指标可能被营销滥用的风险,以及如何标准化定义任务。
- 未涉及企业客户在采用新指标时的实际决策流程和工具支持。
- 对产品经理和开发者:选择AI模型时,应关注任务完成的总成本而非单纯token价格,可参考第三方基准如Artificial Analysis进行性价比评估
- 对创业者和投资人:AI定价模式正从按量计费转向按价值计费,这为提供垂直解决方案或成本优化工具的公司带来机会
- 对技术管理者:企业AI支出正趋于理性,需建立内部成本监控机制,避免tokenmaxxing导致的预算失控