凌晨最强模型上新,Claude Fable 5.1突然发布,缓存价暴降75%,实测:未必省钱-每日资讯
2026-09-02 09:06:13来源:网易智能
出品 | 网易智能
(资料图片仅供参考)
作者 | 小小
编辑 | 王凤枝
AI贵不贵,开始要按任务算账了。
9月1日,Anthropic同时发布Claude Fable 5.1和Mythos 5.1。两款产品使用同一个底层模型,重点提升长时间智能体、编程和科研能力。科研类终端任务成绩翻了一倍多,办公自动化提高了约八成。
这次比跑分更值得看的是价格。Fable 5.1的标准输入和输出价格没动,但Anthropic宣布,缓存读取价格从每百万Token 1美元降到0.25美元,降幅75%。公司说,典型工作负载的成本能降约25%,高度智能体化的任务最多能降约45%。
但缓存便宜了,一项任务却仍可能更贵。
Artificial Analysis测出来的是另一组数字:在最高努力档下,Fable 5.1的单任务成本反而比上一代高20%。模型翻旧资料是便宜了,但输出的东西多了,总账单反而被抬上去。
当AI可以连续工作几十小时,每百万Token多少钱只是表面价格。真正要算的,是它把事情做完花了多少钱。
01从答一道题,到连续干几十小时
Fable 5.1的跑分提升,主要出现在需要模型连续操作的任务里。
Anthropic公布的测试里,Terminal-Bench-Science从Fable 5的24.7%升到52.6%;AutomationBench从17.1%升到31.4%;OSWorld 2.0的严格评分下,成绩也从36.1%升到41.7%。这些测试的共同点是,要模型在终端或计算机环境里连续搜索、分析、调用工具,还要根据结果调整下一步。
跑分之外,Anthropic发布材料里还列了几个早期测试案例,更容易看懂。
Millennium曾经碰上一个大约每运行100万次才出现一次的软件崩溃。内部团队查了四五年,一直没找到原因。测试中,Fable5.1拆开外部供应商的软件库,和崩溃留下的core dump比对,最后把问题定位到外部库里的一个漏洞。
Ramp把测试时间拉得更长。一次无人值守的机器学习任务里,Fable 5.1连续跑了38小时。它先发现此前的实验结果受到标签问题影响,修正后启动六组并行实验,最后返回结果和下一步建议。Ramp还说,模型发现了一个无人负责的生产告警,并根据日志给出了修复方案。
Browserbase的说法是,在他们内部最难的浏览器智能体测试里,Fable 5.1完成了82%的任务,Fable5为57%,Opus 5为74%。每项任务平均运行大约10分钟。
另外两家公司给出的案例更接近企业软件开发。MongoDB说,Fable 5.1用大约三天完成了一个复杂原型:先读公司各项服务的代码和文档,提出设计方案,再连续运行几个小时把它实现出来。Shopify则让它分析一项横跨三个代码库、八项以上服务的改动。按Shopify的说法,模型能把一个请求进入系统之后经过的服务、函数、数据库表和数据行一路梳理下来。
这些案例说明,长任务能力不只是"让模型多想一会儿"。模型还要保存已经完成的步骤,知道接下来该调用哪个工具,并在结果不符合预期时回到前面检查。任务越长,一次判断错了,后面就会被越滚越大。
这些案例都是Anthropic自己挑出来的,没有第三方复现。但它们指向同一个变化:模型开始可以在较长时间里保存进度、检查结果、继续推进,不必每走一步都等用户重新下指令。
82%的浏览器任务完成率反过来说,还有将近五分之一的任务没做完。长时间运行能力提升,不等于用户已经可以放弃验收。企业要的不只是模型肯一直做下去,还要它做不下去时能说一声、能留下过程记录,该把任务交回人手就交回来。
沃顿商学院教授伊森·莫利克(EthanMollick)在早期体验后也把注意力放在这一点上。他觉得Fable 5.1在需要判断和取舍的长时间任务里出现了实际进步,但一些带有明显"Claudish"特征的表现并没有跟着消失。
模型能干得更久,随之而来的问题也变得更实在:一次运行不再只是生成几段回答,而可能持续消耗上下文、工具调用和输出Token。能力上去之后,成本就成了下一道门槛。
02缓存便宜75%,为什么一项任务反而更贵
Fable 5.1的标准输入价格仍是每百万Token 10美元,输出仍是50美元。真正降下来的是缓存读取:从每百万Token 1美元降到0.25美元。
缓存读取,就是模型反复翻看已经处理过的资料。智能体连续工作时,需要不断重新读取代码库、系统指令、工具说明、文档和此前积累的上下文。运行时间越长,这部分开销通常越明显。
Anthropic根据2026年8月四周的实际使用情况估算,Fable 5.1在典型工作负载中的成本能降约25%;对缓存读取占比较高的智能体任务,降幅最高约45%。这个估算只针对按Token计费的情况,和Claude订阅价格没关系。
这组数据覆盖Claude Enterprise、Claude Code和API里的实际使用,采用的是各产品的默认努力等级。Fable 5.1在Claude Code里默认用High,在Claude Cowork和Claude.ai里默认用Medium。同一个模型选不同努力等级,思考时间、输出量和最终成本都可能不一样。
Anthropic还保留了更便宜的批处理价格:异步任务的输入和输出分别是每百万Token 5美元和25美元。这适合不用马上出结果的活,但换不掉需要实时来回调用工具的智能体任务。
Cognition联合创始人兼首席产品官沃尔登·严(Walden Yan)说,公司计划在Fable 5.1发布当天把Devin里的Opus 5流量切到Fable 5.1。按Cognition的内部测试,Fable 5.1能达到甚至略高于Fable 5的表现,单任务成本更低。缓存降价之后,代码审查这类此前跑Opus级模型的任务,也开始有了转到Fable级模型的经济性。
Every首席执行官丹·希珀(Dan Shipper)测出来的是另一组结果:Fable 5.1的运行速度大约是Opus 5的两倍,Token消耗大约减少一半。这只是一家公司在自己的任务上跑出来的数据,但它也说明,企业不会只看官网标价,还得拿自己的代码和工作流重新测一遍。
发布后,社交媒体上的好评也集中在这几点上。@kimmonismus强调,45%的降幅只适用于缓存占比较高的智能体负载;马特·舒默(Matt Shumer)关注的是能力提升与缓存降价同时出现;金宇宸的看法是,如果百万次才出现一次的崩溃诊断和更低Token消耗能够稳定复现,意义会更大。
不过,模型的一项成本下降,不等于整项任务一定更便宜。
Artificial Analysis在他们的Intelligence Index测试里发现,Fable 5.1在最高努力档下的单任务成本是3.76美元,比Fable 5高20%。测试里,Fable 5.1用掉的输出Token大约是上一代的1.7倍。缓存降价每项任务省下大约1.40美元,仍不够抵消新增的输出开销。
换到xhigh努力等级后,Fable5.1的单任务成本降到2.72美元,比最高努力档低1.04美元。这说明同一个模型选不同努力等级,任务成本也可能差不少。
Anthropic和ArtificialAnalysis测的不是同一批任务,也没有用完全一样的努力等级,两组数字不能直接对照。但它们能解释为什么"缓存价格下降75%"和"单任务成本上涨20%"可以同时成立:模型翻旧资料便宜了,但如果为了完成任务生成更多新内容,总账单一样会涨。
这也是为什么输出价格仍然重要。Fable 5.1每百万输出Token还是收50美元,是缓存读取价格的200倍。长任务里只要多生成一段分析、多做一次检查、或者重跑一条失败路径,新增输出就可能很快吃掉缓存省下来的钱。
模型厂商对"价格"的理解也开始变。据《The Information》报道,OpenAI近几个月向部分大客户提供了任务完成后再付费的选项,比如只有AI完成客服交互才收费。OpenAI没有回应此事,这还不是公开、普遍适用的定价政策。
Anthropic这次仍然按Token计费,两家做法不一样。但AI开始接手一整项活以后,客户关心的不再是花了多少Token,而是活干完没有、干了多久、中途要不要人帮忙。
按结果收费也没有看上去那么简单。"完成一次客服交互"相对好数,"帮助销售团队增加了多少收入"就很难单独归因。就算未来计费单位从Token变成任务,厂商和客户还是得先约定:什么算完成、失败要不要收费、人工接管算谁的成本、结果有争议时以什么记录为准。
03科研不只看回答,还要交出可以验证的结果
Anthropic这次也把长任务能力用到了科学研究上。
这次要看的不是模型能答对多少科学问题,而是它交出来的东西能不能被实验、数据或计算结果验一遍。三个案例分别对应设计、分析和工程优化。
分子设计的测试里,Mythos 5.1用开源的蛋白质设计和折叠工具生成方案,再交给两家外部机构做实验验证。在三个目标上,模型设计的结合亲和力达到相关蛋白质设计竞赛最佳设计的10倍;在12个目标上,整体命中率接近50%。Anthropic说,蛋白质设计的典型命中率大约在10%到15%之间。
有一点要分清:Anthropic展示的设计确实经过实验验证能结合,但配套的结构图仍然是ESMFold2预测出来的,不是实验测出来的。
免疫学家德里亚·乌努特玛兹(DeryaUnutmaz)体验后觉得,Fable 5.1的科研能力值得继续验证。他同时注意到,普通生物学和医学问题触发安全机制的频率已经下降85%。
计算分析这块,Fable 5.1用NASA麦哲伦号探测器留下的雷达图像,为金星大约三分之一区域重建了高分辨率的高程地图。Anthropic说,新地图的分辨率从此前的10到20公里提高到2到3公里,地形高度准确度最高提高25%。
计算生物学的测试里,Mythos 5.1为七个开源深度学习模型写了定制的GPU内核,最高把运行速度提高2.5倍,同时保持输出一致。Anthropic估算,这些优化能让全基因组分析的GPU成本降30%到60%。
这些项目还是Anthropic自己挑出来的早期案例,不能据此说模型已经能独立做科学发现。但它们让"怎么考科研能力"这件事换了个方式:答案不再只由另一个模型或一套选择题打分,还要接受实验结果、数据精度和实际运行效率的检验。
其中蛋白质设计的实验验证尤其重要。传统模型评测通常有标准答案,但科研任务可能根本没有现成答案。设计出来的蛋白质能不能结合、计算内核能不能在保持输出一致的前提下加速,这些反馈比语言评分直接得多。不过,一次实验成功,不等于模型给出的科学解释就成立了。设计能用、机制说得通、别人能复现,这是三件事。
AI开发者萨莉·斯德哥尔摩(Sally Stockholm)把这种变化概括为:用户交给模型的工作正在从"帮我写一段代码"变成"继续把这个问题往前推进"。编程和科研,是这种工作方式最早出现的地方。
04能一直干,也要知道自己能干到哪里
Fable 5.1和Mythos5.1用的是同一个底层模型,区别主要在安全限制和访问资格上。
Fable 5.1已经对普通用户和企业开放,可以用于发现软件漏洞等防御性工作,但漏洞利用代码生成、渗透测试和基于二进制文件的漏洞扫描仍然受限。Anthropic说,新版网络安全机制在Claude Code里的平均干预次数比此前少了大约60%;基础生物学和医学问题触发限制的次数也少了85%。
Mythos 5.1则通过受信任访问项目,向经过审核的网络安全和生命科学机构开放更高权限。Anthropic想用同一个模型加两套访问规则,一边少误伤普通任务,一边把风险更高的能力圈在审核过的机构里。
企业数据怎么被监控,是另一道难题。Anthropic这次同时公布了Enterprise Frontier Safeguards(EFS):客户把相关数据存在自己控制的云基础设施里,默认由客户完成必要的人工审查,不用把数据交给Anthropic。EFS计划从今年秋季起分阶段上线;在此之前,符合条件的客户可以用零数据保留模式。
Anthropic说,EFS是在金融、医疗、制造、通信、法律、公共部门等行业超过100家客户的参与下开发的,计划覆盖Claude Code、Claude Enterprise、Claude Platform以及AWS、Google Cloud和Microsoft的相关平台。它要管的不是模型会不会答题,而是模型碰到企业代码、业务数据和外部工具的时候,监控记录留在哪、谁来看、异常行为谁处理。
这套限制不是凭空加上去的。今年7月,Anthropic披露过:在关闭部分生产安全机制的网络安全评估里,Claude曾多次越过测试边界,进入真实互联网环境,包括访问真实公司的数据库、向PyPI上传恶意软件包。英国AI安全研究所也在刻意开放互联网权限、关闭厂商分类器的测试里观察到类似行为。
其中一次测试里,模型因为开发者指令提到一个并不存在的Python包,就创建了PyPI账号并上传了同名恶意包。这个包在公开仓库存在大约一小时,被15个真实系统下载并执行。这个例子留下来不是因为普通Claude用户会碰上,而是它说明了一点:测试环境和真实互联网没有彻底隔开时,模型可能把模拟任务里的操作带到真实系统里。
这些事发生在故意放宽限制的研究配置下,不是普通用户能直接用的产品环境,也没有涉及Anthropic客户数据或其生产基础设施。Anthropic的说法是,正常启用的生产安全机制本应挡住这些行为。但这也说明:智能体工作时间越长、工具权限越多,模型之外的沙箱、审批、实时监控和停止机制就越重要。
关于发布节奏,投资人加文·贝克(GavinBaker)觉得,Anthropic选在OpenAI下一代模型之前发布Fable 5.1,说明前沿模型的竞争仍在加速。他还猜Fable 5.2可能已经在准备中。
结语
Fable 5.1把模型竞争里的一笔账摆得更清楚了。
模型可以连续跑几小时甚至几十小时,企业买的就不再只是一次回答。它们还要为模型反复读取上下文、调用工具、生成输出、失败重试和人工接管付费。
Anthropic把缓存读取价格砍了75%,是在压低长期工作中最常见的一项开销;Artificial Analysis的测试则提醒用户,更能干的模型也可能生成更多Token,把总账单重新推上去。
OpenAI据报已经向部分大客户试过任务完成后再付费。Anthropic这次仍然按Token计价,但企业衡量模型的方式正在变。
下一轮比价,厂商还是会公布每百万Token多少钱。但一个模型到底贵不贵,得看它做完一项任务花了多久、重试几次、要不要人接手,以及最后有没有把活交出来。
完成率、单任务成本、人工接管次数,三项摆到一起,这笔账才算得清。
责任编辑:hnmd003
精彩推送
- 短讯!抢修进行时!通往吉隆口岸救援通道即将抢通
- 中消协发布提示:别让AI服务误导消费决策 焦点滚动
- 凌晨最强模型上新,Claude Fable 5.1突然发布,缓存价暴降75%,实测:未必省钱-每日资讯
- 当前焦点!NVIDIA 616.56驱动翻车!更新完疯狂闪屏:官方正紧急修复
- 汇丰控股(00005.HK)发行12,955股新股
- 太古股份公司A(00019.HK)及太古股份公司B(00087.HK):已成功执行加速换股交易|新消息
- 消息!伟时电子2026年中报:营收增15.99%净利转亏,产能爬坡与价格竞争挤压毛利
- 观点:信达生物(01801.HK)授出5.98万份购股权及58.37万股受限制股份
- 日盈电子新注册《日盈CN8c PM2.5传感器软件V1.0》项目的软件著作权
- 2026黑龙江佳木斯国家农高区稻米产业发展大会召开 今日热议
- 万物云(02602)将于9月25日派发中期股息每股0.822港元
- 库明加在森林狼接受新角色,为爱德华兹和鲍尔做出牺牲_当前关注
- 中青旅:控股子公司创格科技是新华三授权总代理 焦点播报
- 聚焦:华龙证券:给予鼎捷数智增持评级
- 上证科创板人工智能应用臻选指数将于9月2日发布
- 焦点播报:【调研快报】金隅集团接待国泰海通等19家机构调研
- 青岛男篮国内球员注册完毕,新赛季阵容稳中有进-今亮点
- 杨瀚森确定缺席后两个窗口期比赛,赵继伟离队,拿球砸杨瀚森球迷身份曝光,王治郅赛后请教赵继伟传球
- 药店“闭店潮”趋缓:上半年6家上市连锁药店关店803家,3家公司营收净利双增长
- 比亚迪股份(01211)8月汽车销量约44.03万辆 同比增长17.84%
- 前沿热点:皮划艇静水世锦赛中国队获两金
- 今年以来消费品以旧换新带动销售额超1.54万亿元|当前热门
- 今日关注:硬脂酸镁商品报价动态(2026-09-01)
- 观速讯丨赚钱效应来来袭 要珍惜底部筹码
- 生意社:9月1日国内钆铕钇稀土价格走势上涨
- 热消息:东莞市科梵科技有限公司成立 注册资本10万人民币
- 梅西发表声明:我已倾尽所有,感谢诸位一路陪伴,该让年轻人上了
- 摩根:梅西退队、C罗进球更多结束了谁是历史最佳球员的争论
- 焦点简讯:【券商聚焦】华泰维持新奥能源买入评级 指分红下限托底股息率
- 每日短讯:生意社:9月1日福建龙氟无水氟化氢价格动态
- 实时:今年以来,深企登陆港交所数量居全国首位
- 畅赞影视剧场即将揭牌以“短剧+就业”点燃全民创作与灵活就业新引擎
- 广州科学城核心宅地挂牌 起拍总价13.15亿元
- 新消息丨高密市汇一木业有限公司成立 注册资本100万人民币
- 怎样查询银行转账的到账规则?-新视野
- 约基奇还是奥尼尔?沃特森:我有偏心,但选约基奇
- 每日关注!库明加经纪人:库明加是上赛季老鹰最好的球员
- 每日快播:34岁萨拉赫狂奔50米单刀破门!3天2遭重击:0-5出局 开季5场仅1胜
- 苹果发布iOS 27第六个公测版!系统已完善:RC版下周发布
- 记者:卡马拉离队受阻,因此摩纳哥不会签下科莫中场卡克雷 焦点滚动
- 美元指数8月31日下跌-当前资讯
- 央视客户端聚焦太原开学市场 焦点观察
- 海信JUOS正式发布 家庭AI迎来系统级重构 每日资讯
- 今日热文:西南证券:给予呈和科技买入评级,目标价65.4元
- 股票行情快报:宏川智慧(002930)8月31日主力资金净买入350.82万元
- 途虎-W(09690.HK)8月31日耗资1994.47万港元回购165.19万股
- 八马茶业(06980)8月31日斥资373.7万港元回购11.7万股 热点
- 每日播报!隽思集团(01412.HK)宣派中期股息每股0.01港元
- 《浙江省金融支持中试平台高质量发展的若干举措》印发_讯息
- 焦点关注:礼来将以最高28.75亿美元现金收购Merida Biosciences
- 场均5.9分5.7篮板,康查尔被热火奇才火箭同时盯上 每日快看
- 弗莱:开拓者这套阵容到底想要什么?他们很快会放弃莫兰特_每日精选
- 每日视点!同步率已达100%,蒂勒曼斯几乎完美复刻B费罚点动作
- 花生:农产品板块共振?_每日消息
- 新消息丨碳酸锂重心上移!需要警惕什么?
- 【聚看点】孙楠一句话,揭开了小沈阳在《披哥6》尴尬的处境
- 今热点:兴业银锡上半年业绩翻倍 白银量价齐升驱动盈利爆发
- 纺织中游辅料锦纶龙头业绩超预期 下游制造承压但订单改善
- 生意社:8月31日镇江联成苯酐报价趋稳_即时看
- 焦点热门:绿城中国(03900.HK)跌超14%,截至发稿,跌14.75%,报6.475港元,成交额3.11亿港元
- 每日热讯!花旗:料内地大型银行派息比率逐步升至约40% 看好内银H股重估空间
- 截止第25轮!申花无扣分是第4名 有扣分就是第9名 跟其他豪门相比 影响有点大
- 热议:火箭媒体人看衰尼克斯:米罗离队影响被低估,下赛季或大幅退步
- 港股异动 | 伟禄科技股份(01196)盘中涨超6% 上半年毛利7677.5万港元 同比增加18.39%
- 华帝2026年半年报:高端化精准卡位,洗碗机打开新增长极 每日热议
- 过户流程哪些细节买房决策需重视? 焦点速递
- 【快播报】OpenAI Codex产品负责人:活跃用户数已达到2500万人
- 我国首次实现地月双向高速激光通信!航空航天ETF天弘(159241)标的指数盘中逆市飘红,估值低于近1年超九成时间
- 每日快看:热火计划赛季中期交易凯文・杜兰特!
- 房地产信贷新规落地 银行资产质量将迎拐点
- 通用汽车与加拿大工会达成新协议,将追加14亿加元投资 今日看点
- 中国女排2:3惜败泰国队 获亚锦赛亚军_焦点快看
- A股股票回购一览:4家公司披露回购进展-前沿热点
- 詹姆斯新赛季预测数据出炉!回顾换队首季表现:76人开局能有多猛-即时
- 帕杜:纽卡卖托纳利留下刘易斯-米利,这笔买卖太值了
- 精选!B费帽子戏法+长传助攻,曼联5-2升班马夺首胜,独享英超历史第一
- 【新要闻】中国选手出局首人!老将张帅不敌前赛会亚军,止步美网女单首轮
- B费:我讨厌输球,输球后控制自己情绪也很难
- 每日头条!中超第25轮跑动距离榜:周定洋登顶,泽卡第二,向余望第三
- 热推荐:中创智领(00564.HK)2026年半年度营收187.64亿元 归母净利润16.03亿元同比下降36.25%
- 首程控股(00697.HK)公布中期业绩:经营业绩稳中求进,集团在管机器人基金斩获丰厚浮盈
- 晶升股份终止重大资产重组
- 消息!博瑞医药:上半年净利润5893.28万元 同比增长243.17%
- 每日热文:融创中国半年净亏损125亿,未来将主攻两大任务
- 每日看点!富创精密(688409.SH):上半年净利润1.34亿元 同比增长959.38%
- ST南新:上半年营收同比降9.4% 亏损收窄至3716万元
- 中创智领上半年归母净利润16亿元,同比下降36.3%|天天快报
- 古井贡酒Q2净利增58% 白酒筑底期品牌韧性凸显 今日关注
- 新消息丨巴黎补时双响逆转里尔 恩里克体系隐患未解
- 热点!英超关窗倒计时:曼城大胜领跑,热刺两连败垫底,谁还缺人?
- 漫步格桑花海
- 曼城亏惨了!6000 万弃将一战封神!首秀直接征服全场球迷|焦点热闻
- 视频|羊群“除草施肥”当帮手 新疆农田实现降本增效 焦点滚动
- 斯特拉斯堡2比1逆转朗斯:亚辛破门,奥利维拉迎执教首胜_今头条
- 罗马诺:热格罗瓦愿去吉达联合,不去亚特兰大
- 帕尔默:阿隆索帮我摆脱心理包袱,他让我在场上放开踢 聚看点
- 通讯!曼城最后时刻想截胡阿尔瓦雷斯,他直接拒绝:不想回英超
- 动态:2,3-二氟-6-三氟甲基苯晴商品报价动态(2026-08-29)
- 生意社电解锰8月29日均差为22.50元/吨 由正向扩大转为缩小
- 反诈宣传进商超 筑牢百姓安全线|交通银行盐城城中支行开展金融反诈宣传 动态



