在数月的期待、静默测试和社区泄露之后,Anthropic 正式揭开了 Claude 5 系列的面纱,并推出了一个全新的能力层级,他们称之为“Mythos 级”。
这个层级位于此前最高端的“Opus”模型之上,此次发布包含同一底层架构的两个不同版本:Claude Fable 5 和 Claude Mythos 5。这也是 Anthropic 迄今在自主知识工作、企业级软件工程以及双重用途科学研究方面最激进的一次推进。
**双模型:Fable 5 与 Mythos 5**
Anthropic 构建了一个能力极强的基座模型,但也清楚完全不加限制地发布它会带来严重风险。为了在极强的能力与安全性之间取得平衡,他们采用了双轨部署:
- Claude Mythos 5(受限访问):这是原始、无限制的版本。由于它在漏洞发现、药物设计和生物防御筛查方面表现太过突出,访问权限被严格限制在 Anthropic 批准的机构内。目前该模型通过 Project Glasswing 项目,与美国政府和超过 150 家关键基础设施提供商合作,充当终极网络防御者的角色。
- Claude Fable 5(通用版本):这是面向所有人的安全版本,已通过 Claude API、Amazon Bedrock、Google Cloud Vertex AI 和 Microsoft Foundry 提供。它与 Mythos 5 共享完全相同的底层权重,但配备了一套严格的实时安全分类器。
后备机制:如果用户要求 Fable 5 执行高风险领域的任务(例如网络安全漏洞利用、生化武器合成或模型蒸馏),模型不会直接报错,而是会无缝且静默地将该请求转交给 Anthropic 的下一个最佳模型 Claude Opus 4.8 来生成安全回复。据 Anthropic 称,这种回退触发的情况不到 5% 的会话,也就是说,在超过 95% 的时间里,用户得到的都是纯粹的 Mythos 级智能。
**数据说话:基准测试表现突出**
如果说 Mythos 级模型在哪方面最让人眼前一亮,那一定是自主软件工程和长周期任务。Fable 5 能够在无需人工干预的情况下长时间自主运行。相比前代,量化指标的跃升相当可观:
- SWE-Bench Pro(智能体编程):这是一个评估模型在真实开源项目中解决 GitHub Issue 能力的基准,Pro 版本侧重于需要跨文件理解和多步修改的复杂任务。Fable 5 得分 80.3%。作为对比,Claude Opus 4.8 得分 69.2%,OpenAI 的 GPT-5.5 为 58.6%,Google 的 Gemini 3.1 Pro 为 54.2%。
- FrontierCode(钻石级测试):该测试集用于评估模型生成可直接用于生产环境的代码的能力,钻石级代表其中难度最高、对代码健壮性和边界处理要求最严苛的子集。Fable 5 得分为 29.3%,Opus 4.8 得分为 13.4%。
- Stripe 基准(真实世界效用):这不是公开跑分,而是 Stripe 内部用于测试模型处理企业级超大规模遗留代码库重构与迁移能力的实战项目。早期测试中,Stripe 用 Fable 5 对一个 5000 万行 Ruby 代码库进行整体迁移,原估计需人类工程师团队两个多月,该模型在一天内完成。
- 科学研究:模型的应用范围不限于代码。Anthropic 表示,在药物设计环节,该模型将原有流程速度提升了 10 倍;在测试中,它独立验证了一项科学假设,并构建了一个体积缩小 100 倍、但指标超过已发表学术标准的基因组学模型。
**定价与性价比:高昂价格是否值得?**
极强的智能对应着高昂的价格。Mythos 级的收费为每百万输入 token 10 美元,每百万输出 token 50 美元,定位非常高端。下面是 Fable 5 与 2026 年各旗舰模型的价格对比:
| 模型 | 提供商 | 输入价格(每百万 token) | 输出价格(每百万 token) | SWE-Bench Pro 得分 |
|---|---|---|---|---|
| Claude Fable 5 | Anthropic | $10.00 | $50.00 | 80.3% |
| Claude Opus 4.8 | Anthropic | $5.00 | $25.00 | 69.2% |
| Claude Sonnet 4.6 | Anthropic | $3.00 | $15.00 | 无(标准模型) |
| GPT-5.5 | OpenAI | $5.00 | $30.00 | 58.6% |
| GPT-5.5 Pro | OpenAI | $30.00 | $180.00 | 未公开 |
| Gemini 3.1 Pro | $2.00 | $12.00 | 54.2% |
性价比判断: 从数字上看,Fable 5 的价格恰好是 Claude Opus 4.8 的两倍,也比 Gemini 3.1 Pro 贵得多。不过,企业测试者和开发者普遍看重的是投资回报率(ROI)。
因为 Fable 5 有着很高的“一次做对”概率,开发者在迭代、调试和反复修改提示上消耗的 token 会少很多。如果你只是做基础 RAG 或总结 PDF,那继续用 Gemini 3.1 Pro 或 Claude Sonnet 4.6 就好。但如果你在部署自主智能体去做架构重构或数据库迁移,那 Fable 5 每百万输出 token 50 美元的成本,相比其替代的工程师人力工时,其实算便宜的。(值得一提的是,它依然比 OpenAI 顶配的 GPT-5.5 Pro 便宜不少。)
给 Claude 订阅用户的提醒: Fable 5 在 Claude Pro 和 Team 方案中可用,但消耗计入 2 倍使用量。
**开发者们怎么说?**
针对此次发布,开发者社区的讨论主要集中在以下几点:
1. “Fruitcake EAP” 提前泄露 官方发布前,开发者在 Reddit 相关子版块发现了名为 “Claude Fruitcake EAP” 的后端接口。起初有人猜测这是为骄傲月推出的创意模型,但很快被确认为针对长周期自主任务调优的实验版本,即 Mythos 公开版的内部代号。这次泄露在发布前推高了社区期待。
2. 安全过滤与静默回退引发的挫败感 Fable 5 专为复杂调试和代码库分析设计,但部分无害请求也会触发网络或生物安全分类器。触发后,系统要么中断生成(停止原因显示为“拒绝”),要么静默回退至 Opus 4.8 接管。这导致长时间自主任务中途降级或失败。社区认为当前过滤机制过于敏感,Anthropic 已承认系统调校偏保守,承诺将降低误判率。
3. API 成本控制难题 Fable 5 的高自主性使其能长时间运行并派生多个子智能体并行工作,其 token 消耗远超常规模型调用。有云架构师指出,传统云成本监控工具难以追踪此类 AI 工作负载,容易导致 API 费用超预期飙升。
4. 强制数据留存与隐私让渡 Anthropic 实施了严格的 30 天数据留存政策。由于 Mythos 级模型能力突出,所有 Fable 5 和 Mythos 5 的流量均需强制留存,即使通过 AWS Bedrock 等企业级网关也不例外。这意味着用户数据必须离开本地边界,交由 Anthropic 监控潜在滥用。结合美国政府使用受限的 Mythos 5 进行网络防御,而公众只能使用受过滤且被监控的 Fable 5,这表明基础 AI 模型正被作为国家安全资产对待。
想用上目前最聪明的模型,你的数据就得离开本地安全边界,交给 Anthropic 来监控可能出现的恶意滥用(比如生物武器合成)。各大主流媒体都把目光投向了模型的双重用途性质:美国政府用 Mythos 5 搞网络防御,而公众只能拿到经过重度过滤和严密监控的 Fable 5。这已经足够说明,我们正式迈入了将基础 AI 模型当作国家安全资产来对待的阶段。
随着 Fable 5 和 Mythos 5 的发布,Anthropic 并不是简单升级了一个大语言模型,而是为自主 AI 智能体在生产环境中能做成什么事,树立了新的范式。它很贵,也受到严密监控,安全护栏很严格——但不可否认,它就是目前这个星球上你能买到的最聪明的模型。Claude 5 的时代,正式到来了。

