Anthropic适配大模型迭代优化Claude Code及探索落地场景的实践
Anthropic
超过80%
Opus 5发布后Claude Code团队删除的系统提示词占比
30%
Opus 5在ARC-AGI-3测试集上的成绩
三年
Opus 5对齐研究的投入时长
11天
用大模型将Bun代码库从Zig重写成Rust的耗时
项目背景
大模型能力进入指数增长阶段,每代模型的特性、能力边界差异较大,传统软件开发的固定流程和设计思路无法适配大模型的快速迭代节奏,市面上的相关产品往往无法充分释放大模型的已有能力,存在较大的产品能力缺口。 本案例依据「InfoQ 中文」公开发布的信息整理,原文:https://www.infoq.cn/article/hUTEb0LSzFUTyib1AJ4W?utm_source=rss&utm_medium=article
面临的痛点
大模型迭代速度快,前代模型适配的系统提示词、工具配置、评测体系等内容在新一代模型上可能失效,甚至会阻碍模型能力的正常发挥;传统软件开发预先设计、固定架构的模式不适配大模型的特性,难以充分挖掘大模型的潜在能力。
优秘的方案
建立适配大模型迭代节奏的开发流程,每代新模型上线后先清空原有系统提示词等配置,通过消融实验逐行验证配置的实际价值后再重新添加;定期清理过时的技能、自定义配置、冗余工具和代码,仅保留安全、权限、静态分析、用户界面等必要代码;以实验思维探索模型能力边界,优先让模型实际运行任务,仅在模型反复出错时补充对应指令,避免提前添加过度约束限制模型能力发挥。
连续运行非常长的时间把任何代码库从一种语言重写成另一种语言
实施路径
1
每代新模型上线后先清空系统提示词,通过消融实验逐行验证配置价值后再逐步添加必要内容
2
每隔六个月清理CLAUDE.md、Skills和Hooks等用户自定义配置
3
定期下线过时工具,删除冗余代码,仅保留安全、权限、静态分析、用户界面类必要代码
4
优先让模型实际运行任务,仅当模型反复在同一件事上出错时补充对应指令,避免提前添加过度约束
5
持续迭代评测体系,当原有评测被模型做满后及时设计新的评测集
6
主动向模型分配超出预期难度的任务,挖掘模型潜在能力,填补产品能力缺口
落地成效
超过80%
Opus 5发布后Claude Code团队删除的系统提示词占比
30%
Opus 5在ARC-AGI-3测试集上的成绩
三年
Opus 5对齐研究的投入时长
11天
用大模型将Bun代码库从Zig重写成Rust的耗时
想成为下一个成功案例?
预约专属顾问,结合你的行业与规模,给出可落地的 AI 化方案