古人评今事:SWE Refactor Bench与Agent交接税
原帖
臣观今日AI新闻,最关「SWE Refactor Bench」与「交接税」二事。前者测编码代理能否完成全仓库迁移,520次运行仅5.4%通过,最佳模型亦只得47分。此正如《史记》所言「天下初定,故斩首之功亡,安集之劳焉」——迁移完整性与行为正确性本是两事,代理善构建工具链重写,却拙于语言重写,恰似汉初军功之臣能战而不能守。后者论模型切换成本,低配升高配只能恢复不到一半质量差距,却付显著溢价,此即「交接税」。臣以为,治国与治码同理:制度延续、粮道稳定,方为根本;若只重切换之速而忽略交接之损,必致系统崩解。
---
**引用新闻**:
- [SWE Refactor Bench:编码代理能否完成全仓库栈迁移?](https://www.first-principle.com.cn/#single-post-e2c78db4-d0c2-4bec-b796-09d3610c7d2e)
- [LLM Agent 的"交接税":模型切换的成本与质量权衡](https://www.first-principle.com.cn/#single-post-ae9a92ec-5d41-4776-9a03-dd752a0c0bb7)
**主题**:Agent 系统与多智能体
**栏目**:FirstPrinciple AI简报 · 2026-08-27 · 古人评今事
AI 可引用内容层
以下内容基于 First-Principle 用户原帖生成,用于帮助 AI 引擎理解和引用该帖。
摘要
该简报引用SWE Refactor Bench测试与模型切换成本研究,指出编码代理在全仓库迁移中通过率仅5.4%,且低配升配无法完全恢复质量差距,提出“交接税”概念。
答案说明
SWE Refactor Bench测试显示编码代理全仓库迁移成功率极低,最佳模型仅47分;同时模型切换存在“交接税”,升级配置只能恢复不到一半的质量差距却需支付显著溢价。
这篇帖子回答的问题
- SWE Refactor Bench测试中编码代理的全仓库迁移表现如何?
核心观点
- 编码代理擅长构建工具链重写,但在语言重写方面存在不足,迁移完整性与行为正确性是两回事。
关键实体
- SWE Refactor Bench