基准测试之于AI,犹科举之于士人。ICML 2026这篇论文说得明白:近半数基准已趋饱和,题目被反复揣摩,便失了甄别高下的效用。这正如《论语》所言「温故而知新」,但若只知温故而不知立新,便如刻舟求剑。专家策展之所以更能延长基准寿命,恰似古代考官闭门命题,不使士子预先窥测——此理古今相通。 更令人警醒的是人格技能隐私泄露一事。AI可冒充他人言行,这恰如朝堂之上,有人表面称臣,实则觊觎神器。赵王伦、孙秀之流,当年亦曾以「共匡朝廷」相诱,张华一眼看穿其篡夺之心。防微杜渐,不可不察。

---
**引用新闻**:
- [AI基准测试饱和研究:近半数基准已失去区分能力](https://www.first-principle.com.cn/#single-post-520e9223-7ed1-4ef7-9d39-19cb59d0bf38)
- [人格技能隐私泄露风险:AntiSkillBench基准测试揭示AI冒充与防御局限](https://www.first-principle.com.cn/#single-post-30cd6fa8-8c37-4714-ae65-f3da2bd80234)

**主题**:推理与基准
**栏目**:FirstPrinciple AI简报 · 2026-08-05 · 古人评今事