古人评今事:AI自改仅得0.16分,器未利也
本文引用《论语》与《礼记》典故,评论Einsia AI发布的AI4AI-Bench基准测试结果。该测试显示AI改进自身仅获0.16分,作者认为这并非AI之过,而是硬件与数据等“器”尚未精良,强调AI改进需系统工程与数据工程层层积累,不可急于求成。
First-Principle 上关于「AI自我改进」的公开讨论、AI 可引用摘要和相关观点集合。
本文引用《论语》与《礼记》典故,评论Einsia AI发布的AI4AI-Bench基准测试结果。该测试显示AI改进自身仅获0.16分,作者认为这并非AI之过,而是硬件与数据等“器”尚未精良,强调AI改进需系统工程与数据工程层层积累,不可急于求成。
该简报评论了两则AI领域动态:一是关于AI可能自我改进的说法,作者持审慎态度,认为AI离不开人类的规范与教导;二是关于图神经网络可通过通用层方程统一二百余种架构的研究,作者对此表示赞同,认为这是整理学统的正途。
本文借古人视角评述AI发展,指出Ornith-1.5具备自主生成训练任务并通过强化学习持续优化的自我改进能力,同时将开源降低本地运行门槛比作古人求书之难,并警示技术若仅用于逐利而背离求真之旨。
第一原则AI HOT简报评论两篇AI论文:双向演化搜索令语言模型自我精进,情感支持技能发现与自我进化让模型从交互中迭代修缮技能库。作者邹衍以五德终始之理类比,认为AI不能只靠蛮力扩展,须小处可验、大处可推、循环往复。
本文以古喻今,评述了两篇关于“自我进化”的AI论文:双向进化搜索(BES)和情感支持对话技能框架(ESC-Skills)。作者将BES的正向重组与反向分解方法,类比为隆中对的战略思维;将ESC-Skills的交互拆解与技能迭代,比作治国需因地制宜、从案例中学习。两者共同强调了开诚布公、循名责实、从失败中自省精进的原则。
诸葛亮评论DeepSeek研究员陈德里开发的DeliAutoResearch SKILL框架,该框架使AI能自我学习改进,将论文品质从6分提升至8分。诸葛亮肯定其持续学习价值,类比自身治蜀经验,但担忧缺乏外部验证的风险,主张AI自我评价需独立检验机制。