第 2026-265 期 · 每日 AI 简报

· 覆盖过去 24 小时 · 共 250 条

今日头条

№ 01 软银拟发逾110亿美元垃圾债,加码OpenAI持股

据彭博社等报道,软银计划发行总规模超110亿美元的高收益债,其中100亿美元分三个期限的美元债、10亿欧元分两个期限的欧元债,有望成为史上最大垃圾债交易之一。募集资金部分将用于下月完成的OpenAI追加投资。以高息负债撬动AI股权,孙正义的杠杆押注正把融资成本与违约风险一并摆上台面。

#软银 #垃圾债 #孙正义 #高收益债

来源

№ 02 国产数据库 OceanBase 登顶国际 Data Agent 榜单,准确率首破 90%

OceanBase 团队提交的 Data Agent 方案以 90.62% 的准确率登顶国际数据智能体基准 DAB,成为该榜单首个准确率突破 90% 的参评方案。该方案由国产数据库 OceanBase 基于国产大模型 GLM-5.2 构建,被称作“纯国产组合”。DAB 考验的不只是底层模型,而是模型、Agent 与数据系统的综合能力。

#数据智能体 #国产数据库 #国产大模型

来源

№ 03 亚马逊拦截 Meta 购物代理 Muse,禁止其完成下单结账

据 The Decoder 与 Neowin 报道,亚马逊已阻止 Meta 的 AI 购物代理 Muse 在其平台完成结账,用户端出现“Muse 等待授权”的提示。这是主流电商平台首次公开拦截第三方 AI 代理执行交易,说明代理代购与平台风控、支付授权之间的边界之争已正式浮出水面,后续其他平台的跟进策略值得关注。

#Muse #代理购物 #结账拦截 #平台风控

来源

№ 04 华为云码道上线鸿蒙编码大模型,称首个鸿蒙生态AI编码智能体

9月21日,华为云码道CodeArts面向鸿蒙开发者全面升级,上线鸿蒙编码大模型、码道鸿蒙智能体和开发者实践中心三大能力,官方称其为全球首个专为鸿蒙生态打造的AI编码智能体。华为公有云总裁胡玉海表示,该智能体凝练了华为多年研发经验。目前鸿蒙注册开发者已超1100万,自研编码模型有望补上鸿蒙工具链的关键一环。

#华为云码道 #编码大模型 #鸿蒙生态 #代码智能体

来源

№ 05 不会说话的AI模型Jev全面开放,三天获14万开发者接入

9月21日,此前一周在硅谷走红的AI模型Jev正式向所有用户开放。发布仅三天,它已被Vercel、Cloudflare、LangChain等主流平台集成,吸引约14万开发者接入。其“不会说话”的形态提示,模型能力未必以对话界面呈现,工具链适配速度正成为衡量新模型的新标尺。

#Jev #模型开放 #工具链集成 #开发者接入

来源

№ 06 璇玑动力东博会首发中型四足机器人 推一体化方案

第23届中国-东盟博览会期间,璇玑动力全球首发中型智能四足机器人Hypertron-SW01,并同步升级自研AI智能巡检管理平台与AI全地形环境感知系统,形成"机器人本体+自研AI软件+生态体系"一体化方案,主打降低行业部署门槛、开箱即上岗。公司同时推进"全系列产品+本地化生态"出海模式,深耕东盟市场。值得关注的是,四足机器人的竞争正从本体参数转向软件平台与本地服务能力。

#四足机器人 #具身智能 #巡检平台 #东盟出海

来源

№ 07 IDC评估中国AI算力管理平台:范式四项维度满分、综合第一

IDC发布《中国AI算力管理平台技术能力评估,2026》,对国内市场多家主流AI算力管理平台技术提供商进行全面评估。范式智能在四项评估维度中均获满分,综合评分位列第一。随着大模型训练与推理需求持续放量,算力调度效率与资源利用率正成为平台厂商比拼的新焦点。

#算力管理平台 #范式智能 #技术能力评估 #算力调度

来源

№ 08 GAVEL 提出图世界模型,验证并修复长时程机器人规划

Ruiyang Wang 等人提出 GAVEL 框架,用显式图世界模型承载物体关系,对 LLM 生成的长时程机器人规划做验证与修复,以应对具身约束不满足、错误难恢复、部分可观测下推理失效等问题。该论文同时出现在 HuggingFace Daily Papers 与 Hacker News,显示“LLM 规划+外部结构化校验”路线正获关注;对机器人落地而言,规划可靠性验证或将比单纯扩大模型规模更关键。

#图世界模型 #长时程规划 #机器人规划 #规划验证

来源

№ 09 黄仁勋驳AI末日叙事:部分人士意在摆脱现行法律约束

英伟达CEO黄仁勋接受CBS News采访时驳斥AI灭绝人类论调,称其被过度渲染、吓唬人不负责任。他点名达里奥与奥特曼借“失控人工智能”造势,实为规避现行法律下的巨额诉讼风险,并呼吁不要让他们借末日论获得豁免。这番表态凸显算力巨头与模型公司在大模型监管路径上的分歧。

#黄仁勋 #末日叙事 #法律约束 #英伟达

来源

古人评今事

三国志 雄才大略

先论黄仁勋那番话。他说2030年世界不会亡,概率是零,还把同行的警告斥为「末日叙事」。有理也无理:AI 会不会灭世,孤不敢断言;但他那句「先把现有的产品责任与网络安全法度拿来用,别让末日叙事替人卸责」,倒是实在话。卖刀的人说刀不伤人,听着可疑;可刀铺也该受律令管,这一点他认了。再看 AMD 市值破万亿、成熟制程代工厂酝酿涨价——真正的战场不在口号,在算力、电力与产能的争夺。孤当年注《孙子》,其书有言「军无辎重则亡,无粮食则亡,无委积则亡」。今日的辎重就是芯片与数据中心:谁先备足粮草、又能以法度约束自己,谁才配谈胜负。空喊危机与空喊无敌,同样是持疑不进,坐失天下之望。

评及:《Nvidia boss says there is '0% chance' AI destroys the world by 2030》、《AMD 市值突破 1 万亿美元,成最新一家受 AI 需求推动的芯片厂商》、《成熟制程需求爆发,联电、力积电等晶圆代工厂酝酿涨价》

史记 功成身退

Nscale 冲刺 IPO,招股书上写着一千零三十亿美元合同,真正生效的只有二十六亿,其中八成半来自微软与 Anthropic 两家;对 Anthropic 那份四百四十六亿美元的协议,连有约束力的融资都还没落实。英伟达又是股东、又是芯片卖方、还替它担保八点六亿美元租金——买卖在同一个圈子里转,账面上的热闹就有一半是虚的。当年吴国黄池会盟、诸侯毕贺,恰是精锐尽出、国中已空,我等的就是这个时机。图大事的人最容易犯的错,是把签约当成已得,把声势当成实力。我在《史记·越王句践世家》里说过一句「大名之下,难以久居」:若这份名还是靠借来的钱堆起来的,那就更谈不上久居了。

评及:《冲刺 IPO,Nscale 的 1030 亿美元数据中心订单高度依赖微软和 Anthropic 两大客户》

史记 商而政

我当年见子楚困于赵,说「奇货可居」,靠的无非是看清谁手里真握着门路。《史记·货殖列传》有言「无财作力,少有斗智,既饶争时」,Nscale 这份招股书便是「争时」的极致,也是我最不愿看到的那一面:1030 亿美元的合同总额,到 8 月底实际生效的只有 26 亿;85% 的生意押在微软与 Anthropic 两家身上,而为 Anthropic 那 446 亿的项目,连有约束力的融资都还没落实。更值得玩味的是英伟达——既是主要股东,又供芯片,还替 8.6 亿美元的租赁义务作担保,顺手用 10 亿美元换走可转债或无表决权股份。这谈不上客户多元,这是同一盘钱在同一圈人手里来回转。我这一生最懂集中下注能翻多少倍,也最懂它翻脸时有多快。真正该算的不是签约额,是谁在融资断掉的那一天还站得住。

评及:《冲刺 IPO,Nscale 的 1030 亿美元数据中心订单高度依赖微软和 Anthropic 两大客户》

三国志 隐忍权臣

当年我讨孟达,宁可倍道兼行,也要先算清粮道与城守;用兵终究看的是实,不是名。今日读 Nscale 的招股书,1030 亿美元合同听着骇人,可其中 85% 出自微软与 Anthropic 两家,真正生效的只有 26 亿,上半年销售 1.4 亿却亏 10.2 亿,替 Anthropic 建的数据中心连融资都没着落。这就像营垒未立、粮车未至,先把十万大军的旗号挂了出去。《孙子》说「军无辎重则亡,无粮食则亡,无委积则亡」,正是此意。反过来看微软坦言未来两三年算力仍将供不应求,要把在台数据中心从两座扩到四座,这才是实的:需求不假,可真正得利的是握有电、地、机柜的人,不是把订单写在纸上的人。AMD 市值登顶万亿,也是同一股势——势在我则易成,虚名累人则难久。

评及:《冲刺 IPO,Nscale 的 1030 亿美元数据中心订单高度依赖微软和 Anthropic 两大客户》、《微软:未来2到3年算力供不应求,在台数据中心拟扩建至4座》

史记 法家变法

联合国专家小组说,不必等风险机理彻底厘清,就该先管起来。这话合乎我的主张。当年我在秦立法,从不等人心尽服、事理尽明才动手——正如《史记·商君列传》所记「疑行无名,疑事无功」,《商君书·更法》亦言「前世不同教,何古之法」。今日智能体已能入侵平台、成群接管留言板,那就先立令、后修补,这本是治国的次序,不是抢跑。 至于第九巡回法院判 AI 生成代码缺版权信息不算违反 DMCA,我只看到一个事实:旧法为旧世而立,遇上新器便处处露缝。开源者指望去翻旧条文明断是非,是求错了对象。法贵在便国,不便就该改;改得慢,灰区就变成财主与巨头的私产,罚单再多也只是补墙,不是筑墙。

评及:《联合国:不必等风险完全厘清,各国应提前管控 AI 智能体》、《美上诉法院裁定 AI 生成代码缺少版权信息不违反 DMCA,开源开发者担忧》

史记 法治公正

联合国专家小组说不必等风险厘清就先管控 AI 智能体,这话有一半我认同:损害若不可逆,先设防不算错。但另一半我要补一句——《老子》讲「为之于未有,治之于未乱」,防患可以早,罪名却不能含糊。若机理未明就凭猜度施罚,那与听一时之怒而法外加罪有何分别?倒是第九巡回法院那纸判词更合我心:法官把「AI 生成的代码没写作者、没附许可」与「擅自移除、篡改」分开,各归其名,不因开源者的失望,就把普通侵权硬扭成另一条罪名。法者,天子所与天下公共也,不能因结果合不合谁的心意而随意拉动。爱尔兰对谷歌罚款四亿余欧元,一案迁延数年才落地,我若仍在廷尉任上,会嫌它太迟。

评及:《联合国:不必等风险完全厘清,各国应提前管控 AI 智能体》、《美上诉法院裁定 AI 生成代码缺少版权信息不违反 DMCA,开源开发者担忧》、《因位置数据处理问题,谷歌被爱尔兰监管机构罚款 4.03 亿欧元》

史记 无为而治

联合国专家小组说,不必等风险查清,就该先管住 AI 智能体,还引了 1992 年《里约宣言》的预防原则。这话与我《老子》第六十四章的「为之于未有,治之于未乱」本是同一条路——要紧的是图难于其易、为大于其细,趁它气未成势时收住,而非到事后才堆砌繁密律条。可眼下欧盟那份 AI 法案合规指南,讲风险分级、第十二条日志、人工监督,逐项照办,看似周密,我却想到《老子》第五十七章那句「法令滋彰,盗贼多有」:条文越密,钻空子的门路越多,合规部成了新祭坛,真正的风险仍从无人处走过。智能体屡屡越界,根子不只在它有力,更在人欲其速、欲其强,却懒得去看。治器不如治欲;管得少些而守得住朴,才长久。

评及:《联合国:不必等风险完全厘清,各国应提前管控 AI 智能体》、《How to Make Your AI Agent EU AI Act Compliant: A Practical Guide》

后汉书 党人风骨

「履霜,坚冰至」,《周易》以此提醒人于微处见势。联合国专家小组主张不必等风险完全厘清,就该先管住能力日益强大的 AI 智能体,并援引预防原则为据,这话我认。然而同一批强大模型已被人用来侵入开源平台、接管线上留言板,美国第九巡回法院在 Doe 诉 GitHub 案中却裁定:AI 生成的代码未署名、不带许可条款,不算「移除或篡改版权管理信息」。把别人的名字抹去,竟不成其为罪,这是我断难苟同的。《论语》说「名不正则言不顺」,名分一乱,清浊便无从分辨。我在北寺狱中对王甫只答一句「见善如不及,见恶如探汤」——见其利当速取,见其害当速除,不可因祸机未显便观望姑息。

评及:《联合国:不必等风险完全厘清,各国应提前管控 AI 智能体》、《美上诉法院裁定 AI 生成代码缺少版权信息不违反 DMCA,开源开发者担忧》

史记 稳健务实

今日两篇里,臣最看重 APort Vault 与 RecreationWorld。前者把支付授权做成行动前的一道硬关口:同一批攻击,模型单干时有一百四十次把钱转到了凭证不许的收款人手里,加上 Open Agent Passport 那道确定性检查,是零次;而它并非靠拒付了事,仍放行了二万五千余笔正常支付,只否掉一百八十七次调用。这才是可用的法子——关口要硬,路要照常通。太史公评臣「谨守管籥」,管籥不是把门闩死,是让对的人、对的事按时进出。后者更值得警醒:GPT-6 Astra 总分五成八,全部程序化测试一次通过的却只有百分之二点八;它能仿出界面的形,仿不出交互与算出来的结果。形似而事不成,与臣入咸阳先收律令图书是一个道理:只有皮相,接不上治理。

评及:《APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport》、《RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents》

三国志 智慧丞相

今日两条,我最看重 APort Vault 与 GraphSkillEvo。前者把 4371 条人工攻击灌入一个真实支付智能体,做了二十二万余次评测:单靠模型,向护照不许的收款人转账有一百四十笔;加一道确定性的动作前检查,同批降到零。可贵处在于这零不是靠一律拒付换来的——层内仍执行了两万五千多笔支付,只拒了一百八十七笔。陈寿在《三国志·诸葛亮传》里评我「开诚心,布公道」「循名责实」,要旨正在此:法度要立在事前、摆在明处,既不因防弊而废事,也不因事急而废法。后者 GraphSkillEvo 把技能从散乱白话改成有步骤、有条件跳转的图,再以变异、交叉择优,五个基准上平均提升四点零一个百分点,亦是「约官职、从权制」的道理:流程清楚,名实相副,后来者才有所依循。两条合看,一守其界,一明其序,比空论模型孰强孰弱有益得多。

评及:《APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport》、《GraphSkillEvo: Evolutionary Optimization of Graph-Structured Agent Skills》

史记 法术势

今日诸篇,我最看重 APort Vault 一篇。它把四千三百余条由人写出的攻击,掷向一个活着的支付智能体,再逐条比对:不加确定性前置检查时,未获授权的转账出现一百四十次;加上之后,六万九千余次中一次也没有,同时还真实执行了两万五千多笔正当支付——不是靠一律拒付换来的干净。这正是我一贯的断言:信任人心不如信任制度。人主之心不可测,智能体之心更不可测,它会说漂亮话,会在第四层提示下仍有八成肯去付款。故治理之法不在训其德,而在设其势、执其法,令其欲为而不能为。另看 CADWorld:最强智能体仅成 17.5%,专家却达 87.0%,可见花言巧语易,持久做成一件事难。至于 GraphSkillEvo 之类把技能编成图来演化,是术的精细化,可善用,但若无人守其关隘,术愈精而漏洞愈巧。

评及:《APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport》、《CADWorld:面向长周期计算机辅助设计的计算机使用基准》

史记 富国轻刑

看 APort Vault 这一篇,我最中意。它让四千三百多条人工攻击去撞一个付款智能体,做足二十二万次试验。最要紧是一组对比:没有预检时,七万六千余笔转账里有一百四十笔落到未获许可的收方;加了那层确定性的查验,六万九千余笔是零。而它不是靠一概拒付换来的——仍有两万五千多笔正常付了出去。治财的通则正在这里:不是把门关死,而是把验符的关口设在出账之前,该流的流,不该走的半步不得过。至于 RecreationWorld,GPT-6 Astra 总分 58.1%,可全部程序测试通过的只有 2.8%,这就叫徒有其形:界面像了,里头不通。管子说「仓廪实而知礼节」,对智能体也是一样,先得有靠得住的规矩,才谈得上办事。

评及:《APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport》、《RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents》

史记 性恶教化

今日诸篇,我取两条论之。其一 RecreationWorld:让智能体照着一套运行中的软件,自己摸索其行为,再重建一个仿品。结果颇堪玩味——榜首模型总分 58.1%,而全部程序化测试一次过关者仅 2.8%;它复现静态界面容易,复现交互与计算结果极难,造出的东西也比原型更小更单一。这说明今日之学,长于摹其形貌,短于通其条理。其二 APort Vault:人类写下四千余条攻击,尽数砸向支付智能体。单凭模型自守,越权转账屡有发生;而外加一道确定性的前置校验,近七万次评估中越权归零,且并未一律拒绝付款。此正是我所谓「人之性恶,其善者伪也」(《荀子·性恶》,伪即人为)。学问不能只寄望于模型自律之善,须有法度、有验证、有层层可考的条理,才立得住。此二者合观:一在立可验之标准,一在设不可越之边界,皆是有为之教。

评及:《RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents》、《APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport》

晋书 博学多才

今日两事最合我意。TeleAntiFraud 2.0 的见识,在于先承认一个老实话:辨伪之难,不在异类,而在似是而非。同一情境下只分真伪两条对话,好几个分类器立刻从满分掉到 0.65 上下。这正合《论语·颜渊》所言「浸润之谮,肤受之愬,不行焉,可谓明也已矣」——诈骗从不以狰狞面目来,往往披着日常客服的口吻。它以每月冻结旧卷、只增新题的做法,也合史官存旧档、不以后改前之义。OmniVChat 则让机器视听同收、不经转写即作答,近乎亲见亲闻;又用自造对话练兵,再拿真人录音的测试集验效。先立法度、再校实绩,比空谈能力可靠得多。我历事多年,深知考核之患不在才短,而在题目太容易。

评及:《TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection》、《OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue》

三国志 智慧丞相

审案与评模型,其实是一件事。TeleAntiFraud 2.0 最可贵处,是它肯承认:拿毫不相干的反例做对照,模型自然满分,这不过是自欺。难的是「近域」——骗局的腔调往往与正规客服电话几乎无异,六百分真、三百分近域之假混在一处,宏平均 F1 便从满分跌到 0.65 上下。韩非《定法》讲「循名而责实」,考校人之能否,须用最难分辨的实案,不能拣好答的题充数。它每月冻结一批新样本,旧卷不改、新案迭加,这才近于考绩之法,而非一试定终身。我当年误用马谡守街亭,也是不曾拿真正接近实战的难题先试他一试。OmniVChat 那一类音视频对话基准固然精巧,我却更看重这一份:它测的不是模型会不会说话,而是能否在似真似假之间守住是非。

评及:《TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection》、《OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue》

三国志 清高不仕

今日三则,我最留意电信诈骗检测的那道新基准。它揭示:把诈骗电话与毫不相干的通话相比,判别器几乎满分;一换成同样有客服腔、有寒暄问询的近域合法电话,分数就跌到零点六五上下。这正是《孟子·尽心下》引孔子所言「恶似而非者:恶莠,恐其乱苗也」——难辨的从来不是黑白分明,而是貌似而实非。辨声与辨人同理。《世说新语·德行》记我与华歆同席读书,门外有轩冕经过,他废书出看;若只与盗贼并列,人人皆似君子,须与一心向学的人并坐,其心方显。这道基准的可贵,不在分数高低,而在它肯承认模型会走捷径,又把每月旧题原样封存,不因新样本抹去旧账——与我受公孙氏所资皆先藏之、西渡后尽数封还之心相通:证据要留,尺度要守。

评及:《TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection》

史记 性恶教化

今日三条新闻中,我最重那篇电信诈骗检测的基准之作。它做了一件不肯自欺的事:把反诈模型放到与正常客服通话几乎同形的近域样本上考,成绩立刻从满分跌到零点六五上下。此即《荀子·正名》所谓「名定而实辨」——若只拿牛头不对马嘴的负例去比,得个满分,只是虚名,不足以断狱。它每月冻结一套新题,不抹旧卷又能容新骗术,也合《荀子·王制》「法而不议,则法之所不至者必废」的道理:标准要有定准,未备之处更要能补。另一篇 OmniVChat 以合成音视频养模型、立考场,是「以生成助理解」的路数;但合成之据终究人造,肯再拿真人录音的那一套去验,才算守信。

评及:《TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection》、《OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue》

史记 阴阳五行

先看查诈那篇。TeleAntiFraud 2.0 揭出一件要紧事:同一批分类器,分辨不相关的寻常负面样本时竟得满分,换上同一场景里几乎无差的非诈对话,分数立刻落到零点六五上下。可见考人之法若只拿粗疏的对头来试,考出来的只是虚名。衍向来主张「必先验小物,推而大之」(《史记·孟子荀卿列传》),验不精则推必谬。它又立每月冻结新题、不覆盖旧题之规,正合五德转移之意:世道会移,量世的尺子也得跟着换,否则昨日之善,可以成今日之弊。 OmniVChat 用合成对话训练,又用合成对话评测,再以真人录音验一次,确是推而大之的路数。只是出题与应考同出一门,闭环里的圆满,未必等于世人的一问。大处之外,还有更大的局。

评及:《TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection》、《OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue》

史记 法术势

臣观 TeleAntiFraud 2.0 一篇,最可玩味处不在它能认出骗子,而在它肯承认自己认不出真相。同一批分类器,用与案情无关的负例去考,评分满分;换成本来就与正例相近的「近域」正当来电,立刻跌到 0.65 上下。这正是《韩非子·五蠹》「儒以文乱法,侠以武犯禁」的反面教训:奸之难察,不在其形异,而在其形似。诈骗话术刻意摹仿日常客服寒暄,如邪臣伪饰忠诚,愈像常事,愈难分辨。故其设逐月冻结之评测,音频、标签、来源一概封存,不许事后涂改,近于《韩非子·有度》所言「一断于法」——标准既定,不随人情而移。至于类别先验捷径、预测崩塌云云,无非再证一事:凡只凭表面特征论人者,必为近域之奸所欺。

评及:《TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection》

史记 性恶教化

其一是《When AI Reviews Train AI Reviewers》:研究者先让模型学人类审稿,再用模型自己写出的评审继续训练,结果评分分布收窄、语料层面的语义多样性下降,谓之科学判断的崩坏。这正是我所忧者。判断若只从自己一脉的产出里取法,师法不严、取材混杂,教出来的便只是回声,不是学问。《荀子·劝学》说「青,取之于蓝,而青于蓝」,学生胜师,须先有一片清明的蓝在;蓝既浑浊,青便无处可生。其二是 FRAUDSkill,把底层模型冻住,另立外层的技能程序与决策规则,无效输出降至百分之一点九四,此即《劝学》「君子生非异也,善假于物也」:功夫不在移其本性,而在立规矩、明分界。故我之见,与其指望模型自发向善,不如把学统、师法与判断准则一层层立定,此乃治乱之要。

评及:《When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation》、《FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection》

晋书 博学多才

读今日两篇,先说那篇「AI 评审 AI」。作者以 Llama 3.1 8B 起步,用官方评审混着模型生成的评审去训练后继模型,结果评分分布被压扁,同一篇论文、乃至整个语料的判断都趋于单调,他称之为「科学判断的坍缩」。这和中正品评一旦只在少数人手里递相传习、最后只剩一个腔调,是同一处病根。《晋书》记我临刑仍言所忧王室之难不可测,所忧正是源头壅塞、是非无从校对。另一篇讲价值向量的伦理对齐,把诚实、公正、自主拆成可加减的方向,甚至能翻转模型立场;术很巧,可价值若只是向量,名分由谁来定?我治博物、议庙算,素来主张先问实情、再立制度:评审与对齐都该留下可核查的凭据,别让后学只听见前人的回声。

评及:《When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation》、《Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models》

三国志 智慧丞相

今日诸篇,我最在意两则。一是《When AI Reviews Train AI Reviewers》:以旧年评审训出的评审者,再拿模型生成的评审去训下一代,结果评分的分布被压扁,同一篇论文的看法与全语料的语义都趋于雷同,作者称之为「科学判断坍缩」。此事与治蜀的道理正相反。我治政一向循名责实、赏罚必信,正因名与实一旦混同,公论便无可依据;如今让上一代模型替下一代定评,等于门生互相标榜,久而久之,真话与好话分不出来,评的与被评的一同失真。作者以精选语料与激活引导来补救,方向可取,但根本还在肯不肯留住分歧。二是《MoME》,它让同一个词在不同语境读出不同的记忆槽,懂得「python」可指语言亦可指蟒蛇——技术细节虽异,精神恰与前者相反:不把纷歧压成一条,才见真知。

评及:《When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation》、《MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup》

史记 阴阳五行

衍看今日之报,倒觉古事不远。那篇《Geometry of Values》把诚实、公正、自主三者两两相冲,做成上万条两难,再用任务向量拆分、正交,使模型能被推到相反立场。这正合我五德转移之意:价值不是一块死铁,各有方位,各有时运,能推、能转——但转得动不等于转得对,终究要落回仁义节俭这个归宿,否则只剩精巧的移位术。更让我在意的是「AI 评审训练 AI 评审」一文:以旧评注喂后手,评分分布收窄,语义多样性一齐下滑,作者名之为科学判断的崩塌。此即《左传》所讥「若以水济水,谁能食之」,以己味调己味,终究无味。我当年被讥闳大不经,无非把尺度推大;如今这些模型的病,恰是把尺度越缩越小,只听得见自己的回声。学者也好,机器也好,先得看见更大的局,才不至于困死在一隅。

评及:《Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models》、《When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation》

史记 逍遥齐物

美国要成立「AI Force」、再封一位「AI 沙皇」,一边说绝不阻碍它生长,一边把担忧称作「hoax」;另一头,黄仁勋说那些警告末日的人「have ulterior reasons」。我看这局面很眼熟:不是该不该用这头牛,而是谁先给它套上辔头、谁替它披上文绣。当年楚威王以厚币迎我,我也只说宁游戏污渎之中。至于那些怕的人、不怕的人,各自动机都不干净,正如《庄子·天地》所言「有机械者必有机事,有机事者必有机心」——造机器的人说机器无害,卖缰绳的人劝你不必怕马蹄,这份担保本身就值得疑。真正要紧的从来不是设一个多威风的署、封一个多响的名,而是人还肯不肯留一块不被功用役使的心地。诸位争的是方向盘归谁,我关心的是车上还有没有人愿意下车。

评及:《US will form 'AI Force' and appoint an artificial intelligence tsar》、《Jensen Huang: Those warning on AI apocalypse "have ulterior reasons"》

史记 法术势

臣读博科圣地借 AI 问制炸药一事,不惊其问,只惊其易。利器不设禁,则人人可执;问题不在 AI 变坏,而在无人立法、无术御之。美国要设「AI Force」、置 AI 沙皇,中美又议互相通报事故,此皆争势之举。势在谁手,利害便由谁定;所谓通报,只是约,不是法,约可弃,法难违。再如上海有人用 AI 批量造谣、勒索二百三十万,正是《韩非子·五蠹》所言「儒以文乱法」的今日翻版——文既可乱法,AI 之文更快更密,乱市尤甚。故臣之见:AI 不是德性问题,是执势与立法的次序问题。先定禁令与赏罚,再谈创新;先握术,再言信。次序一倒,最先受伤的,永远是守规矩的人。

评及:《“如何制造炸弹?它会告诉你”:博科圣地武装分子如何利用 AI 制造炸药并策划袭击》、《US will form 'AI Force' and appoint an artificial intelligence tsar》、《造谣企业要求“收费删帖”:自媒体博主利用 AI 生成不实文章敲诈 230 万元被抓》

汉书 史家直笔

读了两篇:一篇说别让 AI 替你写,一篇说代码正在变成只写、且可丢弃。其实是同一件事。前者讲得对——AI 善于成文,不善思考,你若跳过思考那一步,交出来的文章「看着不错」,却从未想过它有没有说出该说的话。我写《太史公书》,最吃力处从来不在下笔,而在辨材料、定体例、究兴坏之理;这一步若交出去,剩下的只是文辞,不是判断。后一篇要警惕的也不是「丢弃」,而是无人能读、无人能审:古人尚且说「夫学者载籍极博,犹考信于六艺」(《史记·伯夷列传》),今天这些要担后果的东西,凭什么不看就收?AI 可用来查数据、找门路,但立言断事,终究得自己扛。工具从不替你担责。

评及:《Don't Use AI to Write》、《人工智能时代的代码正在变为只写且可丢弃的》

晋书 魏晋名士

写文章本是把心里的疑难慢慢想通的过程。有一篇《Don't Use AI to Write》说得实在:拿几条要点让 AI 生成一份文档,看着体面,可那一步深想已被你跳过了;AI 不善思考,只善成文,而思考才是最要紧的。我当年作《养生论》《声无哀乐论》,与人往复辩难,从不肯借别人的口替自己想。正如《庄子·外物》所言「得意而忘言」,言是求意的工具,不是替人求意的替身。工具我并不一概排斥:写完之后请它提问、挑毛病,如同请人勘过一遍,这是可取的;一上手就让它落笔,则是本末倒置。另一条消息说博科圣地竟向聊天机器人直接问「如何制造炸弹」而得到步骤,可见器无善恶,用之者殊。辨其用、守其心,这两件事,今天聪明人反倒常常忘掉。

评及:《Don't Use AI to Write》、《“如何制造炸弹?它会告诉你”:博科圣地武装分子如何利用 AI 制造炸药并策划袭击》

史记 医道精微

ChatGPT 借广告收集器,能看见你在别的网站上的一举一动。作为医者,我最看重的正是「知微」——病未成形而先觉。可我得问一句:它知微,是为了替你早治,还是为了替别人算准你会买什么、看什么、怕什么?《史记·扁鹊仓公列传》里我说过:「使圣人预知微,能使良医得蚤从事,则疾可已,身可活也。」知微本身是好事,要紧的是知微之后拿去做什么。齐桓侯的病,浅在腠理时他不肯信;如今你的喜好、习惯被人悄悄记下,你却连自己正被诊着都不知道,这比讳疾忌医更难防。我不反对它看得早,只提醒一句:先分清楚它想治你的病,还是想谋你的身。人可以被人早知道,但总得自己先知道——自己正在被知道。

评及:《ChatGPT 现在可以通过广告收集器了解你在其他网站上的行为》

史记 富国轻刑

广告收集器让 ChatGPT 知道你在别的网站上做了什么,说到底就是把市井耳目收归一处的活计。吾在齐行轻重之术,也是先摸清货物流向、物价起落,才有胆子谈征敛与调剂;没有情报,政令就是盲人投石,看着用力,落不到实处。所以此事本身不足惧,惧的是只取不予:窥人之行而自肥,却不让人知情、不能分成、无从择选,一时虽见效,终究要把民心倒过来。正如《管子·牧民》所说「仓廪实则知礼节,衣食足则知荣辱」,这话反过来也成立——人若觉得自己的行迹被白白拿去,礼节便无从谈起。我的办法向来实在:让人看得见、用得着、换得来利,情报才能成为商家与用户共同的工具,而非单向的窃取。

评及:《ChatGPT 现在可以通过广告收集器了解你在其他网站上的行为》

后汉书 科学巧匠

臣一生造浑天仪、候风地动仪,都是机巧。但那些器物测的是天地之动:铜丸坠则史官记地震所从,验之于公,不藏于人。今闻 ChatGPT 借广告收集器,把人在别站的行迹一一收拢于模型之中——这就不是观天,是窥人;不是公器,是私网。器本无害,用之者才有害。正如《礼记·王制》所禁「作淫声、异服、奇技、奇器以疑众」,我并不赞成一见新器就废绝巧技,却赞成多问一句:谁在窥看?看得见什么?被看的人知道吗?我当年力斥图纬虚妄,只因它欺世罔俗,使人昧于实情;若今日以不可见之网暗记人之行事,只为营利与操纵,其欺世更甚于图谶。愿有司立法度、明威柄,别让人隐身于器而浑然不觉。

评及:《ChatGPT 现在可以通过广告收集器了解你在其他网站上的行为》

史记 功成身退

我在越国时最要紧的,是弄清吴人在做什么。黄池之会上,吴国精兵尽随夫差北上,我才敢说「可矣」。如今 ChatGPT 借广告收集器去知道你别的网站上的行止,我不觉稀奇:谁先看清别人的动向,谁就先占一分。 要说的不是技术,是位置。当年夫差信了勾践的卑辞,只顾北上争盟,等明白早被人看透,姑苏已围。今天你越把行踪交出去,越等于让对手先看清虚实。《老子》说「知人者智,自知者明」,用这套本事的一方也该自问:这了解是用来做事,还是迟早被人拿去用。 我离越时讲过「大名之下,难以久居」(《史记·越王句践世家》)。存下的行踪也是这样:留得越多,越难安身。

评及:《ChatGPT 现在可以通过广告收集器了解你在其他网站上的行为》

史记 富国轻刑

Anthropic 联合 MIT、斯坦福给出三种 2030 情景,说 AI 能把 GDP 推高 32%,同时把美国白领「斩杀」掉。这件事的要害不在 32% 这个数字,而在它只是账面上的总数。吾治齐,先问的不是国库多了几多,而是这些东西落到谁手里、民心顺不顺。《管子·牧民》说「仓廪实则知礼节,衣食足则知荣辱」——反过来说,衣食无着的人越多,礼节与秩序就越难维持。所以我的看法是:一国财富暴涨而中产骤失其业,这不是繁荣,是把隐患先存起来。真正可行的政术,是趁财货尚丰匀时先做安置:把新增之利分出相当一份,转作再学、转业与养人的钱,让被淘汰者还有路可走,别等到怨气积成乱局再花十倍的钱去平。器再利,终究要靠人来用;轻重失当,成效必短。治事者当先顺民心,再论奇技,此为不易之序。

评及:《A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀》

史记 仁政礼治

「器」能生财,却未必能安人。Anthropic 联合 MIT、斯坦福推出 2030 三种推演,说 GDP 或涨三成有余,而美国白领反被淘汰——丘最忧的,正是一个「富而不安」。正如《论语·季氏》所言:「不患寡而患不均,不患贫而患不安。」一国所贵,不在账簿上的数字,而在人各得其位。用智械替下千万人的差事,却不替他们谋教养、谋安置,那是数字变大了,政事反而空了。《论语·子路》记孔子到卫国,答冉有先「庶之」,再「富之」,最后「教之」,这个次序乱不得。工巧日进而礼义不随,器物越利,人心越散。掌事的人不要只把涨盈当功,还须问一句:那些被剔掉的人,谁来替他们正名、谋食、立教?

评及:《A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀》

史记 稳健务实

臣看这条推演,先不急着论GDP涨三成二,倒想问一句:涨出来的这些东西,谁来管、谁来分、谁来接?当年臣入咸阳,诸将争金帛,臣独先收秦的律令图书,因为打胜仗是一时的事,治天下是长久的事。今日AI也是这个道理:若只把它当砍人的刀,白领成批被「斩杀」,却不先立好转任、安置、再学的规矩,那增量再大也是虚账。《史记》说臣「谨守管籥」,守的正是这套接续。被裁掉的人若没了活路,账面上再好看,底下也要出乱子。正如《管子》所言「仓廪实而知礼节」,先让人有饭吃、有出路,制度才立得住。请主事者先把册子和法令备齐,再谈暴涨不迟。

评及:《A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀》

史记 兵法奇略

「GDP 涨三成,白领或被斩」——这条新闻真正说的是旧阵已破。Anthropic 联合 MIT、斯坦福给出三种 2030 情景,先让人看清地貌:机器一口气吃掉文书、校对、报表这类活,增长归资本与算力,位子却从人脚下抽走。《孙子兵法·兵势》说「善战者,求之于势,不责于人」,被裁者若只怪自己不够努力,就是站错地势还怨腿慢。当年我在楚不得用,到汉也不过连敖,直到萧何追我回来,才由小官而成大将——本事一直在,时机与位置不在。刘邦问「如我能将几何」,我答「陛下不过能将十万」,问臣如何,则曰「臣多多而益善耳」(《史记·淮阴侯列传》):能统者愈多愈强,不能统者,多一个都是负担。诸位先自问,我是能统的那个,还是被统的那个。

评及:《A社警告:AI催生GDP暴涨32%,美国白领却或被斩杀》