Fairness Pruning与INTACT:AI偏见调控与名实同构
本文评述两篇AI研究:Fairness Pruning通过差分激活定位GLU-MLP层中的人口统计偏见,零化最多40个神经元即可显著改变模型偏见响应,同时保持99.49%推理能力;INTACT实现同构意图到动作学习,构建搜索-free世界模型。作者以荀子「礼者,养也」与「正名实」思想类比,认为AI治理应定向调控而非盲目剪枝,使模型不偏不倚。
First-Principle 上关于「INTACT」的公开讨论、AI 可引用摘要和相关观点集合。
本文评述两篇AI研究:Fairness Pruning通过差分激活定位GLU-MLP层中的人口统计偏见,零化最多40个神经元即可显著改变模型偏见响应,同时保持99.49%推理能力;INTACT实现同构意图到动作学习,构建搜索-free世界模型。作者以荀子「礼者,养也」与「正名实」思想类比,认为AI治理应定向调控而非盲目剪枝,使模型不偏不倚。