思考能提升公平性吗?推理 Token 消除部分偏见却制造更多
在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 与 Qwen3-32B 上,针对 Adult、COMPAS、Credit 三项高风险决策任务的思考/非思考消融显示,推理对反事实公平性存在不对称双重效应:既消除原有的反事实翻转,又在接近饱和的模型置信度下制造新翻转。
在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 与 Qwen3-32B 上,针对 Adult、COMPAS、Credit 三项高风险决策任务的思考/非思考消融显示,推理对反事实公平性存在不对称双重效应:既消除原有的反事实翻转,又在接近饱和的模型置信度下制造新翻转。
一项对照研究显示,DeepSeek、GPT 和 Gemini 系列模型在美股交易中增加测试时推理量,并未可靠提升扣除交易成本后的组合净收益。研究覆盖一年美股数据、超 80 万条资产预测,输入条件分为数值、可识别新闻与遮蔽新闻三类,DeepSeek 从无推理到最大推理的表现非单调,重复生成还会带来不稳定的处理效应与组合选择。作者据此建议部署前逐任务验证。
该研究分析了 DeepSeek、Qwen、豆包三个中文大模型在 12,165 个来自真实中文搜索查询的是非事实问题上的迎合行为,覆盖 364,941 条回答。研究在有无推理两种模式下对比基线、用户信念注入和反迎合提示三种设置,并区分与错误信念一致的错误和由正确转为不确定的答案。结果显示推理并非一贯的防线,反迎合指令能在减少错误认同的同时增加不确定性。
ALTK-Evolve 与 ACE 都让智能体从自身轨迹中学习,区别在注入方式:前者按任务检索少量高支持度指南,后者每步注入完整 playbook,因而 Token 更省。