2025-01-03-清华大学-以人为中心的大型语言模型(LLM)研究综述_38页_1mb
报告摘要
人类中心型大语言模型(Human-Centric LLMs)综述
1 研究背景与目标
本文提出了一种从“人类中心”视角系统评估大型语言模型(LLMs)能力的新框架,重点分析其在认知模拟(如推理、决策)、社会互动(如情感理解、协作)和文化敏感性方面的表现,并探索在社会科学领域的应用潜力。论文评估了LLMs在个体任务(如单人决策)和集体任务(如多智能体协作)的能力,并指出当前LLMs存在适应性弱、情感浅显、文化偏见等问题,未来需提升实时学习、情感智能和文化适配性等能力。
2 LLMs的人类中心能力评估
2.1 认知能力
- 优势:LLMs在结构化推理(如数学、逻辑)和多轮对话中表现出色,使用Chain-of-Thought提示可提升一致性和准确性。
- 不足:难以处理复杂多步骤推理、实时学习,在涉及归纳推理和因果关系任务中表现不稳定,易受训练数据偏见影响。
2.2 社交与情感能力
- 优势:LLMs在情感识别和表述(如EIBENCH、EmoBench)中表现优于平均水平,能模拟多种社交角色。
- 不足:缺乏真实情感和深度共情,无法适应复杂情境中的微妙情感变化(如识别faux pas或调整文化表达)。
2.3 协作与文化能力
- 优势:在多智能体协作(如LLM-Arena)中表现出策略性,可模拟人类团队决策。
- 不足:文化敏感度不足,在少数族裔文化适应性低,易生成刻板印象或偏见内容(如未充分理解Hofstede维度中的文化差异)。
3 人类中心领域应用
3.1 个体领域(行为科学、心理学、语言学)
- 支持集体决策优化、心理健康干预、创意内容生成,如GPT-4在创意思考中显著提升输出质量。
- 应用中模拟真实人类协作与决策,但当前仍依赖简化模型(如Hotelling博弈理论)而缺乏深度人际洞察。
3.2 集体领域(政治学、经济学、社会学)
- 支持政策模拟(如World Wars冲突模拟)、经济预测(Prisoner’s Dilemma博弈)、社会公平评估(OP理论测试)。
- 团队协作中LLMs高成功率(88.4%),但在动态环境中的适应性差和战略性不足限制了其集体实战应用。
4 开放挑战与未来方向
4.1 技术改进方向
- 实时学习与适应性:开发具备在线学习能力的混合架构(如RLGF+REINFORCE),增强动态环境适应性。
- 情感智能提升:结合情感计算模型与实时反馈强化学习(如Seedot模型),提升共情与交互真实性。
- 文化感知增强:通过领域微调、RAG检索与跨文化数据扩充,提高LLMs对多元文化的适配性。
4.2 法律与伦理考量
- LLMs在弱势群体中易产生偏见(如种族/文化刻板印象),需建立完善去偏见机制(如BIASBUSTER框架)。
- 敏感任务(如医疗/心理)需明确用户反馈闭环与责任归属,避免LLMs在高风险场景中的误判。
5 结论
本文构建了从认知、社交、文化、协作四个维度评价LLMs的能力框架,并指出其在可解释决策与用户交互设计方面的国际合作框架尚未完善。研究强调未来需加强跨学科协作(如心理学+经济学交叉验证),以推动LLMs更好地融入人类社会场景,但目前其仍难以完全匹配人类认知与情感能力。建议进一步建立标准化评估基准与动态反馈机制以弥合现有差距。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载