中国社科院:调教最暖大模型:通过prompt调试并比较国内外大模型“人情味”的小实验(2024)_30页_3mb
报告摘要
研究目的与背景
本报告分析了大模型(如GPT-4和国内模型)在“人情味”方面的表现差异。目标是探索如何通过prompt调试提升大模型的回答温暖度和关怀性,该实验基于不同社会群体(如老年人、残疾人、心情低落者)的焦点小组反馈,旨在帮助无技术背景的普通人复现实验。
实验设计
实验设计了两种prompt类型:原则型prompt强调温语气、真实性和高人称词频率;答案对型prompt邀请专家撰写参考答案,并测试prompt对模型人情味的提升效果。测量基于三个维度:拟人、共情、表达,使用百分制评分,覆盖多个话题(如老年、残障、心情低落、职场发展)。
实验对象包括2款国外模型(GPT-4、Vicuna)和3款国内模型(W、X、Y)。通过prompt调试前后比较人情味得分,使用ERG模型细分话题。
主要发现
- 发现一:GPT-4原始人情味得分最低,经原则型prompt后提升2431%,排名上升。
- 发现二:国内模型在老年话题表现更优,体现更强人情味。
- 发现三:国外模型在心情低落话题更温暖,排名靠前。
- 发现四:国内模型在人际关系话题更擅长表达关怀。
- 发现五:不同prompt对模型效果各异;原则型prompt对GPT-4等模型提升更快,答案对型prompt对Vicuna和国内模型X更有效。
- 发现六:人情味最佳组合TOP3包括特定prompt与模型的搭配,提升比例显著。
- 发现七:prompt调试提升了拟人和共情,但表达友善度提升有限,教做人易而学善意难。
- 发现八:原则型prompt对提高拟人效果更佳,颜色表现拟人提升26%以上。
- 发现九:国外模型对prompt吸收效率更高,GPT-4提升幅度最大。
- 彩蛋:人类撰写答案的人情味评分远高于模型,对大模型局限性进行了对比。
- 附录:实验流程详细说明了问题抽取、prompt输入、打分过程等步骤。
结论
本实验证实,普通人通过使用原则型或答案对型prompt可显著增强大模型的人情味,操作简便且可复现。实验强调“公众科技力”的重要性,鼓励社会各界(如老年人、残疾人)参与科技创新,以提升AI的温暖度和实用性。最终呼吁重视人类的光辉,珍视人情味在社会中的作用。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载