AI越会回答,人为什么越需要深度思考?复旦发布2026人文社科智能发展蓝皮书

2026-07-17 07:00:59未知 作者:徽声在线

徽声在线编辑部

曾几何时,我们对AI的期待还相对简单,诸如撰写邮件、翻译论文、充当聊天伙伴等。那时的AI,宛如一个初入职场的新人,你指向哪里,它便努力做到哪里,然而也时常一本正经地给出一些荒谬的回答。

近两年,AI的发展可谓突飞猛进,势不可挡。

它不再满足于仅仅替人撰写几段文字,而是开始全面接手整套工作:编写代码、查找资料、进行数据分析、生成解决方案,甚至能够自行拆解任务、调用工具、安排步骤并检查结果。

随之而来的,还有一些令人哭笑不得的变化。程序员开发的AI,开始承担起原本由程序员完成的部分工作;不少白领岗位也发现,AI已经悄然坐在了隔壁的工位上。

学术界的情形则更为有趣。AI极大地降低了论文写作的门槛,即便它并不理解学术理想,也能将论文格式整理得相当规范、庄严。

于是,有人开始批量生成论文、批量投稿。审稿人由于工作繁忙,便借助AI辅助审稿;作者发现后,又在论文中嵌入只有机器容易识别的提示词,期望审稿AI能给出积极评价。所有参与者都节省了时间,然而对于知识本身是否有所增加,目前尚未形成统一意见。

但问题恰恰在于此:我们获得的是更多的知识,还是更多看似知识的产物?当越来越多的工作都可以交给AI完成,人究竟还剩下什么?

复旦大学发布的《2026人文社会科学智能发展蓝皮书》,正是试图对这些问题作出回应。

与首期蓝皮书主要关注AI如何赋能人文社会科学不同,本期蓝皮书以“重新发现深度思考的价值”为主题,进一步提出,AI与人文社会科学的关系正在从“单向赋能”迈向“双向融合”:AI改变人文社会科学的研究方式,而人文社会科学则要参与决定AI的使用目的、应用场景以及应当受到的约束。

作为本书的特别支持单位,上海科学智能研究院也正携手复旦大学,持续探索AI与人文社会科学深度融合的路径。



为何AI越强大,深度思考反而越重要

计算器普及后,人们无需再用纸笔计算复杂数字;导航出现后,人们也不必记住每一条道路。按照这一逻辑推演,AI能够分析资料、生成结论后,人或许也可以少动些脑筋。

然而,社会问题并非简单的算术题。

蓝皮书以气候——社会系统耦合为例指出,真正的难点并非处理更多变量,而是理解自然系统与社会系统在结构、变量和尺度上的错配。一个模型能够运算,并不意味着它已经真正理解了问题。



气候——社会系统耦合的三类错配:结构、变量与尺度。

算术题只需判断答案是否正确,而知识生产和公共决策则必须进一步追问:论证过程是否可靠,前提假设是否合理,潜在风险是否可控,以及问题本身是否具有指引未来的价值。

蓝皮书认为,研究瓶颈正在发生转移:过去的问题在于能否处理足够多的材料,而现在的问题则在于能否提出好问题、建立真实机制,并形成可以检验的证据链。

什么问题值得研究,观察到的模式应当如何解释,某种结果是否公平正当,以及研究遗漏了什么、固化了什么偏见,这些判断无法被彻底自动化。AI能力越强,人的判断责任反而越重。

AI看似无所不能,它真的都能做得好吗?

AI越来越擅长说话、推理、调用工具,也越来越像一个可以协作的“研究伙伴”。但它究竟是在真正理解,还是在以非常高明的方式模拟理解?

四十多年前,塞尔通过“中文屋”思想实验质疑纯粹句法操作能否产生语义理解。如今,大模型将这一问题摆在了每个人的面前:我们如何判断大模型到底理解了什么,又遗漏了什么?

蓝皮书的一个重要判断是,人类智能并非简单的“输入——输出”过程。人能够理解世界,是因为感知与注意将外部刺激组织成情境,记忆与认知地图将过往经验组织成可以迁移和推理的结构,情绪与价值决定哪些信息更重要、哪些目标更值得追求。

人智协同的第一步,并非让AI直接干活,而是先明确人和AI的分工。AI可以帮助我们识别对象、检索信息、生成文本,但它很容易将复杂的社会经验改写成自己容易处理的格式,将真正需要理解的问题变成看似已经被回答的问题。我们需要从对象识别走向情境理解,从信息存储走向经验组织,从生成走向价值判断和自我反思。

认知科学因此变得尤为重要。它告诉我们,深度思考并非与AI相对立的能力,而是在人机协作中更需要被激活的能力。真正有价值的认知型AI,不应只是给出一个单一、流畅、确定的答案,而应帮助人提出问题、比较证据、保持判断的主动性。

论文写得越来越快,谁来保证其可信度

AI进入科研领域后,最显著的变化是速度的提升。文献整理、数据清洗、代码生成、图表绘制和论文初稿,都可以在很短的时间内完成。研究者没有义务将宝贵时间消耗在重复劳动上,一个学者是否具有思想,也不应由他手工调整了多少次参考文献格式来证明。

然而,研究的速度和知识的速度并非一回事。论文生成得很快,并不意味着概念已经澄清、数据已经理解、因果关系已经成立。语言模型尤其擅长将分散材料组织成连贯叙述,而学术研究最危险的时刻,往往就是叙述显得过于连贯的时候。

风险还隐藏在那些看似只是“技术操作”的环节。变量如何选择、指标如何构造、样本从哪一年开始、哪些案例被纳入,背后都包含理论判断。

机器当然没有阴谋,它只需要在第一步犯一个小错误,并在后面的二十步里始终保持自信。

另一种风险来自自动化模型搜索。AI可以不断尝试变量组合、参数设置和样本区间,直到找到显著性更强、拟合度更高、图表更漂亮的结果。过去,“试到显著为止”还受时间和精力限制;如今,智能体可以不眠不休地搜索。效率提高后,统计偶然也可能被更高效地包装成理论发现。

自动化科研真正带来的挑战,不只是机器会不会犯错,而是错误能否被及时发现、研究过程能否被回溯、最终结论能否被重新检验。

AI做决定时,谁来负责

AI识别和分类人的能力正在迅速增强。它可以识别诉求、判断风险、审核材料、匹配政策,也可以为工作人员提供决策参考。

这类系统的吸引力显而易见:它们比人快,不会疲劳,也不会因为压力或情绪波动而改变处理节奏。

然而,不疲劳和公平并非一回事。

蓝皮书引用的研究发现,在分析健康论坛帖子和国际学生访谈时,人类研究者能够识别医患互动、文化责任等细微差别,大模型却容易将其概括为更普通、更标准化的类别。

模型并非完全没有理解。它只是非常善于将不容易理解的东西,改写成自己容易处理的样子。

在公共治理中,这种简化可能直接影响人的权利和待遇。蓝皮书由此区分了两种AI嵌入模式。

一种是“代理型”模式。算法成为行动者,从信息输入一直走到决定输出,人类只在系统故障或当事人申诉时重新出现。另一种是“辅助型”模式。AI负责检索、计算、提示风险和生成方案,最终决定仍由人作出。

两种模式的区别,不在于使用了多少技术,而在于权力是否发生了转移。

当然,在制度文件里写着“人在回路”,并不能保证人真的还在。如果工作人员只能在算法结论后面点击“确认”,所谓人工复核,不过是把机器的决定换了一根人类手指。

人工角色必须拥有介入权、纠偏权和解释权,否则人工复核就会成为一种责任表演。

当AI开始影响人的权利,问题便不能仅仅停留在“模型准不准”,还必须明确谁部署、谁复核、谁解释、谁接受申诉并承担最终责任。

责任可以分工,却不能因为分工太细而最终蒸发掉。

深度思考,不止于“多想一会儿”


“深度思考”听起来像是一种个人美德:面对问题,不要急着回答,多想一会儿。但真正有意义的深度思考,必须融入研究流程、治理程序和组织制度。它不仅要求个人更加谨慎,也要求系统保留让人谨慎、质疑和纠偏的条件。

AI可以帮忙,但证据链不能省略

深度思考并不意味着拒绝AI。没有必要为了证明人类的尊严,坚持亲自整理几千份材料,或把一整天花在调整参考文献格式上。

关键在于,工作可以交给AI,但证据链不能一起交出去。AI可以检索文献、处理数据、运行代码,但研究者仍需判断问题是否值得提出、概念是否被准确转化为指标、数据关系能否支持因果解释,以及结论适用于哪些范围。

蓝皮书介绍的STRIDES框架,尝试将复杂研究拆分为理论、方法、数据、执行和审查等环节,并在关键节点设置检查:假设需要写明,证据能够定位,数据和代码保留版本记录,高风险或低置信度结论重新交给人判断。



STRIDES系统概览:从研究设计到对抗式审查的工作流闭环

AI参与研究后,研究产物不应仅剩下一篇最终论文。研究问题、数据字典、分析脚本、运行记录、审查意见和人工裁决,也应被保留下来,让人看见结果从哪里来、在哪一步可能出错、经过哪些修改。

科学之所以可信,并非因为结论来得快,而是因为别人能够沿着证据链重新走一遍。

采访中,团队给出了一个简单的自我检查:关掉模型后,你能否用自己的语言说明问题是什么、证据来自哪里、结论依赖哪些假设、可能有哪些反例,以及适用边界在哪里?

如果只能说“它讲得很有道理”,却解释不了为什么;如果问题逐渐被改造成模型容易回答的问题;如果文章越来越流畅,自己的观点却越来越模糊,那么AI很可能已经从表达助手变成了判断代理。

规则不能仅停留在口号里

关于AI治理,人们已经提出了许多正确原则:公平、透明、安全、以人为本、保护隐私、承担责任。

问题在于,原则如果不能转化为程序,就很容易仅仅停留在会议和文件里。

一套制度若只有原则,没有执行机制,和一个人只有理想没有闹钟差不多。每天都打算做正确的事,只是从未在正确的时间醒来。

蓝皮书强调,AI治理要覆盖系统的整个生命周期:部署前评估风险和适用边界,运行中记录关键决定、监测异常并保留人工介入,出现问题后能够复核、纠偏和追责。

不同风险的系统,也不应接受完全相同的治理。普通的信息检索和文本整理可以降低门槛;涉及公共安全、重要权益和关键决策的系统,则应接受更严格的测试、审计和部署要求。

治理也不能止于“已经告知”。受到影响的人应当知道决定依据什么作出、可以质疑什么、应向谁提出异议,并能够要求人工复核,在错误发生后获得实际救济。否则,说明义务很容易变成一份没人看懂的技术文件,申诉渠道也可能只剩一张网页。

当然,治理并非给技术踩刹车。它更像是修路:哪里可以提速,哪里必须限速,哪里需要护栏,出了事故以后由谁负责。没有规则的道路并不代表自由,通常只代表强者开得更快,其他人自己小心。

AI会整理答案,人还得决定方向

AI很擅长回答已经被提出的问题。但社会真正困难的问题,通常并非没有答案,而是没有一个所有人都认可的标准答案。

效率和公平发生冲突时,应该优先哪一个?技术创新会带来整体收益,却让一部分人承担更大代价时,怎样才算合理?公共利益和个体权利发生矛盾时,边界应当划在哪里?

这些问题无法通过扩大参数规模自动消失。

蓝皮书将人文社会科学对AI的“反向赋能”概括得很具体:不是站在技术旁边发表抽象的道德意见,而是把价值冲突转化成可以分析的权衡,把社会后果转化成可以测量的指标,并为技术发展提供更具方向感和解释力的知识框架。

模型可以告诉我们不同选择可能带来什么后果,但它不能仅凭自己决定,哪一部分人应该为整体效率付出代价,也不能决定某种代价是否值得。

蓝皮书讨论的中华早期文明大模型,就是一个例子。历史文献、出土文字、器物图像、遗址信息和地理数据,过去分散在不同资料系统和专家经验中;多模态模型可以把它们组织进同一个知识空间,使不同来源的证据相互参照。

它的意义不只在于提高检索效率,更在于改变证据的组织方式。但材料连接得越多,专家越需要判断:哪些关联具有历史意义,哪些只是表面相似;哪些叙事建立在可靠证据上,哪些只是被模型组织得更加流畅。

这正是人文社会科学不能被简化为“给AI挑错”的原因。它不仅负责指出偏见、风险和漏洞,也要解释价值冲突,分析制度后果,理解具体人的处境,并帮助社会形成可以共同承担的判断。

技术解决“能够做什么”,人文社会科学继续追问“为什么要做”“应该做到哪里”“代价由谁承担”。

靠少数团队还不够

谈到AI与人文社会科学融合,人们容易想到几个实验室、几项明星成果,以及少数既懂技术又懂社会科学的研究者。

这当然重要,但不能仅依赖这些。

一个领域要形成长期能力,需要数据、算力、模型、工具链、人才培养、组织协作和评价制度共同支撑。蓝皮书特别提醒,AI4SSH基础设施不等于购买更多机器,也不等于把几种模型放进同一个网页,而是多模态数据底座、计算环境、领域模型、智能体、工具链及协同机制的整体建设。

买到算力相对容易,建立共同的数据规则很难;发布一个模型相对容易,让不同学科真正理解彼此的问题很难。真正的挑战,是把零散项目沉淀为可以持续运行的组织能力。

更重要的是,认知科学等新兴学科也需要一同谋划。认知科学连接哲学、心理学、神经科学、计算科学、语言学和社会科学,它既帮助我们理解人类智能,也帮助我们反思和校准机器智能。对高校来说,这类基础学科建设未必马上对应一个可演示的应用,却决定了未来人智协同能否从工具使用走向范式创新。

蓝皮书由此构建“中国高校AI4SSH指数”,从研究核心能力、发展创新潜力和社会传播能力三个维度展开,包括3个一级指标、7个二级指标和10个三级指标。



它提供了一扇结构化的观察窗口:哪些高校已经形成稳定的交叉研究体系,哪些仍停留在零散项目;哪些拥有研究产出,却缺少制度支撑;哪些有学术成果,却还没有把它转化成公共影响和社会服务。

蓝皮书的总体判断是,中国高校AI4SSH发展已经呈现“体系初构、梯次分明”的格局,研究产出和本土融合进展较快,但国际学术影响力、源头创新、制度支撑和社会服务转化仍有短板。

因此,衡量AI4SSH的发展,不能只看模型、论文和项目数量,还要看数据、工具、规范、人才和协作机制能否长期运转。技术可以迅速升级,制度和组织却只能缓慢学习;真正决定AI与人文社会科学能够走多远的,恰恰是这些不太容易被做成演示视频的部分。

结语:AI越会回答,人越要知道该问什么


复旦大学党委书记裘新在蓝皮书序言中寄语读者,在智能时代“始终守护思想、砥砺思考,保留独立思索、理性判断、追问价值、明辨取舍的从容和定力,以思想之深引领智能之变”。

这也是这本蓝皮书希望传递的态度。它不只是对一轮技术变化的观察,也是复旦文科面对智能时代的一次集体思辨。

真正重要的是,在自动生成之前,先判断什么问题值得提出;在模型给出结论之后,继续追问证据是否可信;在技术进入社会之前,明确它的边界和责任;在许多可能的未来之间,保留人的价值判断和方向选择。

我们不必继续证明人在哪些任务上比机器更快,而要重新确认人在知识生产和社会运行中不可转让的判断与责任。

机器可以帮助我们抵达许多地方。至于为什么出发、应当去哪里,以及到了以后准备过怎样的生活,这些事情恐怕还不能完全交给它。

蓝皮书将于7月17日在WAIC 2026“人工智能全球治理与可持续发展”论坛正式发布,全文下载请关注复旦大学国家发展与智能治理综合实验室官方。

点击展开全文
你关注的
从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业从“几年一遇”到“一年几遇”,AI时代网络攻防失衡加剧 奇安信齐向东:主战场转向制造业与服务业 微信电脑端重大更新:可滚动截长图与支持发语音功能上线微信电脑端重大更新:可滚动截长图与支持发语音功能上线 上海布局太空算力新赛道,全球首颗光计算卫星研制正式启动上海布局太空算力新赛道,全球首颗光计算卫星研制正式启动
相关文章
AI越会回答,人为什么越需要深度思考?复旦发布2026人文社科智能发展蓝皮书AI越会回答,人为什么越需要深度思考?复旦发布2026人文社科智能发展蓝皮书 苹果OpenAI技术窃取案升级 马斯克炮轰阿尔特曼:欺诈新境界苹果OpenAI技术窃取案升级 马斯克炮轰阿尔特曼:欺诈新境界 特斯拉AI5芯片流片突破:三星2纳米工艺或改写代工格局特斯拉AI5芯片流片突破:三星2纳米工艺或改写代工格局 东方算芯沪上发布全球首创软件定义近存计算3D芯片,引领国产算力新风尚东方算芯沪上发布全球首创软件定义近存计算3D芯片,引领国产算力新风尚 三年逆袭偏见!古德伍德现场车主退订迈凯伦转投腾势Z,中国电动车在英国掀起认知革命三年逆袭偏见!古德伍德现场车主退订迈凯伦转投腾势Z,中国电动车在英国掀起认知革命 IDC报告:2026年Q2全球智能手机出货量降6.7% 内存成本飙升加剧市场分化IDC报告:2026年Q2全球智能手机出货量降6.7% 内存成本飙升加剧市场分化