7月17日:马彦彪
发布时间:2026-07-15 浏览量:10

报告标题:大语言模型的推理能力源于受约束的推理流形

报告时间:7月17日15:00-16:00

报告地点:理科大楼B211

报告摘要:

大模型的推理能力究竟是如何产生的?过去,我们习惯用 MMLU、GSM8K 等基准测试的准确率来衡量模型的“聪明程度”。但这种黑盒式的评估往往 conflating(混淆)了任务表现与内部推理质量,因为一个模型可能因为数据对齐好而得分高,但其内部推理过程可能脆弱且不可靠。我们最新的揭示:大模型的推理,并不是高维空间中的自由搜索,而是一种在高表达能力基础上,自发形成的低维、信息非退化的受约束动力学过程。也就是说: 真正聪明的大模型,内部并不是在“漫无目的地乱想”。它们会自发收缩到一个极小的低维结构中,同时保持极高的信息密度,并依赖强大的世界知识作为支撑。

报告人简介:

中国人民大学高瓴人工智能学院讲师,北京协和医学院,智能医学学院青年科学家,研究方向包括大模型机理,智能体系统效率优化,多模态大模型图文理解,长尾学习和联邦学习。负责国家重点研发计划子课题,创新群体项目子课题,在人工智能国际顶级期刊和会议发表一作论文20余篇,获得CVPR等主办的国际竞赛冠军6项,长期担任TPAMI、TNNLS、CVPR等期刊和会议的审稿人。


华东师范大学软件工程学院
学院地址:上海中山北路3663号理科大楼

                上海市浦东新区楠木路111号
院长信箱:yuanzhang@sei.ecnu.edu.cn | 办公邮箱:office@sei.ecnu.edu.cn | 院办电话:021-62232550
www.sei.ecnu.edu.cn Copyright Software Engineering Institute