7月17日:马彦彪
发布时间:2026-07-15 浏览量:10
报告标题:大语言模型的推理能力源于受约束的推理流形
报告时间:7月17日15:00-16:00
报告地点:理科大楼B211
报告摘要:
大模型的推理能力究竟是如何产生的?过去,我们习惯用 MMLU、GSM8K 等基准测试的准确率来衡量模型的“聪明程度”。但这种黑盒式的评估往往 conflating(混淆)了任务表现与内部推理质量,因为一个模型可能因为数据对齐好而得分高,但其内部推理过程可能脆弱且不可靠。我们最新的揭示:大模型的推理,并不是高维空间中的自由搜索,而是一种在高表达能力基础上,自发形成的低维、信息非退化的受约束动力学过程。也就是说: 真正聪明的大模型,内部并不是在“漫无目的地乱想”。它们会自发收缩到一个极小的低维结构中,同时保持极高的信息密度,并依赖强大的世界知识作为支撑。
报告人简介:
中国人民大学高瓴人工智能学院讲师,北京协和医学院,智能医学学院青年科学家,研究方向包括大模型机理,智能体系统效率优化,多模态大模型图文理解,长尾学习和联邦学习。负责国家重点研发计划子课题,创新群体项目子课题,在人工智能国际顶级期刊和会议发表一作论文20余篇,获得CVPR等主办的国际竞赛冠军6项,长期担任TPAMI、TNNLS、CVPR等期刊和会议的审稿人。