9月10日学术报告:李一戈
发布时间:2026-09-08 浏览量:10

报告标题:可信与可控人工智能系统:从模型安全到智能体安全

报告时间:9月10日15:00-16:00

报告地点:理科大楼B211

报告摘要:

随着大语言模型逐渐从内容生成工具演化为能够规划、调用工具并与真实环境交互的智能体,人工智能

安全问题也从单一模型层面扩展到复杂系统层面。本报告将介绍在人工智能安全领域的系列研究,包括

神经网络与大语言模型中的后门攻击与防御、大模型越狱与高风险场景安全评测,以及面向真实智能体

运行轨迹的安全风险评估与监控。在此基础上,报告将进一步讨论如何推动人工智能安全从评测与防御

迈向运行时监控、主动干预和失效保护,从而构建更加可信、可控的人工智能系统。

报告人简介:

李一戈,现任新加坡管理大学计算与信息系统学院博后研究员,主要从事人工智能安全、可信机器学习、

语言模型安全与智能体安全研究。以第一作者或通讯作者在 ICLR、NeurIPS、ICML、NDSS、ACL、

IEEE TDSC、IEEE TIFS 等国际会议和期刊发表 CCF A 类论文十余篇,谷歌学术引用 2500 余次。当前研

究重点包括大模型后门攻击与防御、越狱与安全对齐、智能体风险评测及可控人工智能系统。


华东师范大学软件工程学院
学院地址:上海中山北路3663号理科大楼

                上海市浦东新区楠木路111号
院长信箱:yuanzhang@sei.ecnu.edu.cn | 办公邮箱:office@sei.ecnu.edu.cn | 院办电话:021-62232550
www.sei.ecnu.edu.cn Copyright Software Engineering Institute