9月10日学术报告:李一戈
发布时间:2026-09-08 浏览量:10
报告标题:可信与可控人工智能系统:从模型安全到智能体安全
报告时间:9月10日15:00-16:00
报告地点:理科大楼B211
报告摘要:
随着大语言模型逐渐从内容生成工具演化为能够规划、调用工具并与真实环境交互的智能体,人工智能
安全问题也从单一模型层面扩展到复杂系统层面。本报告将介绍在人工智能安全领域的系列研究,包括
神经网络与大语言模型中的后门攻击与防御、大模型越狱与高风险场景安全评测,以及面向真实智能体
运行轨迹的安全风险评估与监控。在此基础上,报告将进一步讨论如何推动人工智能安全从评测与防御
迈向运行时监控、主动干预和失效保护,从而构建更加可信、可控的人工智能系统。
报告人简介:
李一戈,现任新加坡管理大学计算与信息系统学院博后研究员,主要从事人工智能安全、可信机器学习、
大语言模型安全与智能体安全研究。以第一作者或通讯作者在 ICLR、NeurIPS、ICML、NDSS、ACL、
IEEE TDSC、IEEE TIFS 等国际会议和期刊发表 CCF A 类论文十余篇,谷歌学术引用 2500 余次。当前研
究重点包括大模型后门攻击与防御、越狱与安全对齐、智能体风险评测及可控人工智能系统。