学术交流
细粒度家族:迈向更细、更深、更快的视觉感知
发布时间:2026-07-19    浏览次数:


报告题目:细粒度家族:迈向更细、更深、更快的视觉感知

报告人:彭宇新教授(北京大学)

报告时间:2026年7月22日16:00

报告地点:管理楼102-1会议室


报告摘要:多模态大模型在通用任务上表现出色,但缺乏细粒度感知能力,如何提高视觉感知的精度、深度与速度,是多模态大模型急需解决的关键问题。本报告将首先阐释“细粒度家族”的定义,涵盖类别、空间、时间三个感知维度,并分析现有大模型在每个维度上面临的挑战。针对上述挑战,本报告介绍团队在基于细粒度树的分层图像分类、多模态大模型细粒度视觉感知、细粒度图像token剪枝、细粒度美学照片重构、细粒度动作质量评价等方面的最新研究进展。最后,介绍团队在细粒度视觉内容理解与生成技术上的落地应用。


报告人简介:彭宇新,北京大学二级教授、博雅特聘教授,IEEE/CCF/CAAI/CIE/ CSIG Fellow,2019年国家杰青,2025年国家杰青延续资助,2019年国家万人领军人才,2018年科技部中青年科技创新领军人才,863项目首席专家,国家重点研发计划“社会治理与智慧社会科技支撑(平安中国)”重点专项总体专家组专家,中国工程院“人工智能2.0”规划专家委员会专家,中国人工智能产业创新联盟专家委员会主任,中国图像图形学会副理事长,北京图象图形学学会副理事长。主要研究方向为多媒体分析、计算机视觉、人工智能。以第一完成人获2016年北京市科学技术奖一等奖和2020年中国电子学会科技进步奖一等奖,2008年获北京大学宝钢奖教金优秀奖,2017年获北京大学教学优秀奖。主持了863、国家自然基金重点(2项)、北京自然基金联合基金重点、发改委专项等40多个项目。发表TPAMI、IJCV、CVPR、NeurIPS、ICML等ACM/IEEE Trans.和CCF A类论文近200篇,获最佳论文奖2次。参加10届(10年)由美国国家标准与技术研究院(NIST)举办的国际评测TRECVID视频搜索比赛,均获第一名,参赛队伍包括斯坦福大学、卡内基梅隆大学、牛津大学等。成果应用于国家网信办、公安部、国家广播电视总局等重要单位以及华为、腾讯、快手、蔚来、美团、中国电信、中国铁塔等头部企业。担任IEEE TCSVT高级领域编委、IEEE TMM等期刊编委,培养博士生获中国计算机学会、中国电子学会等优博。


欢迎广大师生扫码报名,参与交流!