勷勤数学•专家报告-陈天翔

勷勤数学•专家报告


题      目:从医学视觉到多模态大模型:高效感知与推理方法


报  告  人: 陈天翔 博士  (邀请人:王伟彬)

                                              阿里云


时      间: 10月31日  14:00-15:00

          

地     点:数科院西楼111


报告人简介:

          陈天翔于2026 年在中国科学技术大学网络空间安全学院获得博士学位。现任阿里云算法专家,并在复旦大学与阿里云联合博士后培养项目中从事企业博士后研究工作,合作导师为复旦NLP组的邱锡鹏教授。主要研究方向包括多模态大语言模型 (MLLM)、大语言模型 (LLM)、智能体强化学习 (Agentic RL) 以及医疗人工智能 (Medical AI)。已在 IEEE TPAMI、IEEE TIP、IEEE TMI、IEEE TCSVT、IEEE TGRS、Nature Scientific Data、AAAI、EMNLP、IJCAI 及 ACM MM 等顶级学术期刊与会议上发表第一作者论文 10 余篇,其中多篇入选ESI高被引或会议口头报告。入选了包括“阿里星”、“腾讯青云计划”、“蚂蚁星Plan-A”在内的多项互联网大厂人才计划,荣获中国科学院院长特别奖。



摘      要:

         如何在有限的数据与计算资源下,准确捕捉关键视觉信息,是医学人工智能与多模态大模型研究中的重要问题。本报告围绕“关键细节保留与高效智能计算”这一主线,介绍我们在医学图像分割、手术视频理解和多模态大模型推理加速方面的三项研究工作。

首先,面向医学图像分割中全局依赖与局部细节难以兼顾的问题,介绍高效分割架构 Zig-RiR。该方法通过嵌套式 RWKV 结构与 Zigzag 扫描机制,在保持空间连续性的同时协同建模全局与局部特征,实现兼顾精度与效率的二维、三维医学图像分割。 其次,面向手术视频中的细粒度动作识别,介绍腹腔镜手术视频数据集 LapSurg-230K,以及物理波传播启发的无注意力模型 WaveR,探讨如何通过物理归纳偏置保留器械与动作的高频视觉线索,增强有限训练数据条件下的时空建模能力。最后,将讨论拓展至通用多模态大模型,介绍无需额外训练的推理加速框架 SPIDER,通过多层语义视觉 token 剪枝与自适应子层跳过,联合减少视觉输入冗余和模型计算冗余,在保留关键语义信息的同时降低推理开销。

报告将结合上述研究,讨论任务相关的结构设计、物理先验与自适应计算之间的联系,并展望高效医学视觉模型与多模态大模型相结合的研究方向,以及面向医疗应用的泛化能力、可靠性与部署挑战。


       


          欢迎老师、同学们参加、交流!