大语言模型与可解释性
探索模型的内部机制,研究推理、上下文学习与可靠性。
ABOUT ME 个人简介
我是黄镇,现任同济大学工程智能研究院助理教授。长期从事大语言模型、多模态大模型和计算机视觉等方向的研究,关注模型的可解释性及其在工程中的应用。
我于中国科学技术大学获得本科及博士学位,随后在阿里云与中国科学技术大学开展博士后研究。曾任阿里巴巴通义实验室算法专家,参与 Qwen 模型研发,积累了从前沿研究到产业落地的经验。
曾带领团队获得 Hugging Face 阿拉伯语大语言模型榜单与日语大语言模型榜单第一;以第一作者或指导学生在 ICML、ICLR、ICCV、CVPR、ACL 等人工智能顶级会议发表论文 10 余篇。
欢迎对人工智能研究充满好奇的同学交流。
我们鼓励兼具学术价值与产业影响力的研究。 了解培养理念 →
探索模型的内部机制,研究推理、上下文学习与可靠性。
研究视觉与语言的组合理解、视觉证据及模型幻觉问题。
关注大语言模型智能体、具身智能,以及人工智能在工程中的应用。
默认展示最近 5 篇 · Zhen Huang 为本人
以语言切换为切入点,探索大语言模型多语言生成的内部机制。
通过跨模态掩码组合概念建模,增强视觉语言模型对属性、关系与组合结构的理解。
揭示多语言多跳推理中的共享回路,并通过针对性对齐改善跨语言推理。
从输入与标签映射的视角理解并改进大语言模型的上下文学习。
通过可解释的组合归因增强,提高视觉语言模型对属性和关系的理解。
结合知识继承与自主探索,提升学生网络的表征能力。
以时空 Inception 图卷积建模骨架序列,实现人体动作识别。
博士后
研究方向:大语言模型和多模态模型的可解释性
信息科学技术学院 · 信息与通信工程 · 博士
研究方向:深度学习、计算机视觉 · 导师:田新梅
少年班学院 · 应用物理 · 本科
助理教授
算法专家
参与 Qwen 模型研发,开展大语言模型、多模态大模型与可解释性研究。
FOR STUDENTS
课题组聚焦人工智能前沿方向,注重学生科研能力培养,鼓励开展兼具学术价值和产业影响力的研究。期待同学们夯实基础,在实践中锻炼提出问题、解决问题和持续创新的能力。
对于有志于继续深造、发表高水平论文,或进入国内外知名科技企业发展的同学,我们将提供前沿课题和指导支持。希望大家在开放协作中成长,做出经得起学术检验、也能够服务产业实践的成果。