吴世忠 · 中国工程院
王海峰 · 百度
嘉宾简介:王海峰,国家卓越工程师,百度首席技术官、深度学习技术及应用国家工程研究中心主任。自然语言处理国际学术组织ACL首位华人主席、ACL亚太分会创始主席、ACL Fellow、IEEE Fellow、国际欧亚科学院院士。兼任中国工程师联合体、中国电子学会、中国中文信息学会副理事长。以第一完成人获国家技术发明二等奖、国家科技进步二等奖、中国专利金奖、北京市科技进步一等奖、吴文俊人工智能科技进步特等奖、中国电子学会科技进步一等奖等。获光华工程科技奖、首届全国创新争先奖、首个吴文俊人工智能杰出贡献奖。入选国家百千万人才工程,被授予“有突出贡献中青年专家”称号。享受国务院政府特殊津贴。入选北京学者。
报告简介:多模态统一建模是当前大模型技术发展的前沿趋势之一。本报告解读万亿级原生全模态大模型技术,通过统一自回归框架实现文本、图像、视频与音频的多模态理解与生成。原生全模态大模型基于超稀疏混合专家(MoE)架构,通过模态无关的专家路由及共享专家池,提升跨模态学习与泛化能力;在预训练阶段首创弹性训练范式,能够在内存或时间受限场景中灵活权衡性能、模型大小和推理延迟;后训练阶段引入统一多模态强化学习,提升万亿级超稀疏大模型的收敛稳定性及多模态推理能力。得益于飞桨框架的多维混合并行训练、灵活注意力掩码等技术,模型的训练效率大幅提升。综合各项基准测试表明,原生全模态大模型在多个模态上均表现出强大且均衡的性能。
黄辉 · 澳门大学
嘉宾简介:Full Professor at the University of Macau (UM), where he leads the Natural Language Processing and Chinese–Portuguese Machine Translation Laboratory (NLP2CT Lab). He serves on the boards and committees of CIPS, CCF, and AFNLP, and holds editorial roles with IEEE/ACM TASLP, ACM TALLIP, TACL, and the ACL Rolling Review. His research has earned multiple honors, including the Macao Science and Technology Awards (2012, 2022), the FST Research Excellence Award, and both the Outstanding Academic Staff Incentive (2022) and Teaching Excellence Award (2024) from UM. He has also contributed to major NLP conferences such as ACL, NeurIPS, ICML, IJCAI, AAAI, EMNLP, NAACL, COLING, AACL, and IJCNLP in various program leadership roles.
报告简介:Large Language Models (LLMs) are emerging as promising evaluators for complex linguistic tasks such as machine translation, especially as translation demands become more culturally and contextually nuanced. An analysis comparing foundation models with fine-tuned systems shows that foundation models possess strong multilingual reasoning abilities and can effectively assess translation quality across diverse languages. Building on these insights, the alignment between human and model-based judgments is examined, revealing a persistent gap in consistency and interpretability. To address this, the Large Reasoning Model (LRM) framework is explored as a means of extending reasoning depth and contextual understanding in evaluation. The study further investigates agentic frameworks grounded in MQM principles and generalizes the Model-as-a-Judge concept to the training of reinforcement learning systems. Overall, the findings demonstrate that reasoning-based evaluation frameworks offer a path toward more transparent, scalable, and human-aligned methods for assessing translation and other language tasks.
邱锡鹏 · 复旦大学
嘉宾简介:邱锡鹏,复旦大学教授、上海创智学院院长助理,模思智能创始人,CAAI Fellow,国家杰青获得者,主要研究方向为大模型、智能体以及科学工程等领域中的应用,发表学术论文被引用4万余次,5次获得AI领域高水平会议的最佳/杰出等论文奖,主持研发了MOSS等系列高影响力开源大模型。获得2022年度钱伟长中文信息处理科学技术奖一等奖(第一完成人)、2022-2023年度教育部“高校计算机专业优秀教师奖励计划”,2024年度CCF-ACM青年科技奖(每年仅1人)、2025年度吴文俊人工智能自然科学奖一等奖(第一完成人)。著作《神经网络与深度学习》累计印刷10万余册,被上百家高校作为教材使用。
报告简介:本报告围绕新一代交互范式,系统介绍OpenMOSS团队在视觉、音频与语音生成三个方向上的最新进展。报告首先回顾多模态大模型的发展背景与核心挑战,随后分别介绍 MOSS-VL、MOSS-Audio 和 MOSS-TTS 的模型架构、关键技术与能力表现,包括视频理解、通用音频理解、语音合成等内容。在此基础上,报告进一步讨论多模态模型在实际部署中的推理效率问题,重点分析长视频、长音频和实时语音场景下的显存占用、首包延迟、流式输出和本地推理加速等优化方法。通过模型设计与推理系统协同优化,MOSS 多模态系列模型展示了从研究模型走向高效可用系统的技术路径。
陈恩红 · 中国科学技术大学
嘉宾简介:陈恩红,中国科学技术大学教授,认知智能全国重点实验室副主任。国家杰出青年基金获得者、科技部重点研发计划项目首席科学家、科技部重点领域创新团队负责人、IEEE Fellow、CCF和CAAI会士,教育部计算机类专业教指委委员等。主要研究方向包括人工智能、数据挖掘等,主持科技部重点研发计划、国家基金委重大仪器研制项目、国家基金委区域联合重点项目等多项。谷歌学术引用5万余次,H指数108。获数据挖掘领域国际会议多个最佳论文奖。以第一完成人获教育部自然科学一等奖2次,以及安徽省科技进步一等奖、中国电子学会自然科学一等奖、CCF自然科学一等奖、吴文俊人工智能科技进步一等奖。
报告简介:人机共生系统中,智能体亟需从指令执行者进化为具备心智理论的合作伙伴。然而,现有智能体难以精准理解人类在多模态交互中的隐性意图。本报告聚焦“心智理论”这一核心能力,系统介绍三个层面的探索与实践:通过思维链增强的多模态推理实现意图解析,从碎片化信息中解析用户意图;通过微反应感知与识别技术实现情绪洞察,从面部细微运动中洞察隐藏情绪状态;通过情境感知融合与用户中心交互对齐实现交互对齐,生成适配用户状态与偏好的回应,并在持续人机交互中不断优化。最后,浅谈未来三个重要的研究方向。
张瑞 · 华中科技大学
嘉宾简介:张瑞,华中科技大学计算机学院卓越学者首席教授、澳大利亚研究院未来会士(Future Fellow),谷歌学者奖、大洋洲计算机科学杰出贡献奖获得者,ACM杰出科学家、华中科技大学-OPPO智慧系统联合研究中心主任,连续入选斯坦福大学与 Elsevier 联合发布的《全球前2%顶尖科学家榜单》。主要研究领域为人工智能和大数据,发表国际顶尖会议和期刊论文200多篇,谷歌引用超1万次,h-指数57。取得了一系列具有国际影响力的创新成果和专利,多项发明被国际头部公司如微软、谷歌、华为、美国电信电报公司等广泛采用,产生巨大商业价值。获得数据挖掘领域旗舰会议ACM SIGKDD 2016年最佳论文奖,信息检索领域顶级会议WSDM 2024最佳论文提名奖等。担任国际顶级期刊IEEE TDSC、World Wide Web Journal等的编委;在Web Conference、ACM SIGMOD、AAAI、IEEE ICDE等人工智能和大数据国际会议担任主席和会议组织工作10余次。
报告简介:多模态生成技术是目前人工智能领域的热点,并给我们获取信息的主要途径--推荐和搜索--带来深远的影响。本次汇报将概览面向推荐和信息检索的多模态生成技术。一方面着重介绍个性化多模态生成技术最新的进展,基于大模型把个性化偏好加入多模态生成,让AI学会为用户“量身定制”输出。可用于即时通信、电商、在线广告、游戏、创作辅助等领域,实现个性化背景、人体形态、颜色、表情、角色等内容的生成。另一方面介绍多模态检索增强生成(RAG)技术,探讨在各种不同模态数据的组合作为检索增强生成的输入和输出所带来的新的应用、问题和挑战,并展望该方向广阔的科研空间。
张华平 · 北京理工大学
嘉宾简介:张华平,北京理工大学特聘教授,国家级领军人才(教育部重大人才工程入选者),人工智能学院&计算机学院副院长,数字化与智算技术中心副主任,全国工业和信息化系统先进工作者,研究方向为:多语种智能信息处理、大数据搜索与挖掘、自然语言处理、情报挖掘分析。牵头获得国家科技进步奖二等奖(序1)、国家保密科技奖一等奖(序1)在内的科技奖7项。出版《大数据智能分析》、《自然语言处理与应用》等专著6部。发表ACL、ICML、IJCAI、KDD等顶级论文百余篇。
报告简介:围绕大模型存在的不可控、不可信与不可用三大风险,主要介绍北理工自研的ChatBIT大模型在自主可控、领域可信与灵巧可用方面做的工程探索与应用,围绕角色扮演、多模态可靠推理、推理诊断、事实核查等方面分析团队在KDD、IJCAI等会议最新发表的理论研究成果,探讨我们在多语种认知安全方面的思考。