玉兰-LLaDA:扩散语言大模型
成果介绍:以ChatGPT、DepSeek为代表的大语言模型均传统自回归范式:从左到右、文字接龙式生成文本。高瓴人工智能学院具有前瞻性地探索新的语言生成范式——扩散语言模型。学院于2025年2月发布全球首个80亿参数扩散语言模型LLaDA,挑战自回归模型不可替代的领域共识。LLaDA 通过扩散采样的方式而非从左到右的方式生成连贯对话,效果媲美同规模代表性自回归模型并突破单向推理瓶颈,引起了国际学术界、工业界和开发者的广泛关注。LLaDA在国内外社交媒体被广泛讨论,单帖浏览量破40万。开源模型单月全球下载量超过17万次。LLaDA第一次验证了非自回归范式的可行性,加深了领域对生成式人工智能的理解,未来还有望结合Sora等视频扩散模型,统一多模态生成式人工智能的基本范式。
