先学会画再听话,LLaDA-Image双榜第一,碾压开源模型
- 时间:
- 浏览:100
- 来源:深圳市硝子荼弥网络科技有限公司
切莫再迷信"文字描述"了, LLaDA-Image直接用图片去学习视觉先验, 跳过繁杂的图文配对环节, 使得AI生图踏上一条甚为原始也相当高效的路径。
01.纯图片预训练打破传统路径
传统文生图模型在预训练阶段高度依赖caption作为条件, 团队却反其道而行。在6B DiT的预训练和中期训练中, 超过九成的累计样本采用仅影像监督, 把图片直接作为输入目标。
这种设计背后是一种清晰的判断, 就是模型能够先从图像本身建立起视觉生成能力, 后续再靠SFT完成语言对齐。在2.2亿份的累计生成训练样本当中, 文字描述的介入却被推迟到了更为靠后的阶段。
02.从理解到生成的全扩散架构
LLaDA-Image使用理解侧与生成侧拆分的全扩散架构。理解段运用LLaDA2.0-mini, 其为一款总参量化16B、激活参量化1B的混合专家扩散语言模, 承担解析指令且获取视觉条件的工作。
该部分进行生成的是单流的DiT, 图片既作为了条件的来源也是目标完整的样子, 模型得要完成靠局部视觉线索对整张图进行恢复的任务, 这个机制让图像的质量在长程的训练中有了持续的提升。
03.双流接口实现图文协同
dLLM这个负责理解条件的模型主体, 是由三部分构成的,分别是dLLM之外那个连接理解与生成空间的轻量接口, 还有那个真正执行图像生成的单流DiT。进入同一组Transformer模块的, 是文本token、时间信息, 还有在每一层发生直间交互的图像token。
高层语义帮助模型理解指令意图, 像素条件则强化身份、结构与纹理的一致性, 两种信号共享一套权重, 同时承担开放式生成与参考保持编辑, 文生图样本相当于能力回放, 持续巩固各项能力。
04.长程训练的稳定之道
长程监控里运行的团队, 已发现常规的可学习参数归一化层, 会逐步令改变特征尺度, 造成训练时发生漂移;LLaDA—Image将把DiT里面的归一化层, 统一改成没有可习得参的RMSNorm形式, 用固定方式去维持尺度一致性。
这一改动看似微小, 却直接解决了累积尺度偏移问题。配合未经文本配对的图片直接参与吞吐量最大的视觉学习阶段, 高质量配对资源则集中用于后续语言对齐, 形成了灵活且高效的数据组织方式。
05.开源SOTA的验证体系
在Qwen-Image-Bench基准上, LLaDA-Image取得英文与中文双语评测的开源模型第一。该基准包含1000条分层提示词, 考察美学表现、画面质量、提示词对齐、现实保真度、创意生成能力与综合。
本基础版用五十步采样来呈现完备多步生成能力, 推理阶段则只保留生成头, fake-score输出头在训练完结后退出。整套权重同时覆盖双语长文本渲染与指令图编辑, 形成从综合生成到文字能力的规整完整验证闭环。
06.部署友好面向未来
通过同一套推理系统, 基于SGLang Diffusion框架, 用户可部署Base版本并提供适配文生图和图像编辑需求的兼容OpenAI Images API的服务接口, 还可部署Turbo版本以及FP8版本, 详细模型权重与训练代码的开放配方实现同步。
那份报告也明确了下一步发展方向: 扩展域外世界知识、优化长文本编排质量与多区域文件排版稳定性, 并推进原生2K分辨率生成等多项技术落地。从源生图片数据出发循环推演、历经多层次语言对齐处理与全流程统一编辑完善、最终落脚于二至四个运行步长的快速部署模式, 整条技术探索路径中关键节点均已彻底开放。
这种“先瞧后置好学、又对齐所用表述的”思路, 会不会成为新一代文生图模型的核心流程形态? 欢迎在回复区畅谈您的见解和具体想法呗。
猜你喜欢