4B小模型吊打GPT-6?这波降维打击,真把大模型脸都打肿了

  • 时间:
  • 浏览:78
  • 来源:深圳市硝子荼弥网络科技有限公司

模型协作迎来新范式

一次颠覆传统AI协作模式的实验正引发业界震动。Mostik团队提出的一种全新模型协作方案, 由小模型负责展现最终答案, 大模型只用内部隐藏状态传递信息, 全程保持缄默。这般“模型闭嘴代笔输出、小模型模式大思考”, 被认为或是彻底改进AI系统的应用方式。

传统多模型协作系统, 包括编程子智能体、模型委员会和路由调度机制, 均依赖将内部计算压缩成文本再实施传递。此种模式不单效率不高, 还丢失了大量具价值的中间推理相关流程。Mostik的方案恰好解决了这一棘手痛点, 让模型间之信息传递效率提升数个数量级, 为AI系统规模化应用开辟全新路径。

隐藏状态揭示未说出口的智慧

可解释性研究的最新进展为此方案提供了理论基础, ICLR 2026发表的论文显示, Qwen-3在写出"accountant"这个词之前的多个token段, 其内部就已经携带着该词的表征, 正是这种表征让模型提前选对冠词"an"而非"a"。模型越是体积庞大, 这种提前规划的能力就越是强大, 其内部状态中携带的"未说出口"种类的信息也越是繁多。

Claude 3.5 Haiku上Anthropic的可解释性团队也观察到了类似现象, 落笔诗该模型之前, 就已确定好了韵脚。名为“J-space”的结构体他们进, 一步发现了模——意任时刻下组维护着未达概一的念, 既不输入是的回声, 也不是对接下个下一token猜的想, 而正好是处当前理的核已在运信息。出中这测从来量揭未示在, 现输内有部反思应和推的过程。

一座桥连接两个冻结的世界

绝大多数模型中, 让一型模型将自身体表下的隐性形态, 经由一个小型且受过专门训练的桥型构造直接传递送予另一型模型的核心方案最为关键。持收到状态的型号仅需对这些内源状态直接挪用拾取就行, 整个流程全过程里零文本生成, 两型模型的配重模块完全处于全然冰冻滞留状态, 该桥型骨架乃是整个系统里唯一经受过刻意训练打磨的部分。这一精巧构想恰巧彻底迂避开打破了各型号模型之间本该固有的语言隔阂堡垒。

在公开演示里, 智谱的GLM-5.2(753B参数)作为发送方, 阿里的Qwen-3.5(4B参数可在手机端运行)作为接收方, 团队选择了它们。自始至终, 大模型不生成任何文字, 只读取问题, 隐匿状态传递出来、穿过桥, 然后停止。GLM-5.2和Qwen-3.5, 被不同团队用不同数据训练而成, 然而它们的内部表征能通过桥完成有效信息传递, 无需对任何一方都进行微调。

算力成本的颠覆性重构

模型运行进程中, 逐一生成token的解码环节最为耗费, 而一次性读取所有输入的预填充环节则划真得多。Mostik的做法恰好让大模型仅做预填充不做解码, 把最贵的任务全转交小模型, 算力耗费因此大幅跌落。从成本视角换算, 要在无需桥的前提下得出同样的成绩, 需要布设一个中等规模的模型, 而桥方案的计算成本仅为这个中等模型的五分之二。

团队还把这套方案和其他标准的模型组合办法展开了对照, 共包有传统的文本接力之分。在全部测试的大模型算力水准上, 桥计划通通都表现得不赖。优势呈现在交接点极早的场景时候最醒目, 在这个状态下文本接力压根没有内容可往出传递, 由于大模型连半点儿文字还没赶写出, 但隐藏状态里已装满了这个模型在处置问题流程中积蓄的总计信息。

性能提升远超预期

实验结果呈现着, 4B小模型在桥的加持中, 填补着它与753B大模型前后之间约50%的性能差距, 自身准确率提高着25%。在更难题目子集里面, 恰是大小模型之间的差距更突出的区域, 提升幅度达到了两倍有佳。随着给大模型配置对应着更多算力, 两项方案在最终过程里面的表现就都会完全趋近大模型自身的水准, 然而桥方案在整个历程里的性能算力权衡都要更见上乘。

Mostik首席科学家菲尔兹奖得主Stanislav Smirnov指出在两个AI模型之间找到数学上的共同基础其实非常困难目前似乎还没有合适的数学语言来描述这件事Smirnov认为让模型表征究竟如何对应如何迁移仍缺一套合适的数学语言但这并不妨碍工程上的突破。

从实验室走向产业应用

传统蒸馏里学生模型里看到的多是教师模型的来自最终输出层的信号, 若桥既能将教师的内部状态同步给学生, 其监督便能更早融入该生成过程中, 早期的各类结果均显示, 学生模型在相同训练预算参数下都可更精准地逼近接近教师模型相关内容, 而且一旦携带某一专业领域能力的模型在应用桥训练之时学习效率会更高, 还有较大概率有机机会保留原本就具有的通用类能力, 倘若这一探讨与研究的方向能够继续成立, 那么为大模型新增对应的新技能大概率就并非总要重新训练整全套的体系化系统了呢。

增加了, 桥在两个模型间一这个新的观察, 发送方的隐藏状态转型结果与接收方的行为都, 可以记录能被。猜头猪有多重,一许多普通人众各自报数取平均值常常能得到比单个专家更贴近真实值的结果伽师新梅产业, 多类AI们各自协作也存在类似可能性的潜力还。但今日前, 是成问题而目前: 合作的成本太高, 让当前沿模型与生物的物理等域的专用性模型要高效配对上, 才更为是个有价值的方方向。桥是否能, 更多跨越多模型、更多项任务以及真实的业务负载之上, 是否能作为够可靠的可观测性工具, 还得是需继续地验证。可起码在这款ARC-AGI3之上, 那座使大模型止住思路再由小模型代为发声的微桥, 已然现出了相当反常的成果。

那种你所觉的让大模型闭嘴的方案, 是否会取代现有的模型协作方式? 欢迎在你的评论区留下看法, 记得要点赞分享本文让你更多人看到!

猜你喜欢

安徽周边自驾游,别纠结了!东方盐湖城才是全家爆笑的仙侠天堂

六、关于安徽周边自驾游及东方盐湖城的常见问题

2026-09-07

500年古猗园,美到窒息!上海人却藏着不说?

在上海市的嘉定区,有一座上海古典园林,你知道是哪一座吗?没错,这就是上海市嘉定区的古猗园。据说从明代开始,古猗园的中心就是围绕它来布置的。为此,古人曾把这里的景观叫做“止舫观鱼”,属于南翔十八景之列。离开戏鹅池景区之后,我向东走了大概50米,就到了古猗园最大的园中园:青清园。古猗园不大,但是很耐看。

2026-09-07

2888元一晚连矿泉水都收费?中产网红景点的体面,被阿那亚撕得粉碎

在我看来,这撕裂的反差根本不是偶然,它刚好撕开了中产网红景点的真面目:你以为花钱买的是松弛与情怀,其实从订房那一刻起,就掉进了一套算得滴水不漏的消费闭环。房间里没有配备免费矿泉水,想喝得单独扫码购买。元,一家三口吃两顿饭加下午茶,一千元就没了,再看个展、参加个体验项目,又是几百元。

2026-09-07

9月机票暴跌!华为花瓣地图一键生成川西攻略,比闺蜜还贴心

用户确定好行程一键导航即可出发,省去了来回切换App一边看攻略、一边在地图查地点或导航的繁琐步骤。在最新版本的花瓣地图中,用户也可以切换至“发现”页面,各种图层帮你探索更多宝藏去处,点进专题页面内,能看到不同主题方向的收录指南、周边新鲜活动,瞬间Get出游新思路。

2026-09-07

排队等船?别傻了!边逛公园边等,这才是真·神仙操作

线上排队,边逛边等船”工作人员介绍,线上排队期间,游客可以在公园各处逛逛,排到时码头会有叫号提示,手机短信也会弹出提醒:“您排队的游船即将就位,请前往码头登船。“游客不用在码头干等,可以边逛公园边等船,排到了再过来,体验感好多了。

2026-09-07