Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
36氪 AI · 2026/7/29 04:10:36

在大模型的下一阶段议题上,我们找到了一家做持续学习的中国Neo Lab

AI 中文解读
中国团队Mind Lab开创了让AI持续学习的新路径,让大模型能在使用中不断进化,而不需要推倒重来。简单来说,以往的AI模型训练完成后就像一块固定的积木,遇到新任务只能重新搭建,费时费力。而Mind Lab采用了一种叫MoL(LoRA专家协作)的技术,在基础模型上挂载多个小型专家模块,执行不同任务时自动切换最合适的模块。用户用得越久,模型还能积累专属经验,越变越聪明。他们在GLM-5.2基座上仅通过调整4B参数,就让模型性能反超原版,甚至领先GPT 5.4等前沿模型。商业上,预览版上线两周就实现1000万美元年化营收,公司累计融资6000万美元。这项技术意味着未来的AI不会一成不变:你的工作助手、创作工具会随着你的使用习惯持续优化,不再需要频繁更新或重新训练。无论是写代码、做图表还是日常问答,AI都能更快更准地理解你的需求,真正实现“越用越懂你”的体验。
文|王欣逸 编辑|张雨忻 见到Mind Lab创始人陈锴杰,是在北京的晚上9点半,他已经见了一天的投资人。 陈锴杰是一位连续创业者,从杜克大学休学,做过AI互动故事平台MidReal,也推出了Personal Agent应用Macaron(马卡龙),上线当天就登顶了Product Hunt日榜;2025年10月,Mind Lab成立,团队约30余人,Mind Lab创始人Andrew Chen曾和姚顺雨共同发表FireAct论文,团队主要来自xAI、DeepMind、DeepSeek、字节跳动Seed、MIT和清华大学等企业与高校。他们以Neo Lab的形象再度出现在大众的视野里。 他们所押注的方向,与图灵奖得主、强化学习之父Richard Sutton和OpenAI前CTO Mira Murati所强调的持续学习方向,高度一致。 几天前,WAIC 2026首日主论坛上,Sutton发表演讲,强调了下一代AI的核心路线是经验驱动,而静态标注数据模式已触达天花板。DeepSeek近期也把持续学习带进了更多人的视野之中,声称Agent之后需要的解决的问题是持续学习,这也是下一代模型必须具备的能力。 可见,后训练与持续学习,越来越成为下一阶段评判模型能力的关键点。 Mind Lab在上个月发布了Macaron-V1-Preview模型,此后业务迅速被推着往前走:商业化刚开始跑2周,ARR就达到了1000万美金。 Macaron-V1-Preview的构成是:在GLM-5.1上,挂载了5个参数约1B的LoRA专家模块。尽管只是一个预览版的模型,Macaron-V1-Preview在多个Benchmark上的表现也很亮眼,不仅性能反超基座模型GLM-5.1外,还领先GPT 5.4、Claude Opus 4.6等一众模型。而超越基座的能力,就来自于挂载其上的LoRA。 而真正让他们备受关注的,是用MoL(Mixture-of-LoRA)的方式做后训练的路径。在模型执行不同任务时,系统可以根据任务类型,动态切换到最适合的专家模块;在用户长时间的使用中,沉淀下来的数据也能积累出一个专属LoRA,能随着模型的不断调用而持续更新。 Preview版本率先跑通了技术路径、做好了市场验证。紧接着,7月21日,Mind Lab发布并开源了Macaron-V1的正式版本。从官方发布的benchmark来看,Macaron-V1在12项基准测试中拿下了6个SOTA,其余成绩和前沿模型也比较接近。 这一版本有两个模型:旗舰版Venti,是一个基于GLM-5.2做后训练、总参数748B的模型,其中744B来自冻结的GLM-5.2基座���4B来自于Mind Lab自己训练的4组各约1B的LoRA,分别负责Chat、Agent、Coding和生成UI界面四类能力;另一个是面向本地部署的轻量版Tall,是基于Qwen3.6做后训练、总参数50B的模型。两个版本都原生支持200万token上下文。 这也意味着,仅仅改变4B参数,这支团队让GLM-5.2实现了超越自身的能力。 对Mind Lab来说,创业是无数次保持主线与推翻重做的过程。剥去外部的各种喧嚣,在团队内部,一条更为深远的技术路线在不断进化当中——持续学习。 与此同时,一线资本也纷纷押注。成立以来,Mind Lab母公司Mindverse(心洲科技)累计获得6000万美元融资。2026年年初,完成由美团战投领投的近5000万美元A轮融资,元禾璞华、韶音科技、变量资本及老股东追加跟投。历史股东包括蚂蚁集团、红杉中国、源一、真格、高榕等。 经验的智能:让模型越来越懂你 最初的出发点,可以追溯到2023年Mind Lab联合创始人Andrew和姚顺雨合作的一篇FireAct论文。那时他们认为,想要提升Agent的任务表现,与其做提示词工程,不如把相关的数据直接训进模型里。 这是他们押注持续学习和后训练的起点,当时,这还不算一个广受关注的技术路线。“当我们开始做持续学习的时候,我们都不知道它叫持续学习。”陈锴杰说。 已有技术存在的问题是,一个通用大模型难以做好对所有场景的适配,在模型训练结束后,其参数往往是固定的,不会因为具体的场景而改变模型的参数,从头训模型的成本又非常高。 想要让大参数模型在不同垂直场景中执行任务,用一个复杂的Harness当然能做好对场景的适配,但是与此同时的必然结果是,它会消耗很多Token,速度也会很慢,这显然无法从根本上解决问题。 在香农信息论的框架下,强化学习范式中,用表征模型学到的参数量的需求变小,这也意味着,模型参数足够大、足够稀疏的条件下,在同一个垂直领域做强化学习,LoRA的效果是可以达到全参训练的效果的。 所以,无需全参数重训,也能做好对具体场景的适配。 他们率先交出的成果是做到了万亿参数的强化学习。2025年12月,Mind Lab在Kimi K2(一个万亿参数MoE模型)上做到了端到端LoRA强化学习训练,仅用64张H800,实现了接近全参数训练的效果,GPU消耗只有传统全参数RL的10%左右。 当时,一些大厂和创业公司如字节、阿里、DeepSeek、Kimi等也具备万亿参数强化学习的能力,不过,在国内能在万亿参数上跑通LoRA-RL的团队只有Mind Lab一家,而海外唯一能做到的团队是OpenAI前CTO Mira Murati创立的Thinking Machines Lab。 要实现万亿参数强化学习的难点在于,强化学习对基础设施的精度要求很高,如果训练和推理的精度不一致,可能会带来偏差漂移,导致最终的结果没有办法收敛。Mind Lab的解法是设计了一套混合协同并行引擎,整合了张量并行、流水线并行、专家并行和序列并行,让LoRA能在MoE架构上稳定运行。他们还解决了训练与推理不匹配问题,引入了截断重要性采样来修正分布差异。 这一成果的交出,为Mind Lab打响了漂亮的一仗。不过,在陈锴杰看来,团队真正的技术护城河是基础设施。 一年之前,后训练的数据量大概是预训练数据量的十分之一,但如今,很多模型里后训练数据量比预训练的数据量还要大。要做好后训练的基础设施,比预训练更难。 因此,今年1月,他们推出了一个关于LoRA训推的基础设施平台——MinT,它能面向客户提供大模型后训练全流程解决方案。客户可以在这一平台上获取算力支持,也能训练自己的LoRA。MinT能够管理上百万个LoRA模型,在训练、评估、部署和回滚过程中只传输极为轻量的LoRA Adapter,实时加载速度提升了近十倍。 随后,他们更多的把精力放在了模型自进化与持续学习的路线上,并在LoRA的基础上,继续探索MoL(Mixture of Lora,LoRA协作)的可能性。 持续学习,正在从少数人的探索逐渐演变成行业共识。两周前,强化学习之父Sutton亲自下场创业,创立新公司Oak Lab,致力于建立一个能从自身经验中持续学习、实时进化的智能体。智谱创始人唐杰在近日的内部信中也提到,下一步要攻克的关键技术包括记忆、持续学习和自我评判。国内外头部团队相继入局,这条赛道的加速正肉眼可见地提升。 在陈锴杰看来,现阶段,持续学习有四种解决方案: 第一种是,聊天的上下文,模型在对话窗口内反复理解用户意图; 第二种是,External Memory,用RAG做记忆外挂。随着要记的东西越来越多,数据库也以非常快的速度膨胀,模型的解决问题能力直接与数据库检索能力挂钩; 第三种是,Harness以及Loop Engineering,问题在于,随着Harness复杂程度的上升,它可能会消耗很多Token,速度也会变得很慢; 第四种是,直接改模型的参数,以适配应用场景,从底层就把它变成一个垂直的模型,从根本上去改变模型的表现。 LoRA属于第四种解决方案。“明确某个场景需要额外的学习后,我们才会启用LoRA模式。”陈锴杰告诉我们。 通用大模型无法解决具体场景里100%的问题,想要做到完全适配,就需要在任何场景中对模型做垂直的训练。有时候,不同模型之间99%的参数都是可以共享的,但那1%的部分就决定了他们的差异。 基于这个理解,陈锴杰认为要把模型放进不同的经验之中,让它不断去成长。 Mind Lab将这套思路总结为“经验智能”(Experiential Intelligence):模型可以从自己的经历中学习,经验转化为新能力,新能力让它能解决更难的问题,更难的问题又带来更丰富的经验,智能由此成为了一个持续生长的过程。不仅如此,这个过程是自动化的,模型需要不断的自进化、自迭代,这样才能做到真正的“持续学习”。这一方向,也与Sutton的“经验驱动”路线不谋而合。 Macaron-V1-Preview和Macaron-V1的相继推出与市场化验证,也让大众看到了经验智能的可能性。 协作的智能:用Mixture of LoRA突破智能的上限 在陈锴杰看来,后训练正在逐渐成为一个赛道。目前,行业内出现了一批专门承接预训练完成后的模型、聚焦后训练方向的创业公司。其中,有不少玩家聚焦在小模型场景,做垂直细分领域的后训练、数据处理相关工作。 在LoRA路线上,Mind Lab并非孤军奋战,陈锴杰告诉我们,他们的技术和Thinking Machines Lab是高度一致的,尤其是在选取LoRA训练的路线上。TML在其论文《LoRA Without Regret》中也独立印证了同一结论:在足够大的MoE模型
分享
阅读原文