Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/8/4 09:49:53

千问迎战Kimi、DeepSeek,阿里的胜算在哪?

AI 中文解读
这则新闻最吸引人的地方在于,阿里正面迎战Kimi、DeepSeek等国产对手,甚至直接对标海外最顶尖的模型,亮出了自己最新的王牌——一个参数高达2.4万亿的“超级大脑”。 把技术语言翻译成日常表达,就是阿里给AI装了一个内存更大、更会干活的“超级大脑”。它不仅能聊天,更能自己拆解任务、写代码、甚至像项目经理一样连续盯一个项目长达16天。跑分显示,它在科研和编程上进步神速,部分项目已经超过海外最强模型。但目前仍有短板,比如在复杂的真实软件工程中,它可能“想当然”地改错代码,或者在生成网页时偷懒,需要用户把要求拆得非常细致才肯好好干活。 对普通人来说,最直接的影响是以后用AI写代码、做表格、查资料会越来越顺手,价格也处于中间档位,开发者用得起。不过,它也提醒我们,AI很强但还远没到“甩手掌柜”的程度,关键步骤仍需自己把关。这背后是国产AI的竞争白热化,最终受益的将是普通用户。
(本文作者为 AIX财经,钛媒体经授权发布)文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠8月3日,预热两周后,阿里正式发布Qwen3.8-Max。模型参数规模达到2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研和长周期任务能力。按照官方说法,它不仅可以回答问题,还能调用工具、修改代码,并端到端完成复杂任务。开发者可通过千问AI平台获得Qwen3.8-Max的API服务,每百万Token输入12元、输出36元,在国产头部模型中处于中间价位。阿里还计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。这也意味着,千问一边用Max级别模型冲击能力上限,一边继续通过开源模型扩大开发者生态。7月19日预览版上线时,千问称该模型正以“天”为单位持续进化,并对标Anthropic最强旗舰模型Fable 5,宣称它“可能是除了Fable 5以外最强大的模型”。口号不小,实际成色如何?先看它和Fable 5的基准测试成绩对比。我们挑了两类项目:一类是Qwen3.8-Max反超Fable 5的,一类是差距仍然明显的。可以看出,Qwen3.8-Max确实在科研编程、Agent和办公任务中取得明显进步,部分项目超过海外旗舰模型,但在真实软件工程和复杂环境操作中仍有差距。预览版发布后的两周里,不少开发者参与测试,千问团队也在根据反馈持续调整模型。如今正式版上线,千问会给国产模型的竞争带来变数吗?01.最新模型,强在哪儿、差在哪儿?先看跑分成绩。在官方发布的基准测试中,千问将Fable 5、Opus 4.8和GPT-5.6 Sol等海外旗舰模型作为对比对象。从结果来看,Qwen3.8-Max相较前代提升明显,但还没有做到全面领先。进步最突出的是科研编程和Agent任务。PaperBench要求模型理解论文、搭建实验并复现结果,Qwen3.8-Max从上一代的64.8分升至93分;在Agents’ Last Exam测试中,其任务通过率也从11.8%升至27%。两项成绩同时提高,一定程度上反映出它在代码生成、工具调用、连续执行和反馈修正方面的进步。但在真实软件工程测试中,Qwen3.8-Max还没有追上最强模型。在SWE-bench Pro测试中,Qwen3.8-Max得到67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。这类测试要求模型进入已有代码仓库,完成跨文件修改,并避免引入新问题。Qwen3.8-Max更会解决复杂任务了,但在真实项目中的全局理解和修改稳定性仍是短板。再来看一下第三方榜单成绩。这里我们选择了Arena榜单来进行解读,Arena主要依靠用户盲选投票,更接近模型最终交付给用户的实际体验。其中,Vision Arena主要反映图像理解和视觉问答体验,Text Arena考察通用文本、指令执行和表达质量,Code Arena则更关注模型生成网页的视觉效果、交互和完成度。Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首均相差13分。文本榜单分差相对集中,Qwen3.8-Max虽然排名第五,但仍处于头部区间。在前端代码榜单中,它排名第四,比榜首的Opus 5-Max低37分。官方编程基准成绩较好,与Arena未能登顶并不矛盾,前者主要反映解题和工程任务能力,后者更侧重生成结果的视觉效果、交互完成度和用户偏好。图源 / 千问官网不过,比单项成绩更值得关注的是长周期任务。随着头部模型在单次问答、知识推理和代码生成上的差距越来越小,竞争的重点变成了模型能不能把一项工作持续做完。大模型从业者王楠将长周期任务的难点概括为远距离规划、状态追踪和错误恢复。每一步操作都会改变环境,一次错误的后果可能在数步之后才显现。模型不仅要记得最终目标,还要判断任务进行到了哪里、前一步是否正确,以及失败后应该从哪里重新开始。他介绍,目前行业主要通过任务规划、结构化记忆、多Agent协作等方式解决这些问题。简单来说,就是给模型增加任务管理、质量检查和回滚机制,让长周期任务不再只依赖模型自身,而是由模型和外部工程系统共同完成。千问给出的案例是,Qwen3.8-Max连续运行约16天,从零构建了一个名为oh-my-cli的开源项目。用户反馈、社区实践和模型自测结果先被整理为Issue(任务单),再由Agent领取;代码完成后运行构建、单元测试和端到端测试,验证失败则退回修改。在这套循环中,issue负责记录任务状态,自动测试提供外部反馈,退回修改则对应错误恢复。这说明千问展示的不只是模型能够连续生成代码的能力,更是它能否借助工程系统持续接收任务、验证结果并修正错误的能力。不过,连续运行16天仍不能直接证明长周期能力已经成熟。王楠表示,真正需要验证的是模型能否长期保持目标一致,能否及时发现错误,以及出错后能否恢复。落到实际使用中,还要考察最终功能是否可用、重复执行是否稳定、中途需要多少次人工接管,以及完成任务所需的Token和算力成本。综合来看,Qwen3.8-Max已经进入头部模型的竞争范围,在办公、多模态理解、搜索和部分编程任务提升明显;短板则主要集中在真实代码仓库、复杂工具调用和动态环境中的连续操作。长周期任务可能是Qwen3.8-Max的亮点,但目前最有代表性的证据仍来自官方搭建的项目,它能否在不同任务中以较少的人工介入稳定交付,还需要开发者社区进一步验证。02.跑分和口碑的落差千问系列模型一直不缺少好成绩。5月20日,阿里发布的Qwen3.7-Max曾位列Code Arena第四名,是当时国产模型的第一;在Text Arena也一度排名第六。但在实际使用中,Qwen3.7-Max的口碑并不一致。开发者艾林认为,Qwen3.7-Max对项目的理解比较清晰,在问题分析和输出逻辑上略胜一筹。但在处理复杂代码时,前期看起来进展顺利,检查结果时却会发现漏洞,反而增加了工作量。当时,围绕Qwen3.7-Max的评价主要集中在,它擅长阅读代码、分析问题和提出方案,进入执行阶段后却可能扩大修改范围、改动无关配置,或者没有严格遵守需求。新一代的模型Qwen3.8-Max在上代模型的基础上进行了提升,艾林测试后认为,Qwen3.8-Max在任务拆解、Agent调用、需求理解和UI设计方面均有明显提升,不过与Fable系列仍有距离。独立开发者李默也感受到编程和复杂任务能力的进步,认为Qwen3.8-Max已经摸到了第一梯队的门槛。但在生成交互网站时,模型没有完整实现核心拖动功能,还把HTML标签直接显示在页面上。“Qwen3.8-Max有点懒”,需要把要求拆得非常具体,才能执行到位。相比Qwen3.7-Max,Qwen3.8-Max更会拆解任务,也更容易做出接近成品的页面,但没有完全解决稳定性和交付意识的问题。个体体验有落差,那放到国产模型的竞争里看,千问排在什么水平?一个细节值得注意:上一代发布时,千问的对标名单里还有智谱、月之暗面、深度求索等国内厂商;这一次,对标对象只剩OpenAI和Anthropic的旗舰模型。这并不意味着它已经甩开国产对手,随着Kimi K3和DeepSeek V4的发布,国内竞争只会更激烈。所以,我们也将Qwen3.8-Max与国内近期发布的新模型Kimi K3以及DeepSeek V4 Flash做一组对比。两款模型的参照意义不同:Kimi K3是同期发布的同级旗舰,用来回答“千问掉队了吗”;DeepSeek V4的Pro版尚未发布,目前只有轻量化的V4 Flash有公开成绩,它要回答的是,Qwen3.8-Max比一台便宜得多的轻量模型强多少,多花的钱值不值。先看和Kimi K3的对比。从双方均公布成绩的基准测试来看,Qwen3.8-Max只在工作流智能体任务上超过Kimi K3,其余项目多数落后。差距较小的主要是终端操作和科学推理,说明两者的基础能力处于相近区间。差距较大的则是深度软件工程和前沿工程任务,反映Qwen3.8-Max在复杂代码仓库中的持续执行能力仍有不足。再看和DeepSeek V4 Flash的对比。Qwen3.8-Max在所有可比项目中均占优势,覆盖编程、自动化和工具调用,考虑到双方量级不同,这个结果在预期之内。更值得注意的是差距的幅度:V4 Flash以更小的规模、更低的调用成本,取得了“够用”的成绩。这场对比真正的信息量不在输赢,而在价格。如果轻量模型的能力已经够用,中间价位的旗舰就要证明,多出来的能力值这个差价。从基准成绩来看,真正说明问题的是与Kimi K3的对比:Qwen3.8-Max多数项目落后,但差距有限,算不上掉队;与DeepSeek V4 Flash的对比则更多反映定位差异,它有更高的能力上限,但上限能不能变成用户愿意付的钱,还要看实际交付。开发者的实际感受与跑分互相印证。李默认为,Qwen3.8-Max在长上下文和复杂任务上的提升“实打实”,尤其是编程和智能体协作方面;但代码能力弱于GLM 5.2和Kimi K3,还不能稳定排进第一梯队前列。千问计划开放27B模型权重,可能成为它在中小型开源模型市场上的另一项优势。国内外开发者的关注点也不太一样。海外社交平台的讨论更多集中在前端能力、审美提升,以及与海外头部模型的差距缩小;国内开发者则更务实,分数涨了多少没那么重要,值不值得换掉手里正在用的模型,才是他们关心的问题。因此,如果第一梯队指模型的能力上限,Qwen3.8-Max已经
分享
阅读原文