Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
量子位 · 2026/8/3 05:41:02
刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude

AI 中文解读
阿里刚刚发布了新一代大模型Qwen3.8-Max,总参数达2.4万亿,一举冲进全球第一梯队,编程、专业工作、长程任务和多模态分析等能力直逼甚至部分超越Claude和GPT系列。最吸引人的是,它不仅性能能打,价格还特别亲民,国内输入百万Tokens只要12元,输出36元,比国际主流模型便宜一大截。通俗点说,就是以前只有高端玩家才用得起的顶级AI,现在普通人和小公司也都能轻松上手。实际影响很明显:程序员可以用它自动完成复杂项目,比如从零搭建一个网页或应用;白领能靠它快速处理几百份法律文档、生成产品原型;甚至普通人只需一句话,它就能帮你做出可交互的网页或小游戏。网友实测反馈普遍很高,有人用它复刻了《愤怒的小鸟》,还有人称赞它“便宜大碗”。可以说,Qwen3.8-Max让强大、实惠的AI真正走进了普通人的工作和生活。
首页 资讯 智能车 智库 活动 MEET大会 AIGC 扫码关注量子位 // $('.biaojiwei').click(function(){ $('.biaojiwei').click(function(event){ event.stopPropagation(); $('#pophead').show(); }) $('.weixin_pop').click(function(){ $('.weixin_pop').hide(); }) // }) < img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 刚刚,阿里Qwen3.8-Max来了!冲进全球第一梯队,模型表现直逼Claude 梦瑶 2026-08-03 13:41:02 来源:量子位 编程、专业工作、长程任务、多模态分析统统梭哈 梦瑶 发自 凹非寺 量子位 | 公众号 QbitAI 不er?你告诉我现在搁哪儿还有便宜还好用的模型啊……(真心发问.jpg) 说时迟那时快,友友们,这不就来了嘛!!! 就在刚刚,阿里巴巴突袭发布新一代基座大模型Qwen3.8-Max。 用四个字概括就是:「能打」「便宜」。 总参数量达到2.4万亿,在编程、专业工作、长程任务、多模态智能体等场景上的表现直接next level。 就在今天最新放榜的权威第三方榜单Arena中,Qwen3.8-Max更是一路冲到全球大模型第一梯队,表现直逼Anthropic的Claude系列模型: △Text Arena文本能力榜单,包含数学、代码、创业写作等领域 在编程表现上,Qwen3.8-Max甚至还超过了Claude Opus 5和Fable 5的High版本,确实有亿点不简单??? △编程能力(前端)榜单,考察多步骤推理及工具调用的编程智能体能力等 性能能打是一方面,关键是吧,人家连价格也一块打了下来—— 国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,输入与输出的国际价格仅为Opus5的40%与24%……真·便宜大碗。 性价比高,能力还强,那还了得? 瞧嘛,此前抢先体验Qwen3.8-Max预览版的网友,已经火速交上第一批实!测!反!馈! 看下面这位老哥,直接用Qwen3.8-Max复刻了一版《愤怒的小鸟》,直言价格很合适,一周使用下来额度消耗不到九成,赞! 还有网友只用一条提示词,就用Qwen3.8-Max搭出了一个完整、可交互的开发者作品集,最后给出的评价也相当言简意赅:《夯》! 哦对了,还有一堆网友们,已经针对模型「超能打」的表现开始聊得火热朝天了! 下面这位友友表示,已经迫不及待想把Qwen3.8-Max用起来了,顺便还不忘祝A社、O社IPO好运~(夺笋啊) 下面这位网友还提到,Qwen3.8-Max基准测试都把5.6-Sol给KO了,大家对A社和OpenAI的期待恐怕也得跟着变—— 毕竟又贵又闭源,门槛确实摆在那儿…… 还有朋友实测后感慨,Qwen3.8-Max的表现甚至超过了Fable 5,这波能力属实有点超出预期了奥! 真·有口皆碑了也是。 既然,Qwen3.8-Max来都来了,我们也直接实测一波,看看模型到底能不能打! 编程、专业工作、长程任务、多模态分析统统梭哈! 说实话,阿里Qwen的前几代模型我几乎是发了一个测一个,零零散散测下来,最大的感受就是—— 确实夯,也确实能打…… 而这次到了Qwen3.8-Max,感觉又不一样了,因为面对真实世界里的复杂问题,这模型已经能一路拆解、执行,直到交付最终成果了。 在具体评测表现中,Qwen3.8-Max在科研复现、多模态理解、长视频和电脑操作多项超越GPT-5.6、Opus 4.8与Fable 5,在编程、终端Agent和专业工作也稳居行业头部—— 贴心的我,也帮大家浅浅总结了一下Qwen3.8-Max的亮点能力,让大家一睹为快! 编程能力:能把复杂任务端到端地自主交付,理解需求、搭建工程、运行实验、检查结果、继续优化全流程梭哈。官方披露的一个极端案例是,它能从一个空文件夹出发、在无人干预下自主推进十多天,最终交付一个真实可用的完整项目。 长线程任务:具备系统级自主规划与执行能力,在数千轮超长程交互里也不迷失目标。 专业工作:能一次交付需要返修3到5轮的APP原型,也能在一小时内处理数百份法律文档,完成上千个条款标注。 多模态智能体:几百页的复杂材料、上百小时的视频内容都能消化,还能顺手整理成直接可用的成果。 我:如此之能干,如此之务实,还有这好事儿?那我可就直接狠狠一个大测特测!!! Vibe一下,编程能力大考验 既然,Qwen3.8-Max如此擅长AI Coding,那我们直接上来就考察一下这模型的「编程本事」。 好巧不巧的是,最近的我正愁每周例会上该怎么把这一周的AI热点捋清楚,做成一份能给领导交差的分享。 这下好了,我索性把这事儿交给Qwen3.8-Max~(鬼点子生成中) 不过,光用一句提示词搭个网页,多少有点太简单了,于是乎—— 我直接化身产品经理,喂给了Qwen3.8-Max整整一大页产品需求,让它「从零」开发一个可运行的AI资讯网页。 在具体需求上,我不仅明确要求了网页需要具备的核心功能,还对数据、页面体验、技术约束、验收标准、交付要求进行了明确约束,主打一个狠狠刁难!!! 大概过了5分钟。 我的这位产品经理Qwen3.8-Max,就直接给我端上来了一份接近正式产品交付水准的全链路解决成果—— 整个交付过程页面我从头拉到尾,说实话,确实有点让我震惊。 需求拆解、技术选型、项目结构、功能实现,该有的环节一个没落,完全是一套真实项目从开发到交付的完整流程。 然后,我再定眼一看,发现Qwen3.8-Max还专门整理了一份「问题与解决记录」,开发过程中碰到了什么报错、问题出在哪儿、最后怎么修好的,它全给列得明明白白。 而作为提出需求的那个人,我真的全程一次手都没插,甚至直到看见这份记录,我才知道中间居然还冒出过这么多麻烦??? 不是我说,这模型是真·有问题自己解决啊,Qwen3.8-Max:事情交给我您放心哈~ 此外,在检查模型作业的过程中,我又发现了点我属实没料到的东西…… Qwen3.8-Max在交付前,还给整个项目来了一轮正儿八经的「功能验收」???? 从安装依赖、本地启动,到生产构建和预览,它把项目能不能跑起来逐项过了一遍。 甚至,连数据量、分类覆盖范围、搜索清空后的页面恢复,它都一项项列进了验收清单,最后统一打上「通过」。 别说,整个从零搭建项目的全过程真有点真实工程内味儿了,be like: 真的就几分钟。 我写下的一整页产品需求,就这么被Qwen3.8-Max直接交付成了一个能跑的项目。 我忐忑地打开Qwen3.8-Max给我的代码跑了一下网页,没有报错,也没有哪项功能突然掉链子。 页面布局、资讯分类、搜索、排序、收藏……几乎和需求文档里写的一模一样,交互也没有问题, 原本可能需要我自己一轮轮试错、查报错、补功能、跑测试的工程过程,就这么全让模型一个人干了。 我只想说,Qwen3.8-Max,你这是真·端到端啊…… 长长长长文本分析也来探一探 能搞定编程项目的全流程交付,确实不亿般。 But,在日常学习工作场景中,我们很多时候未必有那么多需要Coding的场合。 很多时候真正想让我们口吐芬芳的,反倒是一些《蛮基础》的工作场景,就比如啊——长文本分析。(doge) 估计有友友该说了,这有啥难的啊,直接喂给AI资料,然后坐享其成得了呗~ 单纯的文本分析当然不难,but,让AI对几十页复杂文档进行「交叉分析」那事情就不一样了。 之前我就喂给过GPT一份包含几十页的技术文档,让AI总结内容还行,但涉及跨章节、细节对比的事儿就宕机了… 于是灵机一动的我,这回也给Qwen3.8-Max上点难度。 这次我喂给它的是AI大神卡帕西参与撰写的一篇几十页的
分享
阅读原文