Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
钛媒体 · 2026/7/22 09:15:16

大模型正在“变小”?

AI 中文解读
大模型正在从“拼大小”转向“拼实用”,一场让AI“变小”的轻量化革命正在全球上演。过去,大模型需要庞大的云端算力支撑,依赖网络才能运行;如今,工程师们正想方设法把千亿参数的“超级大脑”塞进手机、汽车和工厂设备里,让智能真正脱离网线,随时随地、无延迟地服务用户。 通俗来说,就是你手机里那个没网就变哑巴的语音助手,未来在电梯、隧道甚至飞机上也能正常对话;汽车在高速上能听懂“有点困,别对着脸吹风”这种复杂指令,并且瞬间执行;工厂里的机械臂不再需要连接中央服务器,自己就能识别产品缺陷——AI变得像随身携带的“特种兵”一样小巧、敏捷又可靠。 这对普通人的影响很实在:隐私更安全,因为敏感数据不用上传云端;响应更即时,开车时0.5秒的延迟可能关乎安全;设备更聪明,哪怕离线也能完成拍照修图、即时翻译等任务。大模型“瘦身”后,真正的智能不再是远在天边的云,而是近在手边的助手。
(本文作者为 万点研究,钛媒体经授权发布)文 | 万点研究,作者 | 程一章WAIC2026刚刚结束,厂商们的大模型好像变了味儿。去年大会上,企业还是比拼模型参数、榜单跑分,今年大家的关注点不再是“模型有多大”,而是“模型能干什么、能不能赚钱”?甚至仔细分辨后惊觉:厂商们都在搞轻量化部署,玩缩小的mini版本了。这是什么缘故?回想一下,你有多久没在手机信号不好的电梯里,对着一个怎么叫都不应的语音助手干瞪眼了?或者,可能就在昨天,你开车进隧道,导航突然变哑巴。或者在飞机上想整理相册,发现那个“一键消除路人”的功能,因为没网而变成了灰色图标。我们似乎已经习惯了,真正的智能,总要依赖那朵远在天边的“云”。但现在,一场静悄悄的革命正在发生。那些曾经庞大到需要一整栋楼、耗费一个水电站发电量才能勉强运行的“超级大脑”——大语言模型、多模态大模型,正在被想尽办法“塞”进手机、汽车、个人电脑,甚至工厂里一只不起眼的机械臂里。研发人员和工程师们正在想尽办法,要让智能脱离网线,脱离信号塔,在手心、在身边,随时随地、毫无延迟地醒来。这好比把一个千亿参数的“猛犸象”,装进一个巴掌大的“冰箱”,还要保证它活着、能思考,狩猎干活比在野外还要精准利索。这不是想象,这是一场正在上演的“科技大戏”。而驱动它的,不是某些个体的一意孤行,而是需求端的真实渴望凝聚成的产业共识。云端的大脑,正在“下凡”2022年底,ChatGPT横空出世,用一首诗、一段代码、一篇论文震惊世界。然后,所有人都记住了它背后那个骇人的事实:它需要一万张英伟达顶级显卡组成的算力集群,海量算力支撑着我们的对话。一直以来,这种模式运行得很好,直到现实世界给了技术人员三个响亮的耳光。这三个耳光,一个比一个疼,一个比一个更接近真相。第一个耳光,来自手机。还记得2023年底到2024年初,手机圈的那场狂欢吗?三星Galaxy S24系列的发布会,最出风头的不再是摄像头像素,而是那个名叫“即圈即搜”的AI功能。你在屏幕上随意画个圈,圈出一个博主背的包、一张图片里的地标、一段文字里的知识点,手机马上告诉你这是什么、在哪买、怎么去。全程无需跳转浏览器,无需输入文字。而在这些功能背后,是高通骁龙和联发科天玑芯片在疯狂宣传可以本地运行的百亿参数大模型。本地运行大模型,有何特殊?对于我们普通人的意义在哪里?又是一次毫无看点的槽点营销?昨晚你拍的那段孩子第一次走路的视频,刚截图的股票账户和银行流水,你和伴侣那些私密火热聊天记录,这些数据,是绝对不能、也绝对不该被上传到任何一粒云端的字节。手机,几乎已经成为我们最贴身的数字器官,也成了倒逼大模型“瘦身”最凶猛、最不妥协的一股力量。然后是汽车。这个耳光,带着呼啸声狂奔而来。想象一个场景:你开着一辆搭载了最新智能座舱系统的电动车,时速120公里,飞驰在高速上。你随口说了一句:“有点困了,给我来点提神的,但别对着脸吹风。”这句话包含了多少层意思?首先是识别出你“困”了,然后是“提神”,大概率还需要联动空调、香氛、音乐。最后是“别对着脸”,这对空调出风口的精确分区控制、需要有着近乎对物理世界常识的理解。这一套组合拳,需要座舱系统在聊天似的对话中理解、并且精确执行,而不是生硬的给出“你好xx,打开空调、打开音乐...”。从技术角度看,如果这句话要原封不动地上传到云端,经过一个千亿大模型思考,再生成指令传回车内,来回的延迟可能超过0.5秒。在办公室里,0.5秒只是弹指一挥间,但在时速120公里的车里,0.5秒,你或许已经开出近15米。当端到端AI大模型开始掌管自动驾驶的实时决策,每一毫秒都流淌着安全的份量,毕竟延迟和可靠性是物理定律,云端再强,也斗不过光速和基站信号。车,必须是长轮子的、能独立思考的移动智能体。在安全的考量下,如何更快、更聪明地思考与行动,它的“大脑”就得长在车子自己身上。第三个耳光,来自工厂。如果有机会去长三角、珠三角那些被戏称为“黑灯工厂(无人工厂)”的地方看看,一定会颠覆你对传统印象中制造业的所有认知。比如这个场景:高速摄像头以每秒上百帧的速度扫过流水线上每一个电子元件,过去,这些海量数据要通过工业以太网汇聚到中央服务器分析,延迟不说,一旦网络抖动或者服务器过载,整条产线就得停下来等,等那个“大脑”给出指令。一等,就是真金白银的损失。现在,边缘计算模块、各式内嵌了AI芯片的工控机里,一个轻量级的视觉检测大模型正在直接运行。它不联网,不依赖任何外部信号,只盯着眼前流水线上的产品,以人类无法企及的速度和精度,做出毫秒级的生死判决:合格、合格、合格……如有微米级划痕,剔除!这就像给每台机器都安上了一个独立的、不会走神、不会抱怨的质检老师傅的灵魂。工业智能的大脑,正在从中央机房,飞速下沉到每一根机械臂、每一个钻头、每一个传感器里。这三个耳光,分别从隐私安全、物理极限、和成本效率三个维度,打出了一个无比清晰的结论:真正的智能,不能只是飘在天上的云,它必须像血液里的氧气一样,流淌在每一个终端设备里,随时待命。这直接催生了一个听起来蛮不讲理的需求:工程师们能不能把那个在云端用成百上千张H100显卡、耗费堪比一个小镇电量的超级大模型,进行一场史无前例的“减肥手术”、做出一个缩小的mini版,然后优雅地、稳定地、强悍地,塞进一台手机、一辆车,或是一个巴掌大的边缘计算盒子里?需求已经在砸门了。门内,一场让大模型“瘦身”的全球竞赛,就此鸣枪。全球“瘦身”大赛:如何给大模型“抽脂”瘦身,不能简单地粗暴手术,那样只会得到一个瘫痪在床的病人。模型玩家们在摸索中迅速达成了一个共识:我们要的不是一个瘦骨嶙峋、风一吹就倒的病秧子,我们要的是一个高度浓缩的、精力爆棚的、肌肉线条分明的“特种兵”。对,我们需要一个被派去执行特定任务的专家。这就是方向。这场没有硝烟的“大戏”,各路门派的打法截然不同。先看美国西海岸,OpenAI和Google这对老冤家,路线各有千秋。OpenAI的策略最直接、也最商业:纵向分级,按质论价。在云端,最强大AI大脑之一GPT-4镇守高地。这个庞然大物负责探索智能的极限,去理解数学猜想、去写十四行诗。但OpenAI很快发现,全球几十亿用户,每天问得最多的问题,其实是“帮我起个炸鸡店的名字”、“把这篇会议纪要总结成三点”、“这段报错的代码怎么改”......让一个日理万机、时薪昂贵的博导,去回答一年级小学生的加减法,这不仅是智力资源的浪费,更是商业模型的灾难。于是,GPT-4o mini来了。它在官宣时毫不避讳自己的定位:我们更有性价比,我们更轻更快。它的响应速度极快,而调用成本断崖式下跌了超过60%。虽然博学程度和老大哥GPT-4没法比,但在处理日常对话、文本摘要、客服问答、代码辅助这类高频、海量的任务上,效率高得惊人,让你几乎感觉不到差别。这就像你有一个诺贝尔奖得主的导师,还有一个聪明绝顶的博士生师兄,日常的困惑、作业难题,师兄三下五除二就给你讲明白了,随叫随到;而导师,则留在每年几次的关键答辩和战略方向把控上发力。这就是分层,这就是效率。而Google走的则是“全尺寸覆盖,软硬一体”的路子,更有“理工男”的浪漫。他们的Gemini模型,从一开始发布,就清晰地划分成了Ultra、Pro、Nano三个版本。野心呼之欲出,就是要像孙悟空的金箍棒一样,能大能小。Ultra对标人类知识边界,负责在各种学术榜单上屠榜;Pro是能干的“中产”,集成在Google Workspace全家桶里,帮你写邮件、做PPT;而最让竞争对手脊背发凉的,是那个最不起眼的Gemini Nano。Gemini Nano被专门设计,甚至可以说是量身定制,用来在Android手机、平板等移动设备上原生运行的。Google的工程师们用了各种极致的蒸馏算法和量化技术,把“检测诈骗短信”、“智能回复建议”、“离线语音转录”这些最核心、最高频的AI能力,压缩成了一个小小的、高效的离线引擎。结果就是,当你用着搭载了Tensor G3芯片的Pixel 8 Pro手机,即便身处飞行模式,它依然能精准地帮你过滤掉垃圾短信,并在你记录语音备忘录时,瞬间给出文字的智能摘要,所有的计算都发生在你手中的这块芯片上,数据没有任何一比特离开过你的设备。但巨头并非无懈可击。视线回到国内,这里的创新汹涌澎湃,甚至演化出了更多元、更接地气的智慧。说到把大模型做小并彻底开源,DeepSeek绕不过去。很多人不知道,这家公司的创始人,背景是量化交易。也许正是这种背景,让他们的基因里就带着对“效率”和“性价比”近乎偏执的贪婪追求。DeepSee
分享
阅读原文