Daily Tech Briefing
AI 科技速览

每天 5 分钟内学习 AI。获取最新的人工智能新闻,理解其重要性,并学习如何将其应用于您的工作。

AI 快讯
InfoQ AI · 2026/7/29 10:00:00
OPPO 端侧多模态大模型工程化实践|AICon深圳

OPPO 端侧多模态大模型工程化实践|AICon深圳

AI 中文解读
核心亮点:OPPO正在将原本只能在云端运行的大模型“塞进”手机里,让AI在本地就能看懂图片、理解长文本,同时做到又快又省电。 通俗解读:以前手机里的AI特别“笨”,处理复杂任务必须联网求助云端,既慢又费流量。OPPO这次分享的技术,相当于给手机AI装上了“开挂”的训练方法——通过量化感知训练、缓存淘汰等技巧,让大模型在手机芯片上也能快速思考和生成内容,同时还能根据用户的使用习惯“自我进化”,而且全程在本地完成、不泄露隐私。这就像把一位博学的老师直接请进你家,并教会他如何适应你的思考方式。 实际影响:未来你的手机助手不仅能看懂你拍的视频、听懂你的方言,还能在没网络时帮你总结通话记录、规划行程。同时,因为大部分计算都在本地,你的个人数据不会上传云端,隐私更安全。开发者也能更快地为不同手机型号定制AI功能,让新玩法更快出现在你的手机上。
Agent 时代,哪些方向正在成为行业关键变量?50 + 实战案例揭晓答案!模型参数规模不断突破,推理成本持续下降,开源生态日益繁荣。当模型能力逐渐成为行业共识,一个新的问题开始浮现:当人人都能获得强大的模型能力之后,真正的竞争力还剩下什么? 答案正在从模型能力本身,转向围绕模型构建可规模化的智能系统;从单点能力提升,转向系统工程与组织级落地能力。在这一背景下,2026 年 AICon 人工智能开发与应用大会 · 深圳站正式启动。本次大会将于 8 月 21 日—22 日举办,聚焦 AI 基础设施、大模型系统、智能体工程、数据智能、多模态技术与行业落地等关键方向,邀请来自腾讯、阿里、华为、百度、蚂蚁集团等 50 + 头部科技企业技术负责人、科研机构一线专家,系统性分享前沿洞察与实战干货,共同探讨 AI 技术从能力到系统、从实验到生产的真实路径。OPPO 多模态算法专家余席宇博士已确认出席 “大模型效率工程与 Agent 系统实践” 专题,并发表题为《OPPO 端侧多模态大模型工程化实践》的主题分享。随着端侧多模态场景扩展与长上下文需求增长,端侧大模型在 prefill / decoding 时延、工程链路复杂度、模型迭代周期上面临多重约束。本次分享围绕 OPPO 端侧化全栈实践,介绍以 QAT 量化感知训练 为核心的协同训练体系,覆盖稀疏化压缩、长上下文 Cache Eviction、解码加速训练,并结合 QALFT 自动化工程化 与 0 阶端侧训练,打通从模型压缩、编译部署到垂域落地与本地个性化的完整链路。余席宇博士,OPPO 多模态算法专家,长期从事端侧大模型算法研究与工程落地。在大模型量化感知训练、编解码加速等方向具备丰富实践经验,主导/参与多项端侧化关键技术攻关。多年深耕模型端侧化,覆盖感知、理解、推理等跨平台、多业务场景的轻量化模型设计与训练,以及高效率推理部署系统构建。他在本次会议的详细演讲内容如下:演讲提纲:端侧大模型的核心挑战推理效率瓶颈:长上下文场景下,prefill 与 decoding 时延显著上升工程链路复杂:端侧化涉及 训练压缩 → 量化校准 → 编译部署 → 业务集成,链路长、协作成本高模型迭代与个性化难覆盖:端侧模型版本迭代周期长,难以快速响应业务变化,用户个性化需求很难满足2. 多模态大模型端侧化工程实践:全栈链路设计端侧化系统架构:打通模型压缩 → 编解码加速 → 编译部署 → 应用集成 → 端侧个性化迭代的全链路技术栈3. 技术建设模块化 QAT 训练架构将 sparse 训练、Eviction-aware QAT、解码加速训练等能力模块化接入同一训练框架支持从 prefill 到 decoding 的全链路协同优化,而非单点优化QALFT 工程化架构:自动化交付工程化痛点:端侧大模型落地常面临 PTQ 量化 + QALFT 微调 流程复杂、平台差异大、人工环节多QALFT 自动化流水线:覆盖数据准备 → PTQ/QAT → QALFT → 精度校验 → 性能 profiling 等全链路环节,支持 MTK、高通等多硬件平台的统一训练与差异化输出端侧训练:0 阶优化利用稀疏扰动等技术显著提升 0 阶优化性能在隐私约束下,完成用户侧轻量适配,满足用户个性化需求,同时避免重成本端侧模型迭代4. 应用场景与展望应用场景垂域业务交付:端侧模型覆盖 10 余垂域场景业务端侧化 SOP 快速复制:支持端侧 Agent 能力快速迭代未来展望更长上下文下的高效注意力与 KV Cache 管理更低存储与带宽开销,比如低比特量化训练等端侧多模态理解与 Agent 规划能力的统一优化5. 结语端侧大模型的规模化落地,依赖 算法、工程、系统 三者的协同共振:以 QAT 协同训练打通模型压缩、长上下文与解码加速;以 QALFT 自动化缩短跨平台交付周期;以 0 阶端侧训练 满足个性化与隐私需求。面向更长上下文、更低功耗与更高隐私的端侧智能,关键不在单点突破,而在全链路工程化能力的持续升级。这样的技术在实践过程中有哪些痛点?成本高(端侧算力、存储与带宽预算紧张,长上下文推理成本陡增)量化与效果之间的权衡(BPV 极致压缩对 IO 与精度的双重约束)多片商、多平台适配复杂度高Cache Eviction、投机解码与训练目标的对齐难度大听众收益算法融合系统(混合注意力架构 + 量化感知训练 + Cache Eviction + 投机解码端到端协同)端侧训练的高性能实践端侧 Agent 系统架构实践除此之外,本次大会还策划了AI Infra、推理工程与异构计算、超级个体与蜂群智能的共生进化、迈向机器人 AGI 的关键技术与产业实践、Agent 安全:从风险到可控、大模型效率工程与 Agent 系统实践、AI Agent 高价值商业场景实战等 10 个专题论坛,届时将有来自不同行业、不同领域、不同企业的 50+资深专家在现场带来前沿技术洞察和一线实践经验。AICon 全球人工智能开发与应用大会·深圳站,限时 9 折专属优惠,现在报名立减 580,更多详情可扫码或联系票务经理 13269078023 进行咨询。
分享
阅读原文