从感知到决策:AI三大范式转变与全栈框架解析
过去一年里,几乎所有AI从业者都会被同一个问题追问:你们做大模型的,到底怎么赚钱?商汤给出的回答里,藏着一条不那么热闹却值得反复琢磨的线索——AI正在经历三大范式转变,而承接这种转变的,不是某一个更强的模型,而是一套全栈框架。作为长期关注AI产业落地的人,我觉得这套说法比又刷一个榜单分数更有讨论价值。这篇文章就把我理解的三大范式转变和商汤的全栈框架摊开来讲清楚,也会聊聊这套逻辑对开发者、企业和普通用户到底意味着什么。
1. 商汤所说的“三大范式转变”,到底在转什么
1.1 第一重:从“感知理解”到“推理决策”
过去十年,AI的主流能力是“感知理解”。人脸识别判断你是谁,语音识别把你说的字转出来,图像分类告诉你这张图里有一只猫。这套范式本质上是“把物理世界的信号变成结构化标签”,它在安防、手机、互联网等行业已经跑得很成熟。
但商汤指出的转变在于,模型不再满足于“认出猫”,而是要“解释为什么这只猫在窗台上、它接下来可能做什么、我该怎么回应”。从感知到推理决策,是AI从“眼睛和耳朵”升级为“大脑”的过程。这里的核心变量是思维链、推理能力、工具调用这样的新能力。我印象很深的一个例子是:传统视觉模型做车辆检测时只输出一个框,而现在有了大模型的自动驾驶系统,可以把“前方有障碍物、路况湿滑、旁边车道有车”组合成一个完整的驾驶策略判断。感知只是在读数据,推理是在做决策。
1.2 第二重:从“生成内容”到“完成任务”
过去两年,生成式AI把行业的目光全部吸引到了“生成”上。生成一段文案、生成一张图片、生成一段视频,几乎成了AI的全民认知标签。但生成本身不是终点,它只是中间形态。
另一个层面是,AI正在从“内容载体”走向“任务载体”。以前你让AI帮你写一封邮件,它写完就结束了。但在新范式下,AI要自己读取收件历史、判断发件人关系、起草邮件、调用日历确认时间、甚至可以帮你把邮件发出去,并在对方一直没有回复时提醒你跟进。这就是从“生成一个结果”到“完成一个闭环任务”的转变,也正是现在大家常说的AI Agent方向。
商汤把这一重转变讲得很系统:模型不再只是回答问题,而是作为智能体去理解目标、拆解步骤、调用工具、执行操作、验收结果。这意味着AI产品要从“对话式UI”走向“目标驱动的自主执行”。对用户而言,感知上最大的变化是AI从“你问一句它答一句”变成“你交代一件事,它给你一个办成的结果”。
1.3 第三重:从“数字世界”到“物理世界”
生成式AI最擅长的是在数字世界里工作,它接触的是token、像素和波形。但真实世界是三维的、动态的、有物理约束的。商汤明确提出,AI的下一个主战场是物理世界。
智能汽车就是最典型的物理世界AI。车辆要在真实道路环境中实时感知、预测行人意图、规划路径、控制方向盘和油门,任何一个环节出错都会产生真实后果。具身智能、机器人也属于这一重转变——AI不能只在服务器里输出“把杯子拿起来”的字符串,还要在真实空间里规划机械臂轨迹,感知杯子的材质和摩擦力,完成抓取动作。
从数字世界到物理世界,表面上是应用场景的扩展,底层是数据形态、模型架构和评测方式的全面变化。数字世界的输出可以由人去评判好坏,物理世界的输出则要面对真实环境的因果反馈。
1.4 三重转变的递进逻辑
这三重转变不是并列的三个方向,而是一条递进链:从“看懂”到“会说”再到“能干活”。
感知理解解决的是AI能不能理解输入;推理决策解决的是AI能不能像人一样思考路径;生成内容解决的是AI能不能表达输出;完成任务解决的是AI能不能把思考和表达变成实际行动。物理世界则是把这些能力放回到真实约束条件下检验。
理解这条递进链很重要,因为很多公司在思考AI战略时,还停留在第一重转变里——找一个视觉模型做质检,或者接一个对话模型做客服。但实际上,范式转变要求的是系统性升级,而不是单点功能的替换。这也是商汤强调全栈框架的根本原因:范式变了,只换一个零件是不够的。
| 维度 | 旧范式 | 新范式 |
|---|---|---|
| 核心能力 | 感知、分类、识别 | 推理、规划、决策 |
| 输出形态 | 标签、框、分类结果 | 对话、内容、任务结果 |
| 交互方式 | 单轮响应 | 多轮拆解、自主执行 |
| 工作空间 | 数字信号 | 数字世界+物理世界 |
| 典型产品 | 人脸识别、质检系统 | AI Agent、自动驾驶、机器人 |
2. 为什么“全栈框架”是承接范式转变的必然答案
2.1 单点模型撑不起完整价值闭环
如果一家公司只做模型层,它手上最好用的武器是一个强推理能力的大模型。但真实业务需要的远远不止模型:需要算力训练和部署,需要数据来喂给模型,需要一个能对接业务系统的应用层,还需要数据回流机制让模型越用越准。
举个例子,做一个AI医生助手。单点模型只能做到“根据描述给出诊断参考”,但真正要落地到一家医院,你需要把病历数据做脱敏和结构化处理,需要把模型部署进医院的私有化环境,需要跟医院现有的HIS系统打通,需要让医生能对AI的结果做反馈,反馈数据再回流训练模型。这一整条链路缺了任何一环,项目都会停留在Demo阶段。
这就是我在实际项目里反复遇到的困境:模型能力已经不是瓶颈,瓶颈总是出现在算力连接、数据治理、场景集成这些“非模型”环节。商汤强调全栈框架,某种程度上正是看到了这个现实。
2.2 商汤全栈框架的三层结构
商汤的全栈框架可以粗略分成三层:底层是基础设施,中间是模型体系,上层是场景应用。
底层基础设施对应的是商汤大装置(AIDC),把大规模算力、数据平台、训练和推理工具集合成一个可以对外输出的底座。中间层是“日日新”大模型体系,覆盖语言、视觉、多模态,同时也包括端侧的小模型。顶层则是一系列行业解决方案,比如智能汽车领域的绝影、医疗领域的大医、内容生成类的秒画等。
这三层不是简单的“三层楼房”关系,而是互相回馈的:应用层产生真实业务数据,数据回流到模型层做微调和强化学习,模型再通过底层算力高效迭代,最后又回到应用层去改善产品体验。建得越久,这个飞轮的复利效应越明显。
2.3 全栈框架的核心资产:数据闭环
我用一句话概括商汤全栈框架的魂,就是“数据闭环”。很多公司做AI只做到“模型-应用”这一步,输出结果之后就结束了。但真正值钱的AI系统应该在输出之后继续收集反馈,把“好坏对错”转化成训练信号,再进入下一轮迭代。
商汤在智慧城市和智能汽车领域积累的很大一笔财富,其实就是历史数据以及数据标注、数据处理、数据回流的基础设施能力。这些东西不像模型参数那样容易被外界量化,但在业务落地时往往决定成败。我见过太多团队买了一个开源模型,却发现没有高质量数据去让它适配自己的业务场景,最终效果还不如原来那套老掉牙的传统算法。究其原因,不是模型不够强,而是数据闭环没有建立起来。
3. 拆开商汤全栈框架,每一层到底解决什么问题
3.1 大装置:算力不再按“卡”算,而是按“池”算
聊到AI基础设施,很多人直觉上会想到“买多少张GPU”。但商汤大装置的思路是把算力、存储、网络、数据平台统一成一个可调度的大池子,企业不需要关心底层的GPU调度、集群运维、数据流水线这些事情,只需要按需取用算力和平台能力。
这就跟用电一样,早期工厂是自己配发电机,后来是接入电网。AI的基础设施也在经历同样的过程。大装置解决的核心问题是“算力的工业化供给”——有足够多的卡只是第一步,更关键的是调度效率、训练稳定性、数据吞吐这些工程细节。我在实际使用训练集群时踩过很多坑:一个分布式训练任务跑三天,结果因为某几块卡出现通信故障导致整体失败,这种问题在自建算力时排查成本极高。而以平台形式提供的大装置,可以把这类运维问题收敛到基础设施层。
3.2 日日新模型体系:语言、视觉、多模态的协同
模型层是全栈框架里被外界讨论最多的部分。商汤的“日日新”体系覆盖了语言、视觉和多模态能力。相比单纯的大语言模型,商汤在视觉和多模态上的积累是它的差异化所在。这一点也好理解,商汤的基因本身就来自计算机视觉,从人脸识别起家,如今把视觉能力放进生成式大模型体系中,是顺理成章的延展。
多模态不只是把图片和文字放在一个模型里处理,更关键的是模型能不能把不同模态的信息做交叉推理。比如在智能汽车场景里,模型要看摄像头画面、听车外声音、读地图数据,同时用语言理解交通规则,最后给出驾驶决策。这种跨模态推理能力,单靠一个纯文本模型是做不到的。
端云协同也是我觉得值得单独说的点。大模型不可能永远放在云端,很多场景需要低延迟和隐私保护,必须让模型的一部分能力跑在端侧。商汤一直强调端侧小模型与云侧大模型的协同:小模型负责实时响应和本地处理,大模型负责复杂推理和全局理解,两者配合才能覆盖自动驾驶、手机助手这类真实产品。
3.3 应用层:汽车、医疗、办公等典型场景的落地逻辑
应用层决定了全栈框架能不能真正创造商业价值。商汤的应用布局里,我比较关注三条线。
第一条是智能汽车。绝影平台对应的正是第一大范式向第三大范式的迁移——从感知到决策,从数字世界到物理世界。车辆对时延和可靠性的要求比消费互联网高很多,它对全栈能力的要求也最明显:你需要底层算力跑得动多模态模型,需要模型在车规级芯片上做推理,需要大量真实道路数据做迭代。
第二条是医疗。大医这类医疗大模型要解决的核心问题不是“会背医学知识”,而是如何把专业知识与患者的病历、影像、检验指标结合起来,辅助医生做出更准的判断。医疗场景对数据安全极其敏感,医院倾向于私有化部署,这就要求模型本身在端侧和私有化环境里也能高效运行,全栈框架里的部署能力在这里就变得很重要。
第三条是面向办公和创作场景的AI应用。这里商业逻辑比较直接——用AI提升内容生产效率,接API就能做。但这类产品真正拉开差距的地方在于:你能不能通过用户行为数据把内容生成的质量打磨得更好。这又回到了数据闭环。
3.4 全栈框架对AI工程实践的实际影响
对普通开发者和中小团队来说,全栈框架其实提供了一个“站在巨人肩膀上”的选项。以前做AI应用,你首先要雇算法工程师训练模型,其次要考虑训练和推理算力,还要处理数据标注和清洗。但是现在,如果基础设施和模型层都能以服务的方式提供,你就可以把主要精力放在自己最懂的场景层。
我身边有一些团队在做垂直行业的AI应用,他们不再自己微调大模型,而是直接调用商汤这类模型平台提供的能力,把精力集中在业务流程梳理、知识库搭建、Agent逻辑编排这些“业务Know-how”上。从纯工程角度看,这确实是更合理的方式:模型在快速迭代,你投入大量成本训练出来的模型很可能半年后就被新基座模型超越,与其自研基座,不如在动态变化的模型层之上做稳定的业务层。
4. 范式转变对三类人的现实冲击
4.1 AI开发者:从调接口到搭智能体
我接触到的很多开发者正在经历一种岗位定义的变化。过去一两年,大家强调的是提示词工程,想方设法让模型输出更符合预期。但仅仅会写提示词,在今天已经不够了。
范式转变之后,开发者需要掌握的是一套更复杂的工程能力:怎么做检索增强(RAG)把私有知识喂给模型、怎么设计Agent的执行循环让模型能调用工具并处理结果、怎么在模型出错时设计兜底策略、怎么评估和监控自主执行的任务质量。简单说,AI开发者正在从“API调用者”变成“智能体架构师”。
这其实是一个对开发者更友好的变化。因为提示词工程的天花板很明显,大多数时候是在猜模型的脾气;而智能体架构有更多的确定性规则可以做,你可以设计清晰的状态机、异常处理、人工介入节点,让AI的不可控性被封装在可控的框架内。我建议做应用开发的读者尽早往这个方向转,重点是理解工具调用和循环决策这两个概念。
4.2 企业决策者:先看数据闭环,再谈选型
现在很多企业领导选大模型,一上来就问“哪家分数高”。但从范式转变的视角看,单看模型分数是很片面的。你选的不是一个模型,而是一套能够进入你业务流程的AI系统。
判断一家AI供应商能不能用,我觉得更应该看三件事:一是数据安全方案是否成熟,支不支持私有化部署和敏感数据本地处理;二是接口和工具链是否开放,能不能跟你们现有的系统集成;三是供应商愿不愿意一起共建场景,而不是卖完模型就走人。最后这一点在现实中往往最致命,很多采购方拿到模型之后才发现不会用、没人理、没人教,最后项目烂尾。
另外,企业要尽早规划自己的数据策略。范式转变意味着AI的自主性越来越强,它对数据的依赖不是变少,而是变多。高质量、被标注、能回流的数据资产,会和算力一样,成为AI时代的核心生产资料。这件事越早想清楚,后面越主动。
4.3 普通用户:AI从“问答机”变成“办事员”
对普通用户来说,三大范式转变带来的体感变化会非常直观。以前用AI聊天机器人,你问它一个问题,它给你一个答案;你要做一件事,得自己把任务拆成很多个问题,像挤牙膏一样一步步问。而在新范式下,AI会尝试理解你的最终目标,然后拆解任务、调用工具、逐项执行,最后把办好的结果给你——它更像是“办事员”而不是“问答机”。
这种变化会慢慢改变我们的工作习惯。比如起草一份方案,过去你需要自己搭框架、补充细节;以后你可能只需要告诉AI“目标是什么、预算多少、给谁看”,它先把版本做出来,你再审阅调整。这对人的要求反而变高了,因为你需要有更强的“验收能力”和“判断能力”,才知道AI交付的结果里哪些是对的、哪些需要修正。
5. 范式转变的边界:哪些条件不具备时,容易翻车
5.1 算力成本与商业回报的时间差
全栈框架听上去宏大,但它有一个很现实的约束——烧钱。从底层算力的持续投入到模型迭代,再到应用推广,任何一层都需要大资金支持,而且这个投入周期比绝大多数To B业务的回本周期都长。
商汤这些年在AIDC上的投资规模非常大,这种重资产模式能不能持续跑通,取决于有没有足够的客户来消化算力,以及模型能不能在足够多的场景里创造出可量化的商业价值。对于行业内的同行来说,这个逻辑同样适用:你在决定上生成式AI项目之前,要先算清楚投入产出比,而不是因为“别人都在搞”就盲目跟风。
5.2 数据质量是比模型参数更硬的瓶颈
模型参数可以从几百亿涨到几千亿、几万亿,但数据质量不会自动跟着变好。企业实际拥有的数据往往是分散的、脏乱的、没有标注的,甚至因为合规原因根本不能用于训练。我在很多项目的早期阶段体会最深的一件事是:最耗时间的不是调模型,而是清洗数据、梳理字段、统一口径。
随着AI从生成内容走向完成任务甚至物理世界交互,数据的形式也在发生变化:不只是文本和图片,还包括传感器数据、操作轨迹、业务日志和人工反馈。建立一套能持续收集、清洗、标注这些数据的基础设施,难度非常大,但它恰恰是决定一个AI项目能做到多深的隐藏变量。
5.3 全栈不是万能药,多数团队更适合做“生态接驳者”
必须诚实地讲,全栈模式并不是适合所有公司的答案。自建算力、自研基座模型、自己做应用,这条路只适合头部平台型公司玩。对于大多数中小团队和垂直行业公司来说,更务实的路径是“接驳”——把平台型公司提供的大模型能力,接进自己的行业场景,叠加自己的业务理解,做出独特的用户体验。
这就像造车不需要自己炼钢、开餐厅不需要自己种菜。商汤的全栈框架,对生态里的伙伴来说更像是一种公共基础设施,你是可以在上面做开发的。我在给企业的建议里反复讲过一句话:明确自己在产业链上的位置,比盲目追求“自主可控、全套自研”更实际。
5.4 范式转变中的共性难题:评测、安全、可解释性
范式越往前推进,AI系统的风险越大。感知阶段的错误最多是识别不准;生成阶段的错误是内容质量不高;而到了完成任务和物理世界交互阶段,AI的错误会变成真实的行动后果——它可能帮你把邮件发给错误的人,可能在自动驾驶中做出危险决策,可能给出错误的医疗建议。
所以要迎接范式转变,评测体系、安全机制和可解释性也要一起升级。AI不能只被当作一个概率模型看待,它需要具备失败场景识别能力,知道什么时候该说“我不确定”、什么时候必须请求人工介入。商汤这类头部公司在推全栈框架时也一直在强调安全伦理问题,比如大模型内容安全、人脸数据合规等,这些不是表面文章,而是真实产品能不能被社会接受的底线。
评估一个AI系统好不好用,不能只看它答对了多少题,还要看它在不该自作主张的时候有没有停下来。这个判断标准,无论对全栈平台还是对场景应用都适用。
我自己的体会是,商汤这套全栈框架对行业最大的价值,不是让所有人都去买它的算力或模型,而是给了大家一个完整看待AI产业的坐标系。它会逼着你回答三个问题:我的数据在哪里、我的场景在哪里、我的评估机制在哪里。如果这三个问题答不上来,哪怕用了最强的模型,项目也大概率会停在Demo阶段。与其焦虑哪家模型又刷新了榜单,不如先拿一张纸,把自己业务的四个格子填满:算力、数据、模型、场景。哪块是短板,哪块就是你的机会。
更多推荐



所有评论(0)