一、企业数字人正在从“会说”走向“会做”
企业引入数字人,起点通常很朴素:让屏幕里的形象能开口说话、能应答访客。可一旦把它推到业务一线,落差立刻显现——客户问的是“这笔订单为什么还没出库”“这台设备的报警代码意味着什么”,而数字人只能回放一段预设话术。数商云在数字人智能体搭建开发项目里反复验证同一个判断:形象决定用户愿不愿意多看一眼,大模型决定用户愿不愿意继续用下去。把大模型能力嵌进对话与业务流程,让自主交互成为可能,实质是把数字人从内容播放器改造成能理解、能判断、能调用系统、能收尾任务的数字员工。
(一)展示型数字人的能力天花板
把早期数字人的问题摊开看,局限集中在几个地方。
1. 内容依赖预设,覆盖不了真实提问
话术由人工穷举,用户换一种说法、多绕一层条件,匹配就会失败,兜底回答往往是“抱歉,我没听懂”,随后把用户推回人工。
2. 交互以单轮为主,上下文断裂
用户前面交代过身份、订单号、设备型号,后面再问就要重复一遍。表面看是体验问题,实质是缺少会话状态管理。
3. 与业务系统割裂,只能告知不能办理
说得出政策,却查不了余额;念得完流程,却提交不了工单。数字人停在信息展示层,业务价值无从体现。
(二)大模型补上的恰恰是“理解”与“行动”
大模型带来两处变化。其一是语言理解的泛化能力,用户不必迁就系统的说法,同义表达、口音差异、口语化追问都能落到同一个意图上。其二是把自然语言映射为可执行动作的能力,也就是常说的工具调用:识别出用户想查、想办、想约、想改,再决定调用哪个接口、传什么参数、失败后如何退让。前者解决听得懂,后者解决办得成。
(三)自主交互不等于放任自流
企业场景里的自主,是任务边界内的自主,不是没有约束的自由发挥。数字人可以在既定业务范围内自行规划步骤、选择工具、组织语言,但权限范围、话术底线、可触达的数据必须由系统预先划定。数商云在设计数字人智能体时,会把能做什么、不能做什么、做不了转给谁写成明确的规则与配置,让自主能力落在可控的轨道上。
二、数商云数字人智能体的分层架构
一套能上线的数字人智能体,通常不是单一模型或单一形象工具能撑起来的,而是若干层能力叠加的结果。数商云在搭建开发中把它拆成形象交互、语音多模态、大模型推理、知识记忆、业务工具、安全运营等层次,分层的好处是每一层都能独立替换与升级。
(一)形象与驱动层
形象可以是真人克隆的二维形象,也可以是三维超写实或风格化角色,选择依据是场景调性与算力条件。驱动层面关注口型与语音的对齐、表情与语义的匹配、待机与思考状态的过渡。这一层的目标不是好看,而是让用户在几个来回之后自然进入对话,不再刻意观察形象本身。数商云支持基于企业品牌资产定制形象,也支持在已有素材上做轻量化驱动。
(二)语音与多模态交互层
语音识别负责把话听准,在噪声环境、专业术语、多人同时说话时尤其考验功底;语音合成负责把话说自然,包括停顿、重音与情绪。数字人场景对实时性要求苛刻,识别、推理、合成需要流水线式衔接,任何一环卡顿都会让对话变得别扭。多模态输入还包括图像与文档,比如用户把设备铭牌、票据、合同拍照上传,数字人要先看懂再作答。
(三)大模型接入与推理层
数商云不绑定单一模型。通用大模型在开放域理解和表达上更成熟,开源模型在数据不出域的诉求下更有优势,行业微调模型在专业术语与固定句式上更稳定。实际项目里常见的是多模型协同:简单意图由小参数模型或规则处理,复杂推理交给大模型,敏感任务走专用模型。接入层统一封装提示词模板、参数配置与调用日志,换模型相当于换适配器,业务侧不必重写。
(四)知识与记忆层
知识层解决答案从哪来,记忆层解决它记不记得住。企业资料以文档、表格、工单、聊天记录等形式散落各处,需要经过解析、切片、向量化与索引,才能被检索增强生成调用。记忆分短期与长期:短期保存当前会话的上下文,长期沉淀用户偏好、历史诉求与办理过的业务,让数字人下一次接触时不必从零开始。
(五)工具与业务集成层
这是数字人能否产生业务价值的分水岭。查询类、单据类、流程类接口需要按标准化方式注册为智能体可调用的工具,并明确入参、出参、鉴权与幂等要求。数商云在项目中通常先做接口盘点,把可开放、需做字段级管控、禁止触达的接口分类,再按优先级逐步接入,避免为追求功能齐全而放大风险敞口。
(六)安全与运营层
内容安全、权限校验、越权拦截、对话留痕、效果看板,这些能力平时不显眼,却决定项目能走多远。运营层还需支持知识更新、话术调整与案例回流,让数字人随业务变化持续迭代,而不是上线即冻结。
三、数字人智能体搭建开发的关键环节
把架构落到交付,中间要走一串具体动作。数商云的项目节奏从场景定义开始,到上线运营收尾,每个环节都有明确的产出物。
(一)场景选型与任务边界定义
不是所有场景都值得用数字人智能体。判断标准可以归结为几条:提问是否高频、意图是否收敛、答案是否有据可依、任务是否能闭环。高频意味着收益可累积,意图收敛意味着可控,有据可依意味着知识库兜得住,能闭环意味着价值可被业务感知。选定场景后,还要把任务边界写成清单——哪些能答、哪些只能引导、哪些必须转人工。
(二)形象、声音与人格设定
形象要与品牌调性一致,声音要考虑使用环境的噪声与私密性,人格设定则决定说话方式:是严谨克制的业务顾问,还是亲和耐心的服务人员。人格不是文案装饰,它会影响提示词策略、回复长度与追问方式,也会影响用户在情绪对抗时是否愿意继续沟通。
(三)知识工程:把资料变成可检索的知识
这是最容易被低估的环节。原始材料往往格式混乱、版本交叉、口径不一,直接切片入库只会让模型学到矛盾信息。数商云的做法是先做知识梳理:确认权威来源、合并重复条目、标注时效与适用范围,再按业务对象组织成结构化的知识单元。检索环节配合关键词与向量的混合召回,并为答案附上出处,方便人工复核。
(四)智能体编排:从意图到执行
编排层要回答的是:这句话背后是什么意图,需要哪些信息,缺信息时怎么问,拿到信息后调用什么工具,工具失败怎么办。复杂业务往往需要多步协作,比如先核身份、再查单据、再判断规则、最后生成答复,中途还要处理用户打断与新诉求插入。数商云支持把这类流程画成可配置的工作流,让业务人员看懂并参与调整,而不是全部埋在代码里。
(五)评测与调优
评测不能只看答得像不像人。更实用的口径包括任务完成情况、答案依据是否可靠、无效追问次数、错误兜底情况、用户是否需要人工接管。测试集要从真实历史对话里抽取,覆盖长尾问法和容易混淆的近似问题。调优手段按性价比排序:先改提示词与检索策略,再补知识,最后才考虑微调。
(六)部署形态与持续运维
部署可以放在公有云,也可以私有化或混合部署,取决于数据敏感度、算力条件与运维能力。上线之后,监控要覆盖响应时延、调用失败、异常会话与知识命中情况,运营侧则需要固定的知识更新与话术复核机制。
四、大模型驱动的自主交互:关键技术要点
前面讲的是工程流程,这里聚焦让自主交互真正成立的技术机制。
(一)意图理解与任务拆解
用户的一句话里常混着多个诉求,比如“帮我看看最近的账单,顺便把发票寄到新地址”。系统需要先拆出查询与变更等不同任务,判断依赖关系,再决定执行顺序与确认方式。拆解能力决定数字人能否处理真实业务,而不是只应付单点提问。
(二)检索增强与引用溯源
大模型的通识能力可以支撑寒暄与过渡,但企业场景的答案必须来自企业。检索增强把外部知识注入生成过程,让回答有依据;引用溯源把依据明确标出来,既方便用户核对,也方便运营者定位知识缺口。检索质量决定了回答质量的上限。
(三)工具调用与业务闭环
工具调用是自主交互的关键一跳。模型需要在合适的时机选择正确的工具、填对参数,并理解返回结果。工程上要处理失败与歧义:接口超时是否重试,参数缺失是否追问,返回多义时是否让用户确认。这些细节做扎实,数字人才算真正接入业务。
(四)记忆机制与个性化
会话记忆让多轮对话保持连贯,长期记忆让服务具备延续性。记忆的使用要有边界:记住偏好与历史诉求是服务,记住与业务无关的隐私信息则是风险。数商云在设计中会对记忆内容分类管理,并允许用户查看与清除。
(五)实时交互与打断处理
真人对话允许打断、抢话、临时改口。数字人如果只能在对方说完后回应,节奏就会显得生硬。全双工式的交互要求系统在播报的同时持续监听,识别到打断信号后及时收口,并保留被打断前的上下文。这对语音链路的时延控制提出了更高要求。
(六)可控性与安全护栏
自主能力越强,护栏越重要。常见的护栏包括敏感话题拒答与转人工、输出格式约束、越权操作的再次确认、金额与条款类信息的强制核对、全量对话留痕。护栏不是削弱智能,而是让智能可以被放心使用。
五、数字人智能体在企业中的典型落地场景
(一)某制造行业头部集团:设备运维与工艺知识助手
该集团一线人员分散在多个基地,设备型号多、工艺版本杂,老师傅的经验难以复制。项目把设备手册、故障处理记录、工艺变更通知整理成知识库,再由智能体接入工单系统。现场人员用语音描述现象,数字人给出排查步骤并可直接创建维修工单;遇到知识库未覆盖的疑难问题,自动转给技术专家,处理过程再回流成新知识。上线后,一线问题在现场就被解决的比例明显提高,专家被重复咨询占用的时间大幅下降。
(二)某金融行业头部企业:网点服务与内部合规问答
面向客户的部分承担业务咨询与单据指引,面向内部的部分承担制度查询与合规问答。金融场景对准确性要求高,因此数字人的回答坚持有据可查,涉及产品条款、费率规则的内容全部引用制度原文,超出范围的一律引导至人工柜面。内部问答则帮助客户经理快速定位制度条文,减少在多个系统之间来回翻找。
(三)某零售行业头部企业:门店导购与培训陪练
零售门店人员流动快,产品知识更新频繁。该项目把商品卖点、促销规则、常见异议应对做成可对话的知识体系,导购在接待间隙用移动端数字人快速确认口径;培训场景中,数字人扮演不同类型的顾客,与新员工做角色演练,并在结束后给出反馈。培训周期缩短,新人独立上岗所需的带教时间明显减少。
(四)某能源行业头部集团:园区大厅接待与业务导办
大厅场景对形象和引导能力要求高。数字人承担访客接待、会议室指引、事项告知与预约登记,并在屏幕上完成身份核验后的流程引导。这类场景交互轮次不多,但对响应速度和形象一致性要求严格,是数字人智能体较容易体现服务质量的场景。
六、企业推进数字人智能体项目的落地建议
(一)从高频、边界清晰的场景起步
贪大求全是这类项目最常见的失败原因。与其做一个什么都能聊的通用助手,不如先把一个高频、边界清晰的场景做透,跑通知识、工具、评估、运营这一整套链路,再横向复制到其他场景。首个场景的目标不是功能多,而是让人信。
(二)把数据与知识准备当成项目主体
模型能力是通用资源,知识资产才是企业自己的护城河。项目前期在知识梳理上投入的时间,通常与上线后的可用度正相关。反过来,如果指望模型自动消化一堆未经整理的文档,结果多半是回答似是而非。
(三)保留人在环上
数字人不是要替代所有人,而是把人从重复问答中释放出来,去做需要判断和共情的工作。设计上要预留顺畅的人工接管路径:转接时把上下文一并带走,让用户不必重复描述;人工处理的结果再回流到知识库,形成循环。
(四)建立可解释的评估口径
评估体系要能回答业务关心的问题:它替我接住了多少咨询,其中多少真正办成了事,多少需要返工。指标不必多,但必须与业务目标对齐,并且能按场景、按知识条目下钻,指向具体优化动作。
(五)与平台方协作,避免重复造轮子
数字人智能体涉及形象、语音、模型、知识、集成与运维等多条技术线,企业自行从零搭建的投入产出并不划算。数商云提供从场景咨询、形象与声音定制、知识工程、智能体编排、业务系统对接到部署运维的全链路服务,既可以整体交付,也支持在企业已有平台上做能力补齐。交付的不只是能跑起来的系统,还包括配置方法、评估模板与运营机制,让企业团队能接手并持续迭代。
七、让数字人真正上岗,靠的是能力而不是形象
企业数字人项目走到最后,评判标准其实很朴素:业务部门愿不愿意继续用,一线人员愿不愿意主动推荐,用户遇到问题时会不会先想起它。形象带来的新鲜感会消退,大模型支撑起来的理解力、执行力与可控性才会留下来。把知识整理清楚,把接口接稳,把边界划明,把运营坚持做下去,数字人智能体才能从展台上的演示,变成岗位上的一员。


评论