很多企业对数字人智能体的第一印象,还停留在展厅里的虚拟形象:会挥手、会念稿、看起来很新鲜。真正把它用进业务的企业会发现,难点从来不在"像不像人",而在它能不能听懂、答得准、把事办完。这篇文章想聊的,就是这条从需求到上线的全链路该怎么走,中间哪些环节最容易翻车,以及数商云在类似项目里通常怎么拆解和推进。
一、先把目标定准:企业要的不是一个会说话的形象
(一)数字人负责"像",智能体负责"办成事"
数字人解决的是交互界面问题——有形象、有声音、有表情,让用户愿意开口。但决定这套系统有没有价值的,是背后那个能理解意图、找到依据、调用系统、把事情办完的智能体。两者缺一不可:只有形象,是一台昂贵的播放器;只有智能体,是一个看不见的对话框。
评估这类项目时,企业容易被形象效果吸引,把预算和注意力都压在建模仿真上,等上线才发现回答不准、办不了事。更稳妥的顺序是先把智能体的能力边界和业务闭环想清楚,再决定形象做到什么精度。
(二)对外服务与对内赋能,是两条主要落地路径
对外,数字人智能体常出现在客服、售前咨询、门店导购、直播间和线上活动里,替企业承接大量重复性问题,把人工坐席留给真正复杂的沟通。对内,它更像一位随时在线的业务助手:制度查询、产品培训、IT 与人事支持、设备维保知识检索。
某零售行业头部企业希望门店导购随时能问到商品卖点与调拨口径;某制造业头部集团的一线工程师则要频繁翻设备手册和维修记录。场景不同,痛点却一致——把"翻资料、找人问"变成"问一句就有答案,还能顺手把流程走完"。
二、需求阶段:把模糊的期待翻译成可验收的目标
(一)先给场景分级,而不是先选模型
把候选场景按能力要求排一排队:能回答问题、能基于知识给出建议、能直接操作业务系统完成任务。层级越高,对权限控制、操作留痕、人工兜底的要求就越严。
务实的做法是从问答切入,用真实会话积累语料和评测样本,等知识命中率和表达风格稳定之后,再逐步放开写操作。先让数字人"答得对",再让它"办得成"。
(二)写清楚"不做什么",比写"要做什么"更重要
哪些问题必须转人工、哪些信息不能对外说、哪些动作需要二次确认、遇到不确定该怎么回应——这些规则要落在编排逻辑和知识权限里,而不是指望模型自己"懂分寸"。
验收口径也要提前定:答得准不准、事情办没办成、答不上来时的表现是否体面、语气是否对得上品牌调性。先把这些定性标准对齐,比上线后反复争论"感觉不够聪明"要高效得多。
(三)业务、技术、合规要一起上桌
业务侧提供场景与验收标准,数字化团队负责集成、部署与安全,法务与合规确认数据边界和话术红线。数字人智能体天然是横跨几方的项目,任何一方缺席,后期都要返工。
三、底座准备:形象、声音与知识库决定体验上限
(一)形象与声音资产:采集一次,多端复用
常见路线有几类:真人形象采集后做二维或三维建模,用语音克隆复刻音色,或者用通用音色库配合合成语音。精度越高,采集与渲染成本越高,对算力也越敏感。
更值得关注的是资产的可维护性。形象与声音最好做成可替换的模块,将来换形象、调语气,不必推倒重来重做智能体。口型同步、表情与手势要和语音合成对齐;直播和短视频场景还要额外考虑镜头节奏与动作自然度。
(二)知识库是企业数字人智能体的天花板
企业资料往往散落在文档系统、工单记录、群聊和老师傅的经验里,格式混乱、口径不一。要经过采集、清洗、切分、向量化、元数据标注和权限绑定,才能变成真正可检索的知识。在数商云的落地经验里,知识梳理往往是最花时间、也最能决定成败的环节。
其中两点最容易被低估:一是切分粒度与检索策略,切得太碎会丢上下文,切得太粗会引入噪声;二是关键词检索与向量检索混合使用,通常比单一方式更稳,尤其面对型号、编码、专有名词这类内容时。知识还需要有人持续维护——产品改价、政策调整、流程变更,知识库不同步,数字人就会用旧口径回答客户。
(三)合规边界要前置,而不是事后补
个人信息、交易数据、内部制度应当分域管理,检索时按访问者身份做过滤,对话全程留痕可审计。部署方式要看数据敏感度和自身运维能力,私有化、混合部署与公有云各有取舍,没有统一答案。
四、智能体搭建:把模型、知识与工具编成一条工作流
(一)模型选型:合适比"最大"更重要
通用大模型负责理解意图和组织语言,语音识别、语音合成、口型驱动等环节通常由专门模型承担。选型要看的维度包括响应时延、上下文长度、方言与多语言支持、工具调用能力、部署方式和推理成本,榜单分数只是参考之一。
复杂场景可以做分级路由:寒暄、查营业时间这类问题交给轻量模型,涉及多步推理或跨系统查询时再调用更强的模型。把算力花在真正需要它的对话上,是成本控制最有效的手段之一。
(二)检索增强与工具调用:答案有出处,动作有回执
检索增强生成(RAG)让回答基于企业自有知识并可以回溯来源,是目前抑制幻觉的常规做法;工具调用则让智能体能够查询订单、核对库存、创建工单、发送通知。工具数量要收敛,参数要校验,执行失败时要有用户听得懂的兜底话术。
涉及权益、金额、账号变更的操作,一律留痕并加二次确认。这类设计看起来不够"智能",但在企业场景里,可靠永远比炫技重要。
(三)记忆与多轮:别让用户把自己说过的话重复一遍
短期记忆负责当前会话的上下文,长期记忆记录用户偏好与历史诉求。跨渠道的会话衔接同样关键——用户在手机上聊到一半,转到电话或线下门店,不该从零开始。
多智能体协作适合职责清晰的复杂任务,比如接待、查询、工单流转各由一个智能体负责,再由调度层串起来。但要避免为了架构好看而拆分过多角色,协作链路越长,误差与时延的叠加就越明显。
(四)拟人体验藏在细节里
能否打断、被抢话后如何接续、等待时说什么、语气词怎么用、口型延迟是否明显,这些细节直接决定用户愿不愿意继续聊下去。语音交互的端到端时延要纳入观测指标;数字人开口的同时,后端已经在异步取数,避免画面在"思考"而用户在干等。
五、系统集成与上线:让数字人真正长在业务系统里
(一)渠道接入与会话中台
官网、APP、小程序、企业微信、电话、直播间、线下大屏,各渠道的交互形态和话术风格不同,但意图体系与知识底座可以共用。统一会话中台的价值在于:知识一处更新、各渠道生效,数据一处统计、全局可见,运营团队不必在多个后台之间来回切换。
(二)灰度上线与人机协同
稳妥的路径是先在内部试运行,让员工当最挑剔的用户,再面向真实用户逐步放量,并始终保留转人工入口。人工坐席接手时能看到完整对话和智能体引用的知识来源,沟通成本会低很多;反过来,人工处理过的新问题,又能回流成知识条目和评测样本。
某制造业头部集团把设备维保数字人先交给内部工程师使用,把知识准确性和话术边界磨顺之后,才推到服务热线与客户侧,上线阶段的投诉压力明显小得多。
(三)上线之后,运营才刚开始
需要长期盯的指标包括意图识别准确率、知识命中率、任务完成率、转人工比例、平均处理时长与用户反馈,以及失败会话的聚类分析。模型、提示词或知识库任何一处调整,都应该跑一遍回归评测,避免"修好一个、弄坏一片"。
六、绕不开的风险:幻觉、权限与成本
(一)幻觉来自知识缺口,也来自边界模糊
应对思路并不复杂:知识里没有的内容,宁可坦诚说明并引导转人工;回答强制标注来源,方便核查;涉及事实与权限的动作交给工具执行,不交给模型"生成"。让模型做它擅长的理解与表达,把确定性交还给系统和数据。
(二)安全与隐私要双向把关
输入与输出都要经过内容审核,个人信息采集遵循最小必要原则,电话与直播场景做好合规提示,生成内容按要求标识。对内部助手而言,权限过滤必须作用在检索层和工具调用层,而不是只写在提示词里。
(三)成本要当日常指标来管
推理成本随会话量和上下文长度增长,可通过缓存常见问题、裁剪上下文、分级调用模型、并发限流来控制。数字人渲染本身也消耗算力,三维实时驱动的开销尤其需要提前评估。把成本放进日常看板,比月底对账时才发现失控要主动得多。
(四)组织层面最常见的失误
当成纯技术项目做,业务不参与,上线后没人用;追求一次做全,战线拉得太长,迟迟看不到效果;知识库没有明确的维护责任人,过一阵子就开始答非所问。这些问题和技术关系不大,却往往决定项目成败。
七、结语:它是一套需要长期养的能力,而不是一次交付
把数字人智能体做成的企业,路径往往相似:从一个具体、高频、边界清晰的场景切入,把知识和权限打牢,把工具调用与兜底机制做扎实,再用灰度上线的方式一点点扩大范围。形象可以逐步升级,声音可以持续调优,模型也可以更换,但知识、流程和评测体系是真正沉淀下来的资产。
数商云在这类项目中的角色,是陪企业把从需求梳理、资产准备、智能体编排、系统集成到上线运营的整条链路走完,并把每个阶段的交付物和验收标准讲清楚。技术选型会变,模型会迭代,但只要场景选得准、边界划得清、运营跟得上,数字人智能体就能从"看起来不错"变成"确实好用"。


评论