医院数字员工官网的核心不是炫技,而是把知识库做到95%准确率,否则就是给患者添堵。
你的医院官网,其实是个没人用的数字墓碑
打开任何一家医院官网,先找“停诊公告”。如果还挂在首页,恭喜你,至少它还在更新。更多的情况是,官网最新消息停在半年前,科室介绍里的专家照片比实际年龄年轻十岁,出诊时间栏挂着“以当日挂号为准”这样的免责条款。患者想查个夜诊时间,翻了三层菜单没找到,转头打开第三方平台,两秒钟就有答案。
行业里普遍存在这种怪象:医院花了钱建官网,建完就没人管了。信息科说内容该宣传科更新,宣传科说后台系统太难用,最后就变成年久失修的废旧站。有个数字挺有意思,多数三甲医院的官网访问量,不到第三方挂号平台的十分之一。患者不是不需要医院的信息,他们只是放弃了医院自己的官网。
这口锅不该全甩给医院。官网系统当年的建设模式,就是“交钥匙工程”,供应商做完验收走人,医院自己缺乏运营能力,改造升级更是难上加难。数字化时代一到,医院发现自己连个能互动的入口都没有,于是开始仓促地上数字员工智能体。
数字员工智能体这东西,听着很先进,放在聊天框里能回答问题。很多医院在厂商的游说下,觉得这就是万能解药。买个智能体放上去,官网就活了,患者就不用跑了。但结果往往不理想,智能体上线第一天就被问倒,回答驴唇不对马嘴,患者气得直接打电话投诉。
问题出在哪?出在基础数据上。
数字员工的所有聪明,都建立在知识库的地基上。你拿一套乱七八糟的科室目录、过期的医保政策、含糊的报销流程去喂它,它能给你什么答案?顶多是把那些错误信息换一种说法再传递一遍。病人问“我的社保能报销多少”,它回复一段三年前的政策,然后强调一切以现场窗口为准。这样的智能体,不但没给患者减负,反而添堵。
我自己见过不少医院买智能体的过程,开标时厂商的演示都特别顺畅,知识库全面,界面精美,语音识别也快。等到真要接入医院实际数据了,厂商反复核实问你要数据接口,要政策文件,拖上两三个月,好不容易上线了,准确率勉强过六成。为什么?因为医院自己的数据本身就没梳理过,科室之间口径不一致,项目名称编码混乱,门诊和住院的规则还互相打架。
基础数据一塌糊涂,智能体就是空中楼阁。
所以你看,很多医院花冤枉钱,不是智能体本身没用,是他们把智能体当成了一个工具,而不是一套数据工程。数字员工能不能干好活,不取决于算法多先进,取决于喂给它的知识库有多少靠谱的料。这是个很朴素的产品逻辑,但在医院推进数字化的时候,往往被忽略了。
这里说几组公开数据支撑一下判断。国家卫生健康委每年公布的三级公立医院绩效考核中,“信息公开与互动”相关指标的得分率长期偏低。而艾瑞咨询曾发布的医疗行业数字化报告里,提到超过半数患者获取就医信息的第一渠道是商业平台,而非医院官网。虽然统计口径不同,但指向同一个结论:官网在患者服务链路里,基本是失位的。
数字员工智能体要解决的就是这个失位问题,但前提是先承认现实。现实是,医院官网的信息资产本来就薄弱,急诊流程改过三次,官网还挂着旧版;新楼启用半年,地图还没更新。这些基础工作不做扎实,任何数字员工上线都是表演给领导看的。
回到根子上,数字员工能不能当好门诊咨询员、医保导办员,先看医院愿不愿意把知识库当成一个真问题来抓。真抓,就得有人牵头,定标准,定更新机制,定准确率的验收口径。这些事听着琐碎,但恰恰是数字员工能不能干成活的唯一前提。技术那部分,反而是最不担心的事情。

先看结论:数字员工官网的五个硬性指标
既然技术不是瓶颈,怎么判断一个数字员工值不值得上线,标准反而简单了。行业里评测体系五花八门,落到医院管理的日常,我觉得看五个指标就够了。
第一个指标,知识库覆盖率。 患者问的十件事,知识库能接住几件。挂号怎么挂、医保怎么报、住院手续去哪办、检查报告几点出,这些高频问题必须覆盖。怎么测?拿最近三个月的真实咨询记录过一遍,数数智能体能答上来多少。覆盖率低于八成,先别谈智能,回去补料。注意,这里的“接住”不是答非所问说两句片汤话,而是真的给出了患者用得上的信息。
第二个指标,准确率。 这个最关键,也最容易被厂商含糊过去。准确率有两个口径。演示口径是拿一百道精心整理过的题目去测,答对九十五道就敢宣称“准确率95%”。实测口径是把真实患者的原话直接丢进去,看答对多少。两个口径的差距经常大到离谱。患者问“我肚子疼挂哪个科”,和测试题里“患者腹痛应首诊于哪个科室”,难度根本不在一个量级。厂商敢不敢拿后者说事,是试金石。
第三个指标,办结率。 患者问完问题,到办成事,中间这段路通不通。问到了挂号方式,点进去能不能挂到号;问到了报销流程,能不能直接下载到表格。很多智能体答得头头是道,最后一步却断了,问完等于白问。行业里管这个叫闭环完成率,说白了就是一件事从头到尾办成的比例。这个指标最能检验数字员工有没有真正嵌进业务系统。
第四个指标,响应速度。 患者没耐心等,超过三秒没回应,体验就崩了。技术上这一步最容易达标,难的是高峰期表现。平时响应快不算数,早高峰几千人同时涌进来问问题,还能不能守住三秒线,才是真考验。
第五个指标,人工接管率。 智能体答不了、答错了,能不能顺畅转给真人。注意是带着上下文转过去,患者刚才说过一遍的情况,转人工之后还需要复述一遍,这就等于又添了个堵。接管率我一般拿两个数做参考,低于15%算健康,高于30%基本说明智能体扛不住事,人工成了实际的客服主力。
这五个指标放在一起,就是一把尺子。覆盖率和准确率决定答不答得上,办结率决定办不办得成,响应速度决定等不等得起,人工接管率决定兜不兜得住。每一样都能拿真实数据验证,不需要多高深的技术手段。
很多供应商的验收方案不是围绕这套逻辑设计的。他们更喜欢展示演示环境里精心打磨的问答效果,回避真实数据带来的压力。我建议医院信息科在立项阶段就把这五个指标写进合同验收标准,作为硬杠杠。厂商要是连这几项都不敢承诺,方案做得再好看,也跟你没关系。
百事通知识库:不是把文档扔进去就叫智能
很多医院建数字员工,第一步就是把现有文档丢给厂商。各种格式的电子文件、扫描件、网页截图,几百份材料堆成一座山,厂商说都放进知识库了,大家就很放心。结果一上线就露馅:问十个问题,三个答非所问,五个说“对不起,我还在学习中”。这不奇怪。把文档放进系统,跟把文档变成知识,是两码事。
问题出在哪?患者的问法,从来不会按文档结构走。文档是按科室、按制度写的,患者是按自己的症状和着急程度问的。“我这个病该挂哪个科?”、“外地医保怎么备案?”、“化验结果下午几点出?”、“做检查能不能吃饭?”这些问题的答案,散落在不同文件的角落里。系统把文件整段吞进去,却不知道该把哪几句调出来给你。你得到的就是一段驴唇不对马嘴的截取。
所以要建的不是文档库,是百事通知识库。什么叫百事通?就是医院里那个什么都知道的老护士。你问她“孩子发烧挂什么科”,她不用翻手册,直接告诉你“先去儿科急诊,在三楼东侧,如果体温超过39度,去发热门诊”。她脑子里的知识不是按文件柜分层的,是按你问话的场景组织的。
知识库要长在医院的就医流程上。把患者从进院到出院要走的路画一条线:挂号、候诊、看医生、做检查、等结果、再就诊、缴费、取药、离院。每个节点上,患者会问什么,哪些信息最容易被问,先把这些整理出来。这就是场景化。场景化的知识库不再按科室孤立排版,而是把相关科室、流程、政策、位置信息打成一个包。每一个场景包,都要有办理条件、备案入口、报销比例、所需证件、办理地点、咨询电话。别人问的时候,直接从包里拿答案。
再往上走一步,是预判问题。同样是做影像检查,检查前有人问“能不能吃饭”,检查后有人问“结果什么时候出来”。每一项检查都该配一套常见问答。医保报销这类政策问题,更要拆细。“门诊慢特病怎么申请”、“生育津贴去哪领”、“工伤报销和医保什么关系”,这都是一件一件的具体事,不能给一个大锅烩的政策原文。
还有一层容易被忽略:同义表达。患者说“胃不舒服”和“想查胃病”,说的可能是一件事。知识库要能把这些说法归一。科室也有别名,有人说“内分泌科”,有人说“看糖尿病那儿”。这些都要在日常维护里持续补充。光靠上线时的批量导数据,做不精细。另一个常见坑是信息打架。官网写着“预约号源每日下午四点放”,公号里写着“下午三点”,旧通知里还有“现场挂号”。患者听谁的?知识库必须有一个唯一事实源,由专人负责核对,这条信息变更时,其他入口同步更新。不解决这个问题,准确率连90%都站不稳,更别提95%。
知识库的梳理必须有医院自己的人参与。厂商不熟悉本地情况,不知道你们医院哪个科叫“外二科”而不是“普外科”,不知道影像科室在内科楼还是医技楼。这类信息只能医院提供。有的医院把科室目录拉一张表就算完事,其实远远不够。每一层楼、每个窗口、每项检查的注意事项,都是被问出来的。
政策原文也要处理。医保报销比例这种问题,直接甩一段《医保管理办法》第几条,患者看不懂。要把政策语言翻译成“你这种情况,报销比例是70%,带上身份证和医保卡就行”。这个翻译工作,得由懂政策又懂患者的人来做。
系统上线也不是终点。把每天没答上的问题记录下来,攒成一个待补充清单,这跟建库同等重要。很多知识库上线时看着不错,用两周就越用越假,就是因为没有这个“回头听”的动作。
我自己试下来的经验是:建知识库最花时间的不是技术,是梳理。厂商的技术平台都差不多,差距在谁愿意陪你把那些边角料问答,一条条磨出来。这个功夫下不到,后面的准确率、完成率,全都没有地基。
95%准确率是怎么算出来的?别被厂商的PPT带沟里
知识库的底子打好了,厂商演示文档上的数字就该拿出来遛遛了。“智能体准确率95%”,这个数字谁都爱看。但它是怎么算出来的,这里面的文章不小。
同一个准确率,至少有两套算法。一套是演示用的,一套是实际用的。两套结果经常差出一大截。
演示准确率:一场开卷考试
厂商来院演示,通常的操作是:技术团队提前把医院官网上的常见问题、科室介绍、挂号流程都浏览一遍,挑出100到200条典型问题,录进测试集。然后当着你的面,挨个问一遍。系统答一个对一个,答一个对一个,现场效果非常漂亮。
这里面的关键点在于:测试集里每条问题的答案,系统早就“背”熟了。先给答案再考试,考出来的分数当然高。这跟小学生把课本背了一整晚,第二天考原题是一个道理。
这类演示准确率,行业里普遍能跑到95%以上,有的厂商宣称98%、99%。但说实话,这个数字只能证明系统会背课文,证明不了它真能解决患者的问题。
实际准确率:考验不在答案,在“问法”
真正上线之后,面对的是真实用户。患者提问根本不按稿子来,常见的情况有:
- 口语化表达:“我挂不上号咋整”和“挂号失败怎么办”是两个问法,但指向同一个业务
- 错别字:“骨伤科”写成“骨上科”
- 方言和习惯表达:“拿药在哪边”“拍片子在哪做”这种直接问法
- 描述症状而不是问科室:“我头晕呕吐挂什么号”和“神经内科怎么走”完全不是一类问题
- 一句话里夹着两三个问题:“下午能抽血吗,在哪一层,要空腹不”
真实用户问题里,相当一部分是知识库没想过的问法。人工智能再怎么聪明,训练样本里没有这个表达的变体,它就只能瞎猜或者答非所问。
问题就出在统计口径上。演示准确率是封闭测试,所有题目都有标准答案。实际准确率是开放测试,系统得面对它从未见过的提问。 两种语境下跑出的分数,根本没有可比性。
一份测试集的三处猫腻
厂商如果不敢拿真实用户问题来测,通常会在测试集的构建上做文章。盘来盘去,猫腻基本集中在这三个地方。
第一,测试集来源。 问题是谁提的?如果是厂商自己编的,那等于自己出题自己考。真正该用的,是医院过去半年到一年的真实咨询记录,包括电话咨询、导诊台记录、官网留言。这些才是用户关心的问题。
第二,未知问题怎么处理。 测试集里有一道系统答不出来的题,厂商的处理方式往往不是挂上“答错”,而是把“已转人工”也算作准确。患者问“异地医保怎么备案”,系统说“我帮您转人工”就标记为正确,那准确率多少都不意外了。
第三,答案的评判标准。 谁来判断“答对了”?理想情况是医院这边派懂业务的人逐条核对,但实际验收时往往是厂商自己核分。自己打分,有争议的时候总往好处算。核分人懂不懂业务、标准松不松,都能让分数浮动好几个点。
还有一个容易被忽略的问题:答非所问也算“给了答案”。系统回了一长串文字,患者要的是“挂号费多少钱”,系统回答的是“挂号流程介绍”。从匹配角度看确实相关,但从解决角度看没解决。这类题在演示测试集里不会出现,真实用户的反馈却很直接:不靠谱。
验收就按一个标准来:真实记录盲测
想拿掉这些水分,办法其实很简单。签合同时就约定:验收统一用医院真实导诊记录,脱敏后随机抽一千条作为测试集。 这一千条在验收前不对厂商开放,系统现场实时作答,医院这边派业务人员逐条评分。
三条硬规矩:
- 不知道答案、被转人工的,一律算错误
- 答非所问的,一律算错误
- 每条问题必须有明确答案,不许剔除
分数分科室统计。外科、内科、儿科、医保办、体检中心各自算账。总准确率95%还不够,每个核心科室的准确率都不能低于90%。 能做到这一步,那个95%才有含金量。
这套验收标准写进合同,能挡掉九成只会做演示的供应商。剩下的那一成敢签,说明他们对自己的系统心里有数。
实际准确率还有一个变量,是测试集覆盖不到的:时间。患者的问题会随政策变、随季节变、随医院科室调整变。今天测出来的95%,三个月后可能只有80%。怎么让这个数字稳得住,比怎么测出这个数字更麻烦。这个问题,放到运营那块再细说。
官网架构要变:从静态科室介绍到任务闭环
但准确率只是地基。地基打牢了,房子却可能还是不能住人。你花大力气把知识库整理得清清楚楚,盲测也过了95%,上线一看,患者问完一个问题,拿到一段文字答复,然后就没了。想挂个号?得自己退出对话,去翻科室列表。想退费?页面跳转三次,最后还是拨了人工电话。这时候你会觉得,这跟百度搜一下有什么区别?
很多医院踩的坑就在这儿。把智能体当成一个会说话的FAQ,官网的主体结构纹丝不动,还是那套科室介绍、专家出诊、就诊指南的静态页面。这个年头,患者早就不满足于“看到信息”,他们要的是“办成事情”。
我说个行业内普遍存在的现象。你去打开一些医院的所谓智能客服,问“我这个情况挂哪个科”,它给你一段标准答复。再追问一句“那消化内科今天还有号吗”,它就没声了。或者给你一个链接,点进去是两周前的停诊公告。这种体验,比没有智能体还糟。患者本来抱着“问了就能办”的期待来,结果碰了一鼻子灰,下次他连官网都不想打开。
问题出在架构。知识库和准确率解决的是“说得对不对”,架构解决的是“事儿办不办得成”。两者缺一不可。
传统医院官网的信息架构是树状的:首页→科室→医生→出诊时间。患者顺着路径一层层点进去,像翻一本厚重的电话黄页。数字员工智能体的架构应该是网状的,以任务为中心。患者不关心你医院分几个院区,不关心行政楼在哪,他只关心:我这个病怎么挂号、检查去哪做、报告怎么查、医保能报多少。
想让数字员工真正常态化运转,官网的信息架构必须改造成一条完整路径:问答→办事→反馈→更新。
问答是入口。患者用自然语言提问,系统理解意图,给出准确答复。这层你已经通过盲测验证了。
办事是核心。答复的末尾必须挂动作。推荐了消化内科,旁边就要有“立即挂号”的按钮,直接跳转号源池。告知了检查流程,页面上就要有“预约检查”的入口。解释清楚了医保报销比例,就要能下载报销材料清单。没有动作的问答,说得再好听也是空转。
反馈是关键。每完成一次办事,患者可以对过程评分,也能提交补充问题。系统自动记录:这个问题被问了多少次?答完后续操作成功率多少?没办成的原因是知识库里缺了哪个环节?这些数据不是摆好看的,它们是知识库迭代的养料。
更新是驱动。把反馈数据回灌到运营端,知识库管理员每周能看到“问题热度榜单”和“未完成任务清单”。排名前几的问题如果答了但没办成,说明流程有断点,该改系统对接的地方去改系统,该补内容的地方补内容。政策文件一变,相关负责人要在一个工作日内完成条文拆解并更新到知识库。这些动作都要有明确的负责人和时限。
行业里对智能体的定义五花八门,但放到医院这个场景里,判断标准其实很朴素:患者能不能用一句话把事情办了。 你要说“我要办慢性病卡”,系统直接告诉你带什么材料、去哪办、材料上传入口在哪;你说“复查”,它根据上次就诊记录帮你挂回同一个医生。这才是数字员工,不是数字播音员。
这个架构改造,技术上没有多难。开放平台的接口、表单引擎、消息推送,都是现成的东西。难的是医院愿意动这个手术。原来官网是信息科发个通知、挂个排班表的地方,现在要变成整合挂号、缴费、检查、医保多个系统的服务枢纽。这就不只是技术活了,还要有人协调门诊部、医保办、信息中心几个部门坐下来,把流程一条条捋顺。
但这条路早晚得走。第三方平台上患者问“这个药医院有没有”,你管不着;官网自己把知识库和流程做透了,患者才会回来。没人愿意天天在一个信息孤岛上办事。医疗服务的数字化,说到底比的是谁先让患者少折腾。
捋顺了架构,把问答和办事接上,后面就会冒出一堆新问题:知识库谁维护?数据准不准?政策变了怎么同步?这些问题不解决,上线第一天是95分,第三个月可能就不及格了。
知识库上线只是开始,内容是养出来的
知识库上线那天的准确率,大概率是虎头蛇胆。测试集里那几百条问法都是精挑细过的,真正患者的问题从嘴里蹦出来,措辞千奇百怪,你根本预料不到。所以上线第二天要做的第一件事,不是庆祝,是把当天所有真实问答导出来,逐条看一遍。这一看,你心里就有底了。
行业里普遍存在一个错觉,以为智能体上线就是项目结束。实际上,一个不更新的知识库,准确率是按周往下掉的。今天患者问“异地医保备案怎么弄”,明天政策改成了“免备案”,你要是还按老规程回答,不光没用,还误事。这种错误比答不上来更伤人,答不上来患者顶多骂一句废物,答错了人家按你的指引跑了三天窗口,最后啥也没办成,那是要投诉的。
知识库的内容在持续腐坏。科室合并了、医生出诊时间调了、新药进院了、检查费用变了、医保报销比例动了,这些东西不维护,半个月就过期。你要知道,知识库里躺着的每一条回答,背后对应的是一个具体的业务流程。流程一变,答案就必须跟着变。变慢了,准确率就破了及格线,这跟钱多钱少没关系,纯粹是管理问题。
那谁来改?这是最容易被绕过去的问题。信息科懂技术,但不懂医保报销的细节;门诊部懂流程,但没权限改系统里的数据;医保办懂政策,但不知道官网后台怎么登录。你说这活谁干?答案是得有人牵头,把各科室的对接人拉到一个群里,每条知识明确标一个责任科室和责任人。挂号问题找门诊部,医保问题找医保办,药品问题找药剂科,检查项目问题找医技科室。没人认领的知识条目,就该删掉,因为那说明它不重要,也没人信得过它。
更新时限也得定死。政策类变更是最急的,当天出文件,当天就得改,最多不超过一个工作日。科室排班类可以放宽到一周之内。新药上市或者药品下架这种,涉及处方安全,也按最急的走。定了时限就得有人检查,光靠自觉不行,后台要能看到每次修改的时间和操作人,月底拉一张表,谁家的知识条目超过时限没更新,一目了然。
还要留一个患者反馈的入口。回答下面挂个“这答案有用吗”的按钮,看着不起眼,但特别管用。患者说不对,你就去核一遍,错了马上改。这个动作其实就是上一章说的那个流程闭环里的最后一截,有人用、有人反馈、有人改,整个系统才转得起来。没这个入口,知识库永远都是死的,准确率也只能靠撞大运。
我自己试下来,还有一条没那么显眼但值得做:定期做一次全量巡检。把知识库里每条问答翻出来过一遍,问自己三个问题,这句话现在还成立吗?患者看得懂吗?流程还是这个流程吗?每次巡检能挑出两成需要更新的内容,一点都不夸张。上线三个月后的准确率,全靠这个动作撑着。
运营机制这件事,听起来没什么技术含量,但它恰恰决定了数字员工是干活还是添乱。厂商交付那天再漂亮,后面半年没人管,所有成果都会还回去。把知识库当花园养,每天拔拔草、浇浇水,别指望种完一次就一劳永逸。那是对患者负责,也是对你自己负责。
照着这张自查清单,给你的官网智能体把把脉
我整理了一张二十项的自查清单,覆盖知识库底子、准确率验证、办事路径、应急转人工和更新记录。信息科可以直接拿它验收供应商,也可以拿它自查现状。
先查知识库的底子
知识库是数字员工的地基。地基不牢,后面全白搭。这一组条目最先查,不满足就直接给结论。
高频场景覆盖是否完整。挂号流程、医保报销材料、入院出院手续、检查前注意事项、科室位置导航、停车陪护规定,这六大类问题在知识库里能不能直接搜到?搜到之后答案是否完整,还是只给一句话应付?
答案有没有来源和核验日期。每条知识条目应该能查到出处,以及最近一次核实的时间。超过半年没动过的条目,基本可以默认失效。
科室和排班变动有没有同步机制。出诊医生临时停诊、科室搬迁,这类信息靠人工慢慢改,永远跟不上节奏。知识库的编辑后台必须支持批量替换和定时更新。
新旧内容有没有分层。很多人把知识库建成一个大杂烩,过期内容和现行规定混在一起。内部应当把“已下线”和“生效中”分开,过期内容只存档,不出现在患者问答里。
再验准确率是不是真的
知识库完整,不代表答得对。厂商说的准确率,和你自己系统里跑出来的准确率,往往不是一回事。这几条帮你拆穿水分。
测试集是谁挑的。如果测试题是厂商从百科里摘的,那测的是阅读理解,不是落地效果。把医院自己的真实导诊记录拿一批出来,直接丢给智能体答,才算数。
真实问答的准确率有没有统计。从最近一个月的对话记录里抽一百条,人工一题一题核对。答对的占比,就是实际准确率。这件事没有捷径,必须抽查。
答错的问题有没有被标记。回答错了不可怕,可怕的是错完没人知道。系统要把拿不准、答错、超时的对话单独标记出来,送进待审核队列。
有没有人处理这批错题。标记完之后,总得有人看,有人改。这一条可以查后台的待办记录,看看处理量和时效。
看办事路径通不通
患者能从问答走到办事,才算数字员工。这里查的是路径衔接,不是单点功能。
答案页面有没有办事入口。患者问到挂号,答案旁边就摆着挂号的按钮。问到缴费,就能直接跳转到缴费页面。这一步没做到,智能体跟一本电子的问答手册没区别。
拿不准的问题能不能转人工。有一些复杂问题,机器答不对是正常的。关键是要给一条转人工的路,而且这条路要明显,不能被页面的其他元素淹没。
“没用”的反馈有没有人跟进。每个回答下面挂的“有用/没用”按钮不能是个装饰。患者点了没用的,系统应该自动提醒编辑人员复核。
旧入口有没有清理。曾经能预约、现在已经关闭的流程,在知识库里还找不找得到?患者顺着关键词搜到下线业务,然后卡在半路,这体验是最常见也最容易解决的。
应急转人工是否顺手
机器永远做不到百分百周全。转人工这条通道,平时不起眼,真到用的时候要能接住。
夜间和节假日的兜底方式。人工下班后,患者转出来应该落在哪里?总机、急诊分诊台还是一条固定电话,得提前设计好。
转人工等待的时间有没有测过。高峰时段和夜间各测几次,看看从点击“转人工”到有人接话,中间隔多久。超过一分钟,就得想别的办法。
对话上下文有没有带走。患者跟机器聊了半天,转给人工时对方一无所知,患者还得重新说一遍。这个体验放在医院场景里,很容易让人火大。
值班表变动是否同步。人工坐席名单换了,智能体的转接名单也跟着换。这两张表如果不同步,转接就会变成死路。
更新日志经不经得起翻
运营记录是最诚实的。有没有人真正在维护知识库,翻一眼后台就清楚了。
修改记录有没有留痕。每一条知识被改动后,应该能看到修改人、修改时间和改前改后的版本对比。查不到痕迹,就谈不上管理。
更新时限执行得如何。政策调整、药品信息变更、科室流程改动,从外部信息发布到系统内更新完成,间隔了几天?有没有超过当初约定的时限?
全量巡检有没有记录。半年以内,有没有人把知识库从头到尾过一遍?巡检报告在哪里?从里面挑出的问题,处理完了吗?
患者反馈的数据有没有被用起来。哪怕只有一小部分人点了“没用”,这批数据就能画出知识库的薄弱地带。后台有没有人看过、汇总过、处理过,一查便知。
二十项打钩下来,数字员工什么状态就清清楚楚了。哪几项画了叉,就往对应的位置去修。信息科拿这张表做验收,比听厂商讲一个小时的方案有用得多。
半个月跑通一个高频场景,比规划三年更重要
先选一条道
拿着清单数完二十个叉,人很容易慌。一个叉就是一个洞,全补上的活能写满三年的立项书。很多医院也确实这么做了,第一年搭平台,第二年铺科室,第三年全院覆盖。规划写得工工整整,预算批下来,供应商进场,然后就没有然后了。问题不在于规划本身错,而是架子铺得越大,底下越空,任何一个环节掉了链子,整台戏都唱不下去。
我建议把规划收起来,挑一个患者天天要用的场景,半个月之内做出个实实在在的东西。一句“东西做好了,你来试试”,比三年规划有说服力得多。
场景怎么挑?判断标准很简单:频率要够高,答案要能查得到,错了得有人兜底。患者问的频率高,你才能拿到足够多的样本去打磨;答案有据可查,智能体才不用自己发挥;出错能转人工,患者才不会被晾在半路。拿这三条筛一遍,多数医院筛出来的头一个场景,不是门诊挂号,就是医保咨询。
这两个场景有个共同点,患者的问题绕来绕去,实际上就那么几十种。总有人问退号怎么退,总有人问异地医保怎么结算,总有人问CT报告到哪取。把这些高频问题收集齐,把答案写成患者看得懂的大白话,这就是最底层的种子库。
种子库做多大合适?别嫌小,照着近三个月的真实咨询记录来,把被问过两遍以上的问题全捞出来,几十条到上百条不等,一个礼拜之内能做完。每条答案都要落到“办得成事”上,别只说报销窗口在三楼,还得说清带什么材料、几点到几点能办、联系电话多少,万一去晚了会不会白跑一趟。这类细节,才是数字员工和电子档案的分水岭。
两周怎么干
第一周把种子库磨出来,第二周就上线试。上线不用大张旗鼓,把入口放在不显眼的位置也行,关键是人工坐席在旁边守着。患者问了什么,智能体答了什么,人工全都看得见。答错了立刻接管,把正确答案记下来,当天回填到知识库。
第一周除了建库,还有一件事值得做:去挂号窗口和咨询台转一圈。那里的人天天应对患者提问,最清楚哪句话患者听不懂、哪个流程患者总卡壳。把他们的说法带回来,当成种子库的第一批测试问题。
盯什么指标?我不建议只盯后台那个解答率,要看真实问题下,患者问完一句之后有没有接着追问。追问就是没听懂,没听懂就是答案不合格。拿这个口径每天校准一轮,两个星期下来,知识库该磨平的地方基本磨平了。
还有两件事别忘。人工转接名单跟着值班表走,别让患者转到空号上;每改一条知识都留痕,出问题的时候有个追溯的口子。
跑通了再看全局
一个场景跑通的价值,远远超出这个场景本身。你会突然看清楚很多坐在会议室里想不出来的事:患者同一个问题能有一百种问法,准确率不是上线当天测出来的那串数字,而是每天拿真实问题去撞、撞完再改的过程。这些体感,比任何规划文本都值钱。
更重要的是,团队对数字员工的态度会变。原来半信半疑,现在看到它真能答上真问题,后面再铺第二个、第三个场景,阻力就小得多。半个月跑下一个场景,整个团队都知道瓶颈出在哪,是知识库不够全,是理解不了长句子,还是人工跟不上节奏。有了这份底账,下一步规划怎么写,就有自己的数据兜底了。规划三年这种事儿,等跑完第一个场景再干,也不迟。
附:三个逼问厂商的问题,答案比宣传册实在
跑通一个场景之后,你手里就有了真实的问题记录和回答记录。这时候再回头看厂商当初的承诺,每一句都经得起对质。可惜大多数人是在选型阶段就被PPT糊住了,等到上线才发现货不对板。与其到时候扯皮,不如在签合同之前,把下面三个问题甩过去。
对方要是答得含糊,或者开始绕圈子,基本可以直接pass。答得干脆的,至少说明心里有底。
能不能拿我们医院真实的导诊记录做一次盲测
这是最狠的一招,没有之一。你不需要给对方任何加工过的数据,就把导诊台、电话咨询、挂号窗口那边积累的真实问题原样丢过去。脱敏之后,让他们用智能体跑一遍。你们自己内部先标好标准答案,然后看它答得怎么样。
厂商通常的回应有三种。一种是说需要先做定制,得花时间调模型,这种基本是借口。真实场景的问题再复杂,也是医院日常在发生的,如果连这个都接不住,上线之后患者的问题它更接不住。第二种是说可以拿他们自己的测试题来演示,这等于没答。第三种,也是极少见的,直接说可以,然后约时间现场跑。遇到第三种,这个厂商至少是靠谱的。
盲测的意义在于,它绕开了所有精心准备的演示环境。你想啊,真实导诊记录里有多少口语、简称、错别字?患者可能说“胸科那边怎么走”,也可能说“我爹的CT单子去哪拿”。这些问题的问法,跟厂商测试集里的书面语完全是两个世界。能扛住真实问题轰炸的,才叫智能体,扛不住的,就是个玩具。
准确率百分之九十五的测试集,具体包含哪些科室什么问题
很多厂商宣传的时候都会说自己的产品准确率超过百分之九十五。这个数字听起来很漂亮,但你得追问一句:这个准确率是在什么测试集上算出来的?
行业里普遍存在一种做法,就是拿一百个精心挑过的问题去测,这些问题覆盖的都是标准场景,比如“挂号怎么挂”“医保怎么报销”。测出来的准确率当然高,但那不叫本事。真正要问的是,测试集里有多少涉及疑难杂症、罕见科室、多轮追问、方言表达?有没有把真实患者问过的、你们医院历史上被问过一百遍的那些问题放进去?
更好的问法是让厂商把测试集列个清单出来。看看里面骨科、儿科、妇产科的比例是否合理,看看急诊和慢病的问题各占多少。如果对方说这是商业机密不方便公开,那你就知道这准确率是怎么来的了。你还可以反过来问:能用我们医院前三个月的真实问题重新构造一个测试集,然后公布准确率吗?敢接这个活的,才值得谈下一步。
知识库更新一次需要几个工作日
这个问题最容易被忽略,但恰恰决定了你的数字员工能不能活过三个月。医院的科室调整、挂号规则、医保政策,哪一样不是隔三差五在变?知识库要是不跟着变,之前就算做到百分之九十九的准确率,也会在医保新规落地那天直接崩掉。
很多厂商的合同里写的是“提供知识库维护服务”,但不写响应时限。你问他更新需要多久,他可能说“很快”“一两天”。你千万别信,要写进合同里。一个知识条目的修改,从你提需求到线上生效,三五个工作日是合理的。那种说“实时更新”的,你可以反问他,谁来审?谁来测?改错了谁负责?
这个问题还能帮你判断厂商的服务模式。有的厂商是给一个后台让你自己改,有的是必须提工单由他们的运营人员改。前者对你的信息科提出要求,但响应速度可控;后者省事,但如果对方人手不足,就是一个无底洞。不管哪种,你得在合同里明确一条:政策类变更必须在几个工作日内完成,并出具更新日志。没有这个约束,三个月后知识库的准确率跌破及格线,你就只能干瞪眼。
这三个问题问完,厂商的成色基本就清楚了。说实话,能痛快回答的供应商,行业里不多见。多数听到第一个问题就开始顾左右而言他,说“我们需要先做数据清洗”或者“这个要专项评估”。那你就明白,他的产品在别人家跑的所谓成功案例,大概率也是精心布置出来的。
你自己想想,一个连真实数据都不敢碰的智能体,放在医院官网上,等于是让患者对着一个空号打电话。与其信那些宣传册上的头衔和奖项,不如信一次现场盲测的结果。真金不怕火炼,能过这三关的厂商,后面合作起来才靠谱。