过去一年,一些企业开始把 AI 使用率、调用次数,甚至 Token 消耗量写进绩效考核。
理由听起来很直接:用得越多,说明 AI 渗透得越深;Token 涨得越快,说明组织转型越积极。
但 Token 本质上是模型运行时消耗的计量单位。它记录的是一项成本发生了多少,不是一个结果创造了多少。
把 Token 消耗量写进 KPI,不是在衡量 AI 的价值,而是在把企业付出的成本伪装成业绩。
最容易统计的数字,往往最容易被误认成价值
企业喜欢 Token,首先因为它足够清楚。
模型调用了多少次,输入输出了多少内容,哪个部门消耗最多,后台都能精确记录。相比之下,AI 究竟让一个需求提前了几天上线、让一条销售线索多快被跟进、让多少异常不再依赖人工发现,很难单独归因。
真实的业务价值,总是混在流程里。它受人员、规则、数据质量与协作效率共同影响,很难被压缩成一个整齐的仪表盘数字。
当管理层急于证明组织已经“全面拥抱 AI”,却还没有建立结果口径时,最容易测量的用量指标就会被拿来替代价值指标。
这是一种典型的测量错位:因为看不清结果,所以开始奖励投入。
一个数字容易获得,不等于它值得被管理。
当成本成为目标,刷量就是最理性的选择
一旦 Token 从成本记录变成绩效目标,员工的行为就会迅速适应新的规则。
原本一次调用可以完成的任务,会被拆成更多轮;原本不需要模型参与的工作,也会被包装成 AI 任务;为了在排行榜上显得“使用充分”,冗余研究、反复改写与长时间空转都会变成合理动作。
这正是古德哈特定律在 AI 管理中的表现:当一个指标成为目标,它就会失去作为指标的意义。
媒体报道中已经出现这种荒诞场景:有员工为了排名发起不必要的模型调用,企业在算力账单上升后又紧急叫停排行榜;也有员工在内部额度收紧后,自费购买外部 AI 工具,只为了维持工作与考核要求。
问题不在于员工不够理性,恰恰相反,他们是在对错误的激励做出理性反应。
你考核调用量,就会得到更多调用;只有考核业务结果,才可能得到更多结果。
Token 可以进入财务账,但不应该直接进入成绩单
Token 不是完全没有管理价值。
它可以帮助企业观察模型成本、发现异常消耗、比较不同任务的运行效率,也可以作为计算 AI 投入产出比时的一项基础数据。
但它只能是分母,不能单独成为结论。
同样完成一份客户反馈分析,方案 A 消耗十万 Token,方案 B 消耗两万 Token;如果结果质量接近,后者显然更有效率。反过来,如果一个流程消耗大量 Token,却仍然需要人工重新整理、重复核对和手动录入,那么再高的调用量也只是把低效过程自动化了。
企业真正需要追问的不是“用了多少 AI”,而是:为完成一个确定的业务结果,一共投入了多少人力、时间与算力。
Token 应该帮助企业核算投产比,而不是替企业定义产出。
真正应该进入 KPI 的,是业务链条发生了什么变化
企业 AI 的价值,不应停留在模型这一层,而要沿着完整业务链条被验证。
对销售来说,值得观察的不是写了多少段跟进话术,而是线索录入、分配与首次联系是否更快,遗漏是否更少。
对财务来说,值得观察的不是识别了多少张发票,而是核验时间是否缩短,异常是否被准确拦截,人工复核是否减少。
对运营来说,值得观察的不是生成了多少份巡检摘要,而是现场问题是否及时进入台账,是否自动找到负责人,是否按期闭环。
这些指标没有 Token 那么统一,却更接近企业经营的真相。因为它们衡量的不是模型动了多少次,而是事情向前走了多少。
企业可以围绕四类结果建立自己的 AI 评估基线:任务完成率、处理周期、人工接管与返工、结构化数据沉淀。不同业务的具体口径可以不同,但共同原则只有一个——指标必须落在业务结果上。
AI 应该进入流程,而不是变成绩效表演
如果一项 AI 能力只有打开聊天框、主动发问时才会发生,它就很容易被“使用次数”绑架。
更成熟的方式,是把模型能力放进原本就要运行的业务流程中:用户提交信息时自动识别字段,数据进入系统后自动完成格式归一,异常出现时自动判断并交给规则引擎流转。
员工不需要为了证明自己在使用 AI,额外制造一次对话。AI 是否发挥作用,也不再依赖谁更勤快地点击工具,而是由业务结果直接体现。
这也是金数据把 AI 融入表单、表格与工作流时坚持的方向。AI 可以在后台理解非结构化内容、提取关键信息、完成语义对齐;真正触发分配、审批、通知和归档的,仍然是可验证的数据结构与确定性规则。
模型负责处理模糊性,业务系统负责交付确定性。
当两者被放在正确的位置上,企业看到的就不再是不断增长的对话轮数,而是信息是否一次收齐、流程是否自动推进、结果是否可以追踪。
别让员工成为机器的饲养员
企业当然需要鼓励员工学习 AI,也需要为探索保留预算和容错空间。但探索期的使用数据,不能直接等同于成熟期的经营指标。
如果组织只看调用次数,员工就会花时间证明自己调用过;如果组织只看 Token 排名,管理者最终得到的只会是一场昂贵的绩效表演。
企业落地 AI 的关键,不是让每个人都成为更熟练的机器饲养员,而是让机器接手那些可以被标准化、被验证、被自动流转的工作。
衡量 AI 是否成功,也应该回到最朴素的问题:事情有没有更快完成,错误有没有更少发生,人工有没有从重复劳动中被释放,数据有没有变成可以继续使用的资产。
成本增长只能证明机器更忙。业务结果增长,才能证明企业真的变得更强。
资料参考:钛媒体《大厂卷AI,打工人买单》;钛媒体《从“用了多少AI”到“Token效”:企业AI投入正在换尺子》。
