Dogfooding · 自测记录

我们连自己的系统
也用同一套方法测评

KNDLI 把向客户提案的测评与改善方法,原封不动地用在自家 AI 代理知识管理系统上。以公开评分标准 AKM Index v1.2 自测,总分 80.75/100、成熟度等级 M3,第 1 次 66.25 → 第 2 次 72.75 → 第 3 次 80.75,3 周内累计自我改善 +14.5 分。这是以五大支柱对抗式验证与证据门槛防止灌水的诚实记录。

要证明方法论不只是说说,最确实的方式就是用这套方法先测评我们自己。以下是分数与证据。

80.75
总分 / 100
M3
成熟度等级
+14.5
3 次累计自我改善
01

我们的系统
得几分?

公开评分标准 AKM Index v1.2 把知识管理系统分成五个领域评分。总分 80.75 分,成熟度等级 M3(协同编排)。强项与弱项都不隐藏,原样呈现。

AKM Index v1.2 · 第 3 次

提示词设计系统地管理交办 AI 工作的指令 16 / 20
上下文设计备好 AI 可参考的资料与记忆 18.75 / 25
运行环境设计让 AI 实际使用工具、执行工作的环境安全可靠 18 / 20
运营循环设计每天运行、检查、改善的循环结构 16 / 20
互操作 · 治理让多个 AI、设备、人按同一套规则协作,并设有安全机制 12 / 15
02
SELF-IMPROVEMENT

分数能
提升多少?

不是量一次就结束。第 1 次找出弱点、修正原因后在第 2 次再测,再修正后在第 3 次再测。不是炫耀新功能,而是加上验证循环与安全机制的结果。

第 1 次
66.25

首次测评。确认弱项与证据不足之处。

+6.5 自我改善
第 2 次 · 3 天后
72.75

修正静默失败的原因并加上验证循环。

+8.0 自我改善
第 3 次 · 2026-08-11
80.75

路由实测、元数据回填 100%、强化治理后再测。相比第 1 次累计 +14.5。

03

自测的分数
可以相信吗?

自己打的分数很容易灌水。所以我们设了三道机制,让它不是自评,而是可验证的测评。

01 · Public rubric

公开评分标准

不是用我们自定的尺子,而是用人人都能查看的公开标准(AKM Index v1.2)来量。同一张表,可以和其他组织比较。

02 · Adversarial review

对抗式验证小组

五个领域各设一个严格反驳的验证小组。它们的工作不是放水,而是挑毛病。

03 · Evidence gate

证据门槛

没有佐证产出就强制扣分。口头主张的等级不算数,要有实际记录分数才会上升。

04
THE EVIDENCE

系统修好系统的记录

这是分数依据的三项第 4 级产出。三项都在每天实际运行,正因为有这三项,系统才能自己找出问题并修好。

Level 4

持续记忆

学过一次的东西,下一次会话也记得。不必每次从头解释,知识不会散掉,而是积累起来。

Level 4

可观测性

把什么在何时、如何运行都留下记录。就连悄悄失败的工作也会在日志里现形,所以能回头找原因。

Level 4

定期回顾

按固定周期重新检查并改善自己。这次自测本身就是回顾循环的一部分,下一次再测的日程也已排定。

05

所以,实际上发生了什么

抽象的分数背后,是具体的一天。这套方法在实务中怎么运转,把实际的工作原样搬过来给你看。

一天内查明并修复 3 件静默失败的原因

通过可观测性日志,找出三件没有任何报错、却悄悄停摆的自动化。查出表面看似正常的任务真正的原因,并在当天修好。

亲自设计每日验证循环与记忆自动捕获

建立每天自我验证结果的循环,并让当天学到的东西自动留在团队记忆里。人忘了,系统也记得。

以护栏机制让难以回退的操作在人工审批前先停下

在发送、付款这类难以回退的步骤前设下护栏,即使已经自动化,也一定要经过人的确认。这是把安全放在速度之前的设计。

NEXT STEP

把这套方法,
也用在我们公司的系统上

用在我们自己身上的测评与改善,同样用到客户的 AI 系统。从现在处于什么位置、该先修哪里开始,一起诊断。

咨询诊断 看 AI 自动化咨询

※ 本页的分数与叙述,是以公开评分标准测评 KNDLI 自家系统的结果。客户资料与咨询内容不对外公开。

常见问题:知识管理自测

AKM Index 是什么?

AKM Index 是一套公开评分标准(v1.2),把 AI 代理知识管理系统的成熟度分成五个领域(提示词设计、上下文设计、运行环境设计、运营循环设计、互操作与治理),以 0 到 100 分评分。每个领域按行为标准分级,每一分都要求提供实际证据。KNDLI 以这套公开标准测评自家系统,总分 80.75 分、成熟度等级 M3。

KNDLI 为什么公开测评自家系统?

为了证明向客户提案的测评与改善方法,我们也同样用在自己的系统上。不说“会变好”,而是用公开标准公布得几分、哪里弱、几天内提升多少,用数字和证据说话。这种先测评自己的做法一般称为 dogfooding(自用实测),是方法论不只是说说、而是真的能运转的信任依据。

分数怎么验证?如何防止灌水?

五个领域各设一个对抗式验证小组,没有依据的项目强制扣分。要主张某个等级,就必须拿出持续记忆、可观测性日志、定期回顾记录这类实际存在的产出作为证据。没有证据分数就不会上升,因此从结构上杜绝了高估。从第 1 次 66.25 分升到第 3 次 80.75 分,也不是因为炫耀新功能,而是修正静默失败的原因、实际加上验证循环与安全机制的结果。

探索其他服务
完整作品集 AI 自动化咨询 AI曝光方案 AI 自动化 客制化AI教育 个人档案 联系