Dogfooding · 自测记录

我们连自家系统
也用同一套方法论测评

KNDLI 把提供给客户的测评·改进方法论,原样用在自家 AI 智能体知识管理系统上。以公开评分标准 AKM Index v1.1 自测,总分 72.75/100、成熟度 M3,并从第 1 次的 66.25 分出发,3 天内自我改进 +6.5 分。这是一份用五大支柱对抗式验证与证据门槛防止虚高的诚实记录。

要证明方法论不是空谈,最可靠的方式,就是先用它测评我们自己。以下就是那份分数与证据。

72.75
总分 / 100
M3
成熟度等级
+6.5
3 天自我改进
01

用数字看我们的系统

公开评分标准 AKM Index v1.1 将知识管理系统分成五大领域打分。总分 72.75 分、成熟度 M3(Orchestration)。强项与弱项都不遮掩,如实呈现。

AKM Index v1.1 · 第 2 次测评

提示词设计系统地管理指派 AI 工作的指令文本 15 / 20
上下文设计为 AI 备好可参考的资料与记忆 15 / 25
Harness 设计让 AI 实际使用工具作业的环境安全可靠 17 / 20
运营循环设计每天运行、检查、改进的循环结构 16 / 20
互操作 · 治理让多个 AI、设备与人按同一套规则协作,并设有安全机制 9.75 / 15
02
SELF-IMPROVEMENT

3 天内自己拉高的分数

不是测一次就结束。我们在第 1 次测评确认弱点,实际修复其原因,再在第 2 次重新测评。不是炫耀新功能,而是补上验证循环与安全机制的结果。

第 1 次
66.25

首次测评。确认偏弱的领域与证据不足之处。

+6.5 自我改进
第 2 次 · 3 天后
72.75

修复原因后重新测评。保持 M3 等级,总分上升。

03

让分数值得信任的三道机制

自己打的分数很容易虚高。因此我们设下三道机制,让它不是自说自话的打分,而是可验证的测评。

01 · Public rubric

公开评分标准

用的不是我们自定的尺子,而是任何人都能查阅的公开标准(AKM Index v1.1)。同一张表也能与其他组织比较。

02 · Adversarial review

对抗式验证小组

五大领域各设一个严格反驳的验证小组。它的角色不是说好话,而是挑出毛病。

03 · Evidence gate

证据门槛

没有佐证产出就强制扣分。只凭口头主张的等级不被承认,必须有实际记录,分数才会上升。

04
THE EVIDENCE

系统修复系统的记录

以下是支撑分数的三项 Level 4 产出。三者如今每天实际运行,正因为有这三项,系统才能自己发现问题、自己修复。

Level 4

持续性记忆

学过一次的事,下一个会话仍然记得。不必每次从头说明,知识不会散落,而是持续积累。

Level 4

可观测性

什么任务在何时、如何运行,都留有记录。连悄悄失败的作业也会在日志中现形,因此能回溯原因。

Level 4

周期性复盘

按固定周期重新检视并改进自己。这份自测本身就是该复盘循环的一部分,下一次重测日程也已排定。

05

那么,实际发生了什么

抽象的分数背后,是具体的每一天。这套方法论在实务中如何运转,我们原样搬给您看。

一天内查明 3 起静默失败的原因并完成修复

三起没有任何报错、却悄悄停摆的自动化,靠可观测性日志找了出来。表面看似正常的作业,我们揪出真正原因,当天就修好。

亲手设计每日验证循环与记忆自动捕获

建立每天自我验证结果的循环,让当天学到的内容自动留进团队记忆。即使人忘了,系统也记得。

用护栏钩子让难以回退的操作停在人工审批之前

在发送、支付这类难以回退的步骤前设置护栏,即使已经自动化,也必须经过人的确认。这是把安全放在速度之前的设计。

NEXT STEP

把这套方法论,
也用在贵公司的系统上

我们用在自己身上的测评与改进,也同样应用到客户的 AI 系统。从您现在处于哪个阶段、该先修哪里开始,与您一起诊断。

咨询诊断 查看 AI 自动化咨询服务

※ 本页的分数与叙事,是以公开评分标准测评 KNDLI 自家系统的结果。客户资料与咨询内容一律不对外公开。

常见问题 — 知识管理自测

什么是 AKM Index?

AKM Index 是一套公开评分标准(v1.1),把 AI 智能体知识管理系统的成熟度分为五大领域(提示词设计、上下文设计、Harness 设计、运营循环设计、互操作·治理),按 0 到 100 分打分。每个领域按行为基准划分等级,每项分数都要求提交实际佐证材料。KNDLI 以这套公开标准测评自家系统,获得总分 72.75 分、成熟度 M3。

KNDLI 为什么要公开测评自家系统?

为了证明我们提给客户的测评与改进方法论,也同样用在自己的系统上。与其空口说“会变好”,不如以公开标准公开现在几分、哪里偏弱、几天内提升了多少,全部用数字与证据说话。这种先测评自己的做法通常称为 Dogfooding,是方法论不只是口号、确实可行的信任依据。

分数如何验证、如何防止虚高?

五大领域各设对抗式验证小组,没有依据的项目强制扣分。要主张某个等级,必须提交实际存在的产出作为证据,例如持续性记忆、可观测性日志、周期复盘记录。没有证据分数就不会上升,从结构上防止虚高。从第 1 次的 66.25 分升到第 2 次的 72.75 分,也不是因为炫耀新功能,而是修复静默失败的原因、实际补上验证循环与安全机制的结果。

探索其他服务
完整作品集 AI 自动化咨询 AI曝光方案 AI 自动化 客制化AI教育 个人档案 联系