Dogfooding · 自我評測紀錄

我們連自己的系統
也用同一套方法測量

KNDLI 把向客戶提案的測量與改善方法,原封不動地套用在自家 AI 代理知識管理系統上。以公開評分標準 AKM Index v1.2 自我評測,總分 80.75/100、成熟度等級 M3,第 1 次 66.25 → 第 2 次 72.75 → 第 3 次 80.75,3 週內累計自我改善 +14.5 分。這是以五大支柱對抗式驗證與證據門檻防止灌水的誠實紀錄。

要證明方法論不只是說說,最確實的方式就是用這套方法先測量我們自己。以下是分數與證據。

80.75
總分 / 100
M3
成熟度等級
+14.5
3 次累計自我改善
01

我們的系統
得幾分?

公開評分標準 AKM Index v1.2 把知識管理系統分成五個領域評分。總分 80.75 分,成熟度等級 M3(協同編排)。強項與弱項都不隱藏,原樣呈現。

AKM Index v1.2 · 第 3 次

提示詞設計有系統地管理交辦 AI 工作的指令 16 / 20
脈絡設計備妥 AI 可參考的資料與記憶 18.75 / 25
執行環境設計讓 AI 實際使用工具、執行工作的環境安全可靠 18 / 20
營運循環設計每天執行、檢查、改善的循環結構 16 / 20
互通 · 治理讓多個 AI、裝置、人依同一套規則協作,並設有安全機制 12 / 15
02
SELF-IMPROVEMENT

分數能
提升多少?

不是量一次就結束。第 1 次找出弱點、修正原因後在第 2 次再測,再修正後在第 3 次再測。不是炫耀新功能,而是加上驗證循環與安全機制的結果。

第 1 次
66.25

首次測量。確認弱項與證據不足之處。

+6.5 自我改善
第 2 次 · 3 天後
72.75

修正靜默失敗的原因並加上驗證循環。

+8.0 自我改善
第 3 次 · 2026-08-11
80.75

路由實測、中繼資料回填 100%、強化治理後再測。相較第 1 次累計 +14.5。

03

自我評測的分數
可以相信嗎?

自己打的分數很容易灌水。所以我們設了三道機制,讓它不是自評,而是可驗證的測量。

01 · Public rubric

公開評分標準

不是用我們自訂的尺,而是用人人都能查看的公開標準(AKM Index v1.2)來量。同一張表,可以和其他組織比較。

02 · Adversarial review

對抗式驗證小組

五個領域各設一個嚴格反駁的驗證小組。它們的工作不是放水,而是挑毛病。

03 · Evidence gate

證據門檻

沒有佐證產出就強制扣分。口頭主張的等級不算數,要有實際紀錄分數才會上升。

04
THE EVIDENCE

系統修好系統的紀錄

這是分數依據的三項第 4 級產出。三項都在每天實際運作,正因為有這三項,系統才能自己找出問題並修好。

Level 4

持續記憶

學過一次的東西,下一次對話也記得。不必每次從頭解釋,知識不會散掉,而是累積起來。

Level 4

可觀測性

把什麼在何時、如何執行都留下紀錄。就連靜靜失敗的工作也會在日誌裡現形,所以能回頭找原因。

Level 4

定期檢視

依固定週期重新檢查並改善自己。這次自我評測本身就是檢視循環的一部分,下一次再測的時程也已排定。

05

所以,實際上發生了什麼

抽象的分數背後,是具體的一天。這套方法在實務上怎麼運作,把實際的工作原樣搬過來給你看。

一天內查明並修復 3 件靜默失敗的原因

透過可觀測性日誌,找出三件沒有任何錯誤訊息、卻悄悄停擺的自動化。查出表面看似正常的工作真正的原因,並在當天修好。

親自設計每日驗證循環與記憶自動擷取

建立每天自我驗證結果的循環,並讓當天學到的東西自動留在團隊記憶裡。人忘了,系統也記得。

以護欄機制讓難以回復的作業在人工核准前先停下

在寄送、付款這類難以回復的步驟前設下護欄,即使已經自動化,也一定要經過人的確認。這是把安全放在速度之前的設計。

NEXT STEP

把這套方法,
也用在我們公司的系統上

用在我們自己身上的測量與改善,同樣套用到客戶的 AI 系統。從現在在哪個位置、該先修哪裡開始,一起診斷。

洽詢診斷 看 AI 自動化顧問

※ 本頁的分數與敘述,是以公開評分標準測量 KNDLI 自家系統的結果。客戶資料與諮詢內容不對外公開。

常見問題:知識管理自我評測

AKM Index 是什麼?

AKM Index 是一套公開評分標準(v1.2),把 AI 代理知識管理系統的成熟度分成五個領域(提示詞設計、脈絡設計、執行環境設計、營運循環設計、互通與治理),以 0 到 100 分評分。每個領域依行為標準分級,每一分都要求提出實際證據。KNDLI 以這套公開標準測量自家系統,總分 80.75 分、成熟度等級 M3。

KNDLI 為什麼公開測量自家系統?

為了證明向客戶提案的測量與改善方法,我們也同樣用在自己的系統上。不說「會變好」,而是用公開標準公布得幾分、哪裡弱、幾天內提升多少,用數字和證據說話。這種先測量自己的做法一般稱為 dogfooding(自家實測),是方法論不只是說說、而是真的能運作的信任依據。

分數怎麼驗證?如何防止灌水?

五個領域各設一個對抗式驗證小組,沒有依據的項目強制扣分。要主張某個等級,就必須拿出持續記憶、可觀測性日誌、定期檢視紀錄這類實際存在的產出當證據。沒有證據分數就不會上升,因此從結構上杜絕了高估。從第 1 次 66.25 分升到第 3 次 80.75 分,也不是因為炫耀新功能,而是修正靜默失敗的原因、實際加上驗證循環與安全機制的結果。

探索其他服務
完整作品集 AI 自動化顧問 AI曝光方案 AI 自動化 客製化AI教育 個人檔案 聯繫