Dogfooding · 自我評測紀錄

我們連自家系統
也用同一套方法論評測

KNDLI 將提供給客戶的評測·改善方法論,原封不動地套用在自家 AI 代理知識管理系統上。以公開評分標準 AKM Index v1.1 自我評測,總分 72.75/100、成熟度 M3,並從第 1 次的 66.25 分出發,3 天內自我改善 +6.5 分。這是一份以五大支柱對抗式驗證與證據關卡防止灌水的誠實紀錄。

要證明方法論不是空談,最可靠的方式,就是先用它評測我們自己。以下就是那份分數與證據。

72.75
總分 / 100
M3
成熟度等級
+6.5
3 天自我改善
01

用數字看我們的系統

公開評分標準 AKM Index v1.1 將知識管理系統分成五大領域評分。總分 72.75 分、成熟度 M3(Orchestration)。強項與弱項都不遮掩,如實呈現。

AKM Index v1.1 · 第 2 次評測

提示詞設計有系統地管理指派 AI 工作的指示文 15 / 20
上下文設計為 AI 備妥可參考的資料與記憶 15 / 25
Harness 設計讓 AI 實際使用工具作業的環境安全可靠 17 / 20
營運循環設計每天執行、檢查、改善的反覆結構 16 / 20
互通性 · 治理讓多個 AI、裝置與人依同一套規則協作,並設有安全機制 9.75 / 15
02
SELF-IMPROVEMENT

3 天內自己拉高的分數

不是量一次就結束。我們在第 1 次評測確認弱點,實際修正其原因,再於第 2 次重新評測。不是炫耀新功能,而是補上驗證循環與安全機制的結果。

第 1 次
66.25

首次評測。確認偏弱的領域與證據不足之處。

+6.5 自我改善
第 2 次 · 3 天後
72.75

修正原因後重新評測。維持 M3 等級,總分上升。

03

讓分數值得信任的三道機制

自己打的分數很容易灌水。因此我們設下三道機制,讓它不是自說自話的打分,而是可驗證的評測。

01 · Public rubric

公開評分標準

用的不是我們自訂的尺,而是任何人都能查閱的公開標準(AKM Index v1.1)。同一張表也能與其他組織比較。

02 · Adversarial review

對抗式驗證小組

五大領域各設一個嚴格反駁的驗證小組。它的角色不是說好話,而是挑出毛病。

03 · Evidence gate

證據關卡

沒有佐證產出就強制扣分。只憑口頭主張的等級不被承認,必須有實際紀錄,分數才會上升。

04
THE EVIDENCE

系統修復系統的紀錄

以下是支撐分數的三項 Level 4 產出。三者如今每天實際運作,正因為有這三項,系統才能自己找出問題、自己修復。

Level 4

持續性記憶

學過一次的事,下一個工作階段仍然記得。不必每次從頭說明,知識不會四散,而是持續累積。

Level 4

可觀測性

什麼工作在何時、如何執行,都留有紀錄。連悄悄失敗的作業也會在日誌中現形,因此能回溯原因。

Level 4

週期性檢視

依固定週期重新檢視並改善自己。這份自我評測本身就是那個檢視循環的一部分,下一次重測日程也已排定。

05

那麼,實際發生了什麼

抽象的分數背後,是具體的每一天。這套方法論在實務中如何運作,我們原封不動地搬給您看。

一天內查明 3 件靜默失敗的原因並完成修復

三件沒有任何錯誤訊息、卻悄悄停擺的自動化,靠可觀測性日誌找了出來。表面看似正常的作業,我們揪出真正原因,當天就修好。

親手設計每日驗證循環與記憶自動擷取

建立每天自我驗證結果的循環,讓當天學到的內容自動留進團隊記憶。即使人忘了,系統也記得。

以護欄掛鉤讓難以回復的作業停在人工核准之前

在寄送、付款這類難以回復的步驟前設置護欄,即使已經自動化,也必須經過人的確認。這是把安全擺在速度之前的設計。

NEXT STEP

把這套方法論,
也用在貴公司的系統上

我們用在自己身上的評測與改善,也同樣套用到客戶的 AI 系統。從您現在位於哪個階段、該先修哪裡開始,與您一起診斷。

諮詢診斷 查看 AI 自動化顧問服務

※ 本頁的分數與敘事,是以公開評分標準評測 KNDLI 自家系統的結果。客戶資料與諮詢內容一律不對外公開。

常見問題 — 知識管理自我評測

什麼是 AKM Index?

AKM Index 是一套公開評分標準(v1.1),將 AI 代理知識管理系統的成熟度分為五大領域(提示詞設計、上下文設計、Harness 設計、營運循環設計、互通性·治理),以 0 到 100 分評分。每個領域依行為基準劃分等級,每項分數都要求提出實際佐證資料。KNDLI 以這套公開標準評測自家系統,獲得總分 72.75 分、成熟度 M3。

KNDLI 為什麼要公開評測自家系統?

為了證明我們提給客戶的評測與改善方法論,也同樣套用在自己的系統上。與其空口說「會變好」,不如以公開標準揭露現在幾分、哪裡偏弱、幾天內提升了多少,全部用數字與證據公開。這種先評測自己的做法通常稱為 Dogfooding,是方法論不只是口號、確實可行的信任依據。

分數如何驗證、如何防止灌水?

五大領域各設對抗式驗證小組,沒有依據的項目強制扣分。要主張某個等級,必須提出實際存在的產出作為證據,例如持續性記憶、可觀測性日誌、週期檢視紀錄。沒有證據分數就不會上升,從結構上防止高估。從第 1 次的 66.25 分升到第 2 次的 72.75 分,也不是因為炫耀新功能,而是修復靜默失敗的原因、實際補上驗證循環與安全機制的結果。

探索其他服務
完整作品集 AI 自動化顧問 AI曝光方案 AI 自動化 客製化AI教育 個人檔案 聯繫