← 所有學員作品

AI 使用能力評估工具:讀 Claude Code、Codex 真實對話紀錄,檢測個人與團隊的 AI 成熟度

純本機執行的開源 Skill「AI 幾級了」:讓 AI 讀 Claude Code、Codex、Antigravity 留在硬碟上的真實對話紀錄,產出 LV0–LV5 等級與改善建議,適合個人自檢、團隊 AI 導入盤點與面試評估。

  • Skill/工作流/自動化應用
  • 團隊管理
  • 開源專案
  • 效率工具
  • Claude Code
  • Codex
  • Antigravity

核心觀點與起點

「讓 AI 來評估你的 AI 能力,不是讓人來評估,這才是最準確的能力檢核方法。」

人評人,有三件事躲不掉:看不全、記不住、有情緒。

AI 能盤點你電腦上所有使用 AI 的紀錄,能讀完每一則對話、錯誤和摩擦,也沒有心情好壞的人際壓力問題。

想知道 AI 用得怎樣以前怎麼判斷卡在哪
主管問團隊「最近有在用 AI 嗎?」只會得到「有啊很好用」
發 AI 能力問卷大家照想像中的自己填填完誰也不知道真假
面試應徵者聽他說自己精通 Prompt分不出真的用過還是前兩天惡補

「AI 幾級了」這個開源專案的起點,是我跟有序設計的陳敬儒吃飯時聊出來的。敬儒先做了一套通用檢核 Prompt,讓使用者手動貼上對話來健檢;我想再往前一步:能不能做成一個全自動掃描本機紀錄、有證據可追溯的開源工具?

流程圖載入中…

成果畫面與核心特色

報告不打虛胖分數,只認 AI 使用紀錄裡看得到的證據。

等級從 LV0 到 LV5:

等級名稱紀錄裡看得到什麼
LV0問答靠人品該補條件、該查核的任務,沒處理就採用答案
LV1換句話重問察覺得到錯誤,靠換說法和多問幾次推進
LV2單點式應用能穩定完成單一類任務,判斷得出答案能不能用
LV3精準下指令給得出背景、範圍與完成標準,答錯時指得出具體問題
LV4模組化使用把有效做法固定成模板、Skill 或代理,啟用前會實際測試
LV5系統級營運分工、例外處理、維護與回寫整合成系統
  • 四項系統驗證與 5 種自動化齒輪:檢驗做出來的東西真的被測過嗎、睡覺時系統還跑不跑。
  • 隱私紅線:純本機 Python 執行、不連網、不上傳;金鑰與敏感路徑存檔前自動脫敏;不做排名或 PR 百分位(避免無謂的競爭意識)。

16 型 AI 使用人物志

等級看的是「做到哪」,人物志看的是「怎麼用」。報告從交辦、查核、沉澱、動手四個軸,把使用習慣組成 16 型:同樣是 LV3,有人是先想清楚、做完留下能跑的東西的「PVSE 系統建築師」,也有人是想到就試、試完就丟的「QVOE 直覺實驗家」。風格不是分數,沒有哪一型比較高級。

完整 16 型圖解在 GitHub 的人物志說明。

實作、卡關與踩坑突破

第一版,我發現不能讓 AI 只去掃對話紀錄,要分成「人主動發起的對話」&「機器發起的自動訊息」這樣分析才準。

1. 人打的字和機器打的字要分開算

第一版掃 Claude Code 時,14 天對話裡「使用者發言」高達 16 萬字。追查才發現,程式把半夜自動排程機器人(雷小蒙)的大段 system prompt 當成真人發言。分流後真人發言只有 42 則:簡短精確的交辦才是常態,自動化紀錄則變成檢驗「人不在場時系統跑不跑」的證據。

2. 「提到」跟「做了」是兩件事

偵測 5 種自動化齒輪時,初版關鍵字掃描會讓 5 個關卡都通過。深入查才發現,Webhook 齒輪會亮,只是因為某條指令在 grep 這個關鍵字。規則收緊成「只認做了、不認提到」後,降為真實的 3/5。

3. 真實資料才抓得到的邊界雜訊

用真實紀錄驗證時又抓出幾個缺陷:Codex 的 plugin 清單被誤判成初始任務交辦、spawn_agent 沒被認出來導致委派漏算、開場的背景說明被當成糾錯、diff 輸出混進假路徑。

4. 報告指出的缺口,直接拿去補真實系統

報告抓出的第一個缺口就在我們自己身上:系統裡缺少「資料出錯會主動中止」的紀錄。順著查下去,Gmail 助理(email-assistant)遇到演講邀約資訊不足時,會自己腦補報價,我接著在 Skill 補上缺漏閘門。

適用情境

誰在用怎麼用看什麼
個人工作者每月自檢一次是把 AI 當聊天外包,還是持續把工作流固化成資產
面試招募請應徵者在自己電腦跑報告、螢幕分享真實交辦習慣與糾錯能力,不靠口頭自述
團隊賦能成員保有隱私、自主產出報告組織整體的 AI 工具覆蓋率與協作斷點

使用者怎麼說

上線之後,陸續有人在 Discord、Threads、Facebook 分享自己跑出來的等級和心得;也有同學直接到 GitHub 開 issue,回報誤判、Windows 編碼與證據歸屬的問題(#1、#2、#4),或分享在其他 Agent 上的實測(#5)。

AI 使用能力評估工具對 AI Agent 課程的啟發

「AI 幾級了」上線之後,收到很多同學的使用回饋,所以我們陸續針對 LV4 與 LV5 加強了更多審核標準。

這份報告真正的價值不在分數。企業和用人方,可以看見團隊的 AI 用到哪裡、卡在哪裡;每天在用 AI 的人,可以知道自己還有哪些地方值得學,過去哪些流程其實能交給 AI 更自動化地完成。

把報告指出的缺口一個個補起來,AI 助理就會持續進化、承接更多任務,工作流程也跟著變好。這是我們做 AI Agent 課程一直想傳遞的事,也是想送給所有 AI 使用者的提醒:重點不是學會更多咒語,而是讓你的 AI 員工一次比一次可靠。

留言與交流

使用 GitHub 帳號回覆作者,分享你的想法。