核心觀點與起點
「讓 AI 來評估你的 AI 能力,不是讓人來評估,這才是最準確的能力檢核方法。」
人評人,有三件事躲不掉:看不全、記不住、有情緒。
AI 能盤點你電腦上所有使用 AI 的紀錄,能讀完每一則對話、錯誤和摩擦,也沒有心情好壞的人際壓力問題。
| 想知道 AI 用得怎樣 | 以前怎麼判斷 | 卡在哪 |
|---|---|---|
| 主管問團隊 | 「最近有在用 AI 嗎?」 | 只會得到「有啊很好用」 |
| 發 AI 能力問卷 | 大家照想像中的自己填 | 填完誰也不知道真假 |
| 面試應徵者 | 聽他說自己精通 Prompt | 分不出真的用過還是前兩天惡補 |
「AI 幾級了」這個開源專案的起點,是我跟有序設計的陳敬儒吃飯時聊出來的。敬儒先做了一套通用檢核 Prompt,讓使用者手動貼上對話來健檢;我想再往前一步:能不能做成一個全自動掃描本機紀錄、有證據可追溯的開源工具?
成果畫面與核心特色
報告不打虛胖分數,只認 AI 使用紀錄裡看得到的證據。
等級從 LV0 到 LV5:
| 等級 | 名稱 | 紀錄裡看得到什麼 |
|---|---|---|
| LV0 | 問答靠人品 | 該補條件、該查核的任務,沒處理就採用答案 |
| LV1 | 換句話重問 | 察覺得到錯誤,靠換說法和多問幾次推進 |
| LV2 | 單點式應用 | 能穩定完成單一類任務,判斷得出答案能不能用 |
| LV3 | 精準下指令 | 給得出背景、範圍與完成標準,答錯時指得出具體問題 |
| LV4 | 模組化使用 | 把有效做法固定成模板、Skill 或代理,啟用前會實際測試 |
| LV5 | 系統級營運 | 分工、例外處理、維護與回寫整合成系統 |
- 四項系統驗證與 5 種自動化齒輪:檢驗做出來的東西真的被測過嗎、睡覺時系統還跑不跑。
- 隱私紅線:純本機 Python 執行、不連網、不上傳;金鑰與敏感路徑存檔前自動脫敏;不做排名或 PR 百分位(避免無謂的競爭意識)。
16 型 AI 使用人物志
等級看的是「做到哪」,人物志看的是「怎麼用」。報告從交辦、查核、沉澱、動手四個軸,把使用習慣組成 16 型:同樣是 LV3,有人是先想清楚、做完留下能跑的東西的「PVSE 系統建築師」,也有人是想到就試、試完就丟的「QVOE 直覺實驗家」。風格不是分數,沒有哪一型比較高級。
完整 16 型圖解在 GitHub 的人物志說明。
實作、卡關與踩坑突破
第一版,我發現不能讓 AI 只去掃對話紀錄,要分成「人主動發起的對話」&「機器發起的自動訊息」這樣分析才準。
1. 人打的字和機器打的字要分開算
第一版掃 Claude Code 時,14 天對話裡「使用者發言」高達 16 萬字。追查才發現,程式把半夜自動排程機器人(雷小蒙)的大段 system prompt 當成真人發言。分流後真人發言只有 42 則:簡短精確的交辦才是常態,自動化紀錄則變成檢驗「人不在場時系統跑不跑」的證據。
2. 「提到」跟「做了」是兩件事
偵測 5 種自動化齒輪時,初版關鍵字掃描會讓 5 個關卡都通過。深入查才發現,Webhook 齒輪會亮,只是因為某條指令在 grep 這個關鍵字。規則收緊成「只認做了、不認提到」後,降為真實的 3/5。
3. 真實資料才抓得到的邊界雜訊
用真實紀錄驗證時又抓出幾個缺陷:Codex 的 plugin 清單被誤判成初始任務交辦、spawn_agent 沒被認出來導致委派漏算、開場的背景說明被當成糾錯、diff 輸出混進假路徑。
4. 報告指出的缺口,直接拿去補真實系統
報告抓出的第一個缺口就在我們自己身上:系統裡缺少「資料出錯會主動中止」的紀錄。順著查下去,Gmail 助理(email-assistant)遇到演講邀約資訊不足時,會自己腦補報價,我接著在 Skill 補上缺漏閘門。
適用情境
| 誰在用 | 怎麼用 | 看什麼 |
|---|---|---|
| 個人工作者 | 每月自檢一次 | 是把 AI 當聊天外包,還是持續把工作流固化成資產 |
| 面試招募 | 請應徵者在自己電腦跑報告、螢幕分享 | 真實交辦習慣與糾錯能力,不靠口頭自述 |
| 團隊賦能 | 成員保有隱私、自主產出報告 | 組織整體的 AI 工具覆蓋率與協作斷點 |
使用者怎麼說
上線之後,陸續有人在 Discord、Threads、Facebook 分享自己跑出來的等級和心得;也有同學直接到 GitHub 開 issue,回報誤判、Windows 編碼與證據歸屬的問題(#1、#2、#4),或分享在其他 Agent 上的實測(#5)。
AI 使用能力評估工具對 AI Agent 課程的啟發
「AI 幾級了」上線之後,收到很多同學的使用回饋,所以我們陸續針對 LV4 與 LV5 加強了更多審核標準。
這份報告真正的價值不在分數。企業和用人方,可以看見團隊的 AI 用到哪裡、卡在哪裡;每天在用 AI 的人,可以知道自己還有哪些地方值得學,過去哪些流程其實能交給 AI 更自動化地完成。
把報告指出的缺口一個個補起來,AI 助理就會持續進化、承接更多任務,工作流程也跟著變好。這是我們做 AI Agent 課程一直想傳遞的事,也是想送給所有 AI 使用者的提醒:重點不是學會更多咒語,而是讓你的 AI 員工一次比一次可靠。
留言與交流
使用 GitHub 帳號回覆作者,分享你的想法。


