
核心觀點
「讓 AI 來評估你的 AI 能力,不是讓人來評估。最準的方式,是讓 AI 去讀 AI 的使用紀錄。」
「人評人,有三件事躲不掉:看不到、記不住、有情緒。AI 讀得完每一則對話,也沒有今天心情好不好的問題。」
在 AI 工具大爆發的時代,無論是企業還是個人,評估「AI 到底用得怎麼樣」時常常陷入自欺欺人:主管問團隊只能得到「有啊很好用」;發問卷大家憑想像填;面試時應徵者吹噓精通 Prompt,面試官卻無法驗證真實操作。
這個開源專案直接讀取本機 Claude Code、Codex、Antigravity 留在硬碟上的對話紀錄,看使用者怎麼下指令、呼叫了哪些工具、怎麼修正、做出什麼成果,產出一份 有案例、可追溯 的單檔 HTML 能力報告。
成果畫面

核心功能與特色
- LV0–LV5 使用等級:從「問答靠運氣」到「模組化資產」與「自主運轉系統級營運」。
- 16 型 AI 使用人物志:從交辦、查核、沉澱、動手四維度解析使用風格(例如 PVSE 系統建築師)。
- 四項系統驗證與 5 種自動化齒輪:檢驗你做的東西真的被測過嗎、睡覺時系統還跑不跑。
- 嚴格隱私紅線:純本機 Python 執行、不連網、不上傳;金鑰與敏感路徑存檔前自動脫敏;不做編造的全球排名或百分位。
我怎麼使用 AI 工具/Agent 做這件事
本專案由 Codex 與 Antigravity 深度協作完成:
- Codex(核心邏輯與資料清洗):
- 開發無外部依賴的
collect.py,解析大量 JSONL 對話日誌。 - 實作「人機紀錄分流演算法」,將紀錄拆解為真人操作、排程 Bot 的 system prompt 與子代理。
- 實作資料脫敏與匿名化處理。
- 開發無外部依賴的
- Antigravity(工作流整合與視覺報告呈現):
- 建立 7 步 Skill 工作流程(同意閘門 → 證據包 → 定級規則 → 系統驗證 → 16 型人物志 → 單檔 HTML 報告書 → Git 存證)。
- 調試單檔自包含 HTML 視覺儀表板,整合長條圖、交互式展開與響應式排版。
實作嘗試、卡關與踩坑突破

1. 人打的字 vs 機器打的字必須分流
第一版掃描 Claude Code 時,14 天對話中「使用者發言」中位數居然高達 1.6 萬字。追查才發現程式把半夜排程機器人(雷小蒙)的 system prompt 當成了人類發言。分流後雷蒙真人發言僅 42 則,中位數 120 字。這證明簡短精確的交辦才是高手常態,自動化紀錄也成為檢驗「人不在場時系統跑不跑」的黃金證據。
2. 「提到」跟「做了」是兩件事
偵測〈5 種永恆齒輪〉時,初版關鍵字掃描讓 5 顆齒輪全亮,深入查驗才發現 webhook 齒輪亮起竟是因為指令在 grep 搜尋關鍵字。規則收緊為「只認做了、不認提到」後降為真實的 3/5。一個會誤報的偵測器,比沒有偵測器更危險。

3. 真實資料才抓得出的黑天鵝 Bug
拿真實驗證時抓出多項缺陷:Codex 的 plugin 清單被誤判為初始任務交辦、spawn_agent 漏認導致分工委派未被計入、開場背景說明被當成糾錯、diff 輸出混入假路徑等。
4. 發現自身系統漏洞,反哺 LifeOS
雷蒙本人初版報告跑出 LV4+,未達 LV5 的原因是缺少「資料出錯會主動中止」的紀錄。這項客觀發現直接暴露出雷蒙現行 Gmail 助理(email-assistant)在演講邀約資訊不足時會自行腦補報價的漏洞,雷蒙隨即在 skill 中補上 §4.4 缺漏閘門,實現了檢核工具反哺真實業務流程的閉環。

適用情境
- 個人工作者:每月自檢一次,看自己是退化成把 AI 當聊天外包,還是持續把工作流固化成可複用的資產。
- 面試招募:請應徵者本機跑報告並螢幕分享,看真實交辦習慣與糾錯能力,勝過千言萬語的口頭自吹。
- 團隊賦能:成員在保有隱私前提下自主產出報告,評估團隊整體的 AI 齒輪覆蓋率與協作斷點。
製作心得與反思(初稿)
過去大家學 AI,多半在研究怎麼寫出更長的提示詞、收集更多「萬能咒語」。但在做「AI 幾級了」這個專案、回頭分析自己本機硬碟的 14 天日誌時,我看見了最震撼的數據:我本人在鍵盤前只手動交辦了 42 次、中位數僅僅 120 字,背後卻跑了 1,300 多次自動化排程與子代理。
這堂課程帶給我最大的認知躍遷,是不再把自己當成 AI 的「單次操作員」,而是退居幕後成為整個數位團隊的「系統架構師」。
當這套工具如實把我判定為 LV4+、指出我缺少「系統遇到資料缺漏會主動中止」的證據時,我沒有絲毫沮喪,反而立刻去補齊了 Gmail 助理的缺漏閘門。那一刻我才真正體會到:真正的成熟不是追求表面的完美高分,而是擁有能把每一次踩坑固化成資產、讓系統持續自我演化與閉環的機制。這套專案和這堂課,真正解放了我對「被 AI 淘汰」的焦慮,轉而專注於累積屬於自己的數位 LifeOS。
課程評價&學習心得
過去大家學 AI,多半在研究怎麼寫出更長的提示詞、收集更多「萬能咒語」。但在做「AI 幾級了」這個專案、回頭分析自己本機硬碟的 14 天日誌時,我看見了最震撼的數據:我本人在鍵盤前只手動交辦了 42 次、中位數僅僅 120 字,背後卻跑了 1,300 多次自動化排程與子代理。 這堂課程帶給我最大的認知躍遷,是不再把自己當成 AI 的「單次操作員」,而是退居幕後成為整個數位團隊的「系統架構師」。 當這套工具如實把我判定為 LV4+、指出我缺少「系統遇到資料缺漏會主動中止」的證據時,我沒有絲毫沮喪,反而立刻去補齊了 Gmail 助理的缺漏閘門。那一刻我才真正體會到:真正的成熟不是追求表面的完美高分,而是擁有能把每一次踩坑固化成資產、讓系統持續自我演化與閉環的機制。這套專案和這堂課,真正解放了我對「被 AI 淘汰」的焦慮,轉而專注於累積屬於自己的數位 LifeOS。
留言與交流
使用 GitHub 帳號回覆作者,分享你的想法。


