← 所有學員作品

自動化工作流 · Skill/工作流/自動化應用

AI 幾級了(ai-level-check)

做一個開源工具,讓 AI 去掃描你電腦硬碟裡跟 AI Agent 的真實對話紀錄,不打虛胖分數、不搞群體排名,用具體可追溯的客觀證據,評估個人與團隊的 AI 應用成熟度。

  • Codex
  • Antigravity
AI 幾級了(ai-level-check)

核心觀點

「讓 AI 來評估你的 AI 能力,不是讓人來評估。最準的方式,是讓 AI 去讀 AI 的使用紀錄。」
「人評人,有三件事躲不掉:看不到、記不住、有情緒。AI 讀得完每一則對話,也沒有今天心情好不好的問題。」

在 AI 工具大爆發的時代,無論是企業還是個人,評估「AI 到底用得怎麼樣」時常常陷入自欺欺人:主管問團隊只能得到「有啊很好用」;發問卷大家憑想像填;面試時應徵者吹噓精通 Prompt,面試官卻無法驗證真實操作。

這個開源專案直接讀取本機 Claude Code、Codex、Antigravity 留在硬碟上的對話紀錄,看使用者怎麼下指令、呼叫了哪些工具、怎麼修正、做出什麼成果,產出一份 有案例、可追溯 的單檔 HTML 能力報告。


成果畫面

報告總覽首頁

核心功能與特色

  • LV0–LV5 使用等級:從「問答靠運氣」到「模組化資產」與「自主運轉系統級營運」。
  • 16 型 AI 使用人物志:從交辦、查核、沉澱、動手四維度解析使用風格(例如 PVSE 系統建築師)。
  • 四項系統驗證與 5 種自動化齒輪:檢驗你做的東西真的被測過嗎、睡覺時系統還跑不跑。
  • 嚴格隱私紅線:純本機 Python 執行、不連網、不上傳;金鑰與敏感路徑存檔前自動脫敏;不做編造的全球排名或百分位。

我怎麼使用 AI 工具/Agent 做這件事

本專案由 CodexAntigravity 深度協作完成:

  1. Codex(核心邏輯與資料清洗)
    • 開發無外部依賴的 collect.py,解析大量 JSONL 對話日誌。
    • 實作「人機紀錄分流演算法」,將紀錄拆解為真人操作、排程 Bot 的 system prompt 與子代理。
    • 實作資料脫敏與匿名化處理。
  2. Antigravity(工作流整合與視覺報告呈現)
    • 建立 7 步 Skill 工作流程(同意閘門 → 證據包 → 定級規則 → 系統驗證 → 16 型人物志 → 單檔 HTML 報告書 → Git 存證)。
    • 調試單檔自包含 HTML 視覺儀表板,整合長條圖、交互式展開與響應式排版。

實作嘗試、卡關與踩坑突破

使用情境與工作法分佈

1. 人打的字 vs 機器打的字必須分流

第一版掃描 Claude Code 時,14 天對話中「使用者發言」中位數居然高達 1.6 萬字。追查才發現程式把半夜排程機器人(雷小蒙)的 system prompt 當成了人類發言。分流後雷蒙真人發言僅 42 則,中位數 120 字。這證明簡短精確的交辦才是高手常態,自動化紀錄也成為檢驗「人不在場時系統跑不跑」的黃金證據。

2. 「提到」跟「做了」是兩件事

偵測〈5 種永恆齒輪〉時,初版關鍵字掃描讓 5 顆齒輪全亮,深入查驗才發現 webhook 齒輪亮起竟是因為指令在 grep 搜尋關鍵字。規則收緊為「只認做了、不認提到」後降為真實的 3/5。一個會誤報的偵測器,比沒有偵測器更危險。

評估論證與人物志分型

3. 真實資料才抓得出的黑天鵝 Bug

拿真實驗證時抓出多項缺陷:Codex 的 plugin 清單被誤判為初始任務交辦、spawn_agent 漏認導致分工委派未被計入、開場背景說明被當成糾錯、diff 輸出混入假路徑等。

4. 發現自身系統漏洞,反哺 LifeOS

雷蒙本人初版報告跑出 LV4+,未達 LV5 的原因是缺少「資料出錯會主動中止」的紀錄。這項客觀發現直接暴露出雷蒙現行 Gmail 助理(email-assistant)在演講邀約資訊不足時會自行腦補報價的漏洞,雷蒙隨即在 skill 中補上 §4.4 缺漏閘門,實現了檢核工具反哺真實業務流程的閉環。


多 Agent 棲地圖與系統驗證

適用情境

  • 個人工作者:每月自檢一次,看自己是退化成把 AI 當聊天外包,還是持續把工作流固化成可複用的資產。
  • 面試招募:請應徵者本機跑報告並螢幕分享,看真實交辦習慣與糾錯能力,勝過千言萬語的口頭自吹。
  • 團隊賦能:成員在保有隱私前提下自主產出報告,評估團隊整體的 AI 齒輪覆蓋率與協作斷點。

製作心得與反思(初稿)

過去大家學 AI,多半在研究怎麼寫出更長的提示詞、收集更多「萬能咒語」。但在做「AI 幾級了」這個專案、回頭分析自己本機硬碟的 14 天日誌時,我看見了最震撼的數據:我本人在鍵盤前只手動交辦了 42 次、中位數僅僅 120 字,背後卻跑了 1,300 多次自動化排程與子代理。

這堂課程帶給我最大的認知躍遷,是不再把自己當成 AI 的「單次操作員」,而是退居幕後成為整個數位團隊的「系統架構師」

當這套工具如實把我判定為 LV4+、指出我缺少「系統遇到資料缺漏會主動中止」的證據時,我沒有絲毫沮喪,反而立刻去補齊了 Gmail 助理的缺漏閘門。那一刻我才真正體會到:真正的成熟不是追求表面的完美高分,而是擁有能把每一次踩坑固化成資產、讓系統持續自我演化與閉環的機制。這套專案和這堂課,真正解放了我對「被 AI 淘汰」的焦慮,轉而專注於累積屬於自己的數位 LifeOS。

課程評價&學習心得

過去大家學 AI,多半在研究怎麼寫出更長的提示詞、收集更多「萬能咒語」。但在做「AI 幾級了」這個專案、回頭分析自己本機硬碟的 14 天日誌時,我看見了最震撼的數據:我本人在鍵盤前只手動交辦了 42 次、中位數僅僅 120 字,背後卻跑了 1,300 多次自動化排程與子代理。 這堂課程帶給我最大的認知躍遷,是不再把自己當成 AI 的「單次操作員」,而是退居幕後成為整個數位團隊的「系統架構師」。 當這套工具如實把我判定為 LV4+、指出我缺少「系統遇到資料缺漏會主動中止」的證據時,我沒有絲毫沮喪,反而立刻去補齊了 Gmail 助理的缺漏閘門。那一刻我才真正體會到:真正的成熟不是追求表面的完美高分,而是擁有能把每一次踩坑固化成資產、讓系統持續自我演化與閉環的機制。這套專案和這堂課,真正解放了我對「被 AI 淘汰」的焦慮,轉而專注於累積屬於自己的數位 LifeOS。

留言與交流

使用 GitHub 帳號回覆作者,分享你的想法。