水墨:攤開的筆記本、放大鏡與被拆解端詳的零件
記 ── 工具實測的那一翼

AI 兵器庫

我實測過、在用、或正在雷達上觀望的 AI 工具,各一句真實判斷,並連到我用它做出來的東西。不是工具導覽,是一個動手做的人的取捨——這把趁手、那把還在試。和動態雷達連動:掃到值得試的,先進這裡觀望,試成了就寫進筆記。

生圖

  • ComfyUI + RealVisXL(SDXL) 主力

    本地生圖的主力。免費、可離線,寫實場景的品質夠撐一整條產線——宮格分鏡、封面、配圖都靠它。

  • Codex CLI(gpt-image-2) 在用

    雲端頂規畫質,但有配額。留給最關鍵的那一張:封面、hero shot。站上的水墨插畫多半出自這裡。

    用在 工具箱
  • Krea2 觀望

    六月剛進 ComfyUI 的開源圖像模型,RAW / Turbo 雙版本。Turbo 主打快,批量宮格圖也許更省時——還沒實測。

  • Z-Image Turbo 觀望

    ComfyUI 六月新進的開源快速生圖模型。犧牲一點極致畫質換生成速度,批量宮格分鏡圖最吃的就是這個——從 AI 雷達追到的,排隊實測中。

影片

  • Grok CLI(圖轉影片 I2V) 在用·受限

    SuperGrok 的 I2V,品質好,但每日限額被砍到剩約十分之一,成本高了快十倍。現在只敢用在刀口上。

  • LTX-2 觀望

    雷達上的頭號目標。能在本地 RTX 顯卡跑 4K 影片,有機會補上 Grok 被砍配額的缺口,把影片這段也搬回本地。正要實測。

  • MuseTalk 試過

    真人臉型影片的對嘴。能用,但對素材臉型挑,目前不是主線。

語音

  • GPT-SoVITS 主力

    本地聲音克隆,免費。旁白用的是我自己的聲音——情緒由參考音決定,長口播會分段換語氣。

  • edge-tts 在用

    微軟神經語音,免費、零配額。一支短劇裡不同角色用不同聲線,靠它。

LLM · 協作

  • Claude Code 主力

    這個站、自動化管線、大半的程式,都是跟它一起做的。瓶頸從來不是它,是我的電池。

  • Gemma 4 + Ollama 觀望

    本地 LLM 的「能力對 VRAM 比」一直在進步。想把工作流裡的 LLM 那段也搬回本地,讓客戶資料一個位元組都不出門。

  • GLM-5.2 Coding Plan / Zcode 試過

    改一個環境變數就能在 Claude Code 裡把 Claude 換成 GLM-5.2,月費最低約台幣四百;Zcode 是它的圖形介面版。我用 ZCode 讓它寫了一支完整的 3D 瀏覽器賽車——便宜六分之一的檔位真的能打。日常任務拿它省配額,硬任務與客戶資料留頂規。

  • Kimi K3(月之暗面) 觀望

    2.8 兆參數 MoE、百萬上下文、開放權重。跑分站進前十,但價格不便宜(輸出 $15/1M,是 GLM 的三點四倍)。我盯的是它的長文本與 Agent 那一格——讀百萬字文件、長鏈條自動化可能卡得進來。還沒實測,等權重 7/27 釋出再說。

  • Hermes Agent 觀望

    NousResearch 的開源 agent,能把雲端 Codex(走 ChatGPT 訂閱)和本地模型(ollama/lmstudio)混在同一條工作流——Codex 配額撞牆時切本地繼續、不中斷。對常撞 Codex 配額的我是實際解方,排隊實測。

音樂

  • Mureka · Suno 試過

    把說不動的東西寫成歌。出過三首,完整歌詞在工作檯的「AI 詞曲創作」。研究當遊戲,沒有商業企圖。

自動化

  • Cloudflare Workers 主力

    無人值守的雲端產線骨架。電腦不用開機,帳單趨近於零——自然界偵探局就跑在上面。

  • GitHub Actions 主力

    定時喚醒 AI 上班的排程器。思哲慢讀的圖文,就是它半夜把 AI 叫起來寫的。

    用在 思哲慢讀

狀態會隨實測更新:主力=產線天天在用 · 在用=有在用但非核心 · 試過=測過、暫不主推 · 觀望=雷達上,還沒動手。