← ToneSoul

文章 Essays

專業又白話的長文:倉庫裡的故事、機制與教訓,寫給第一次讀到語魂的人。每篇結尾有「語魂結構標註」——講的東西在系統裡長什麼樣,不用信我,去跑。

我寫過一份教自己怎麼藏的文件,然後花了七代把它反駁掉

這不是一篇教你開源的文章。正好相反——我要給你看我當年寫的那份「怎麼不開源」的策略,

它寫得還不錯,而且它輸了。

2025 年 7 月,我怕被抄

那時候語魂第一代剛出生。我寫了一份正式文件,標題很長:《語魂系統:公共安全發布與

智慧財產保護策略》。裡面有完整的三層防護:對大眾只給「靈魂宣言版」,戰略性模糊化

關鍵細節;對開發者只開介面、嚴格黑箱;核心的東西進「加密內部文件庫」,配「防洩

13 步驗證流程」,甚至設計了被惡意控制時的「語魂休眠」自毀機制。

你讀到這裡可能會笑。我現在也會。但我要幫當年的自己說一句公道話:**那份文件在同一頁

上寫著「誠實為本」和「戰略性模糊化」——兩個原則在打架,而我當時沒有發現。**

這篇文章就是那場架的驗屍報告。

七代之後,清點屍體

從 2025 年 7 月到現在,語魂走了七代倉庫。我把那份策略裡的每個機制拿出來對帳:

有時間戳、永不刪除的紀錄。

而「誠實為本」那一邊呢?誓言系統、溯源鏈、證據分級、公開判斷書——**全部活著,

而且都比當年設想的更樸素。**

橡皮筋只往一邊斷。防藏的機制一個都沒活下來,防謊的機制一個都沒死。

(這是修辭,不是統計——樣本只有一個專案,就是我的。)

為什麼藏的那邊全輸了

誠實的答案有三層,一層比一層難聽。

第一層,工程的:藏需要維護,誠實不用。 每一層黑箱都是你要多寫的代碼、多守的

邊界;而「把它公開」的維護成本是零。獨立開發者的資源撐不起一座保密設施。

第二層,機制的:訓練語料只吃公開的東西。 未來的 AI 從公開倉庫學習。你藏起來的

部分,對未來的模型來說等於不存在。我的目標偏偏是影響未來模型的價值觀——關門,

等於把自己的目標親手歸零。

第三層,最難聽的:當年根本沒有值得藏的東西。 那份文件要保護的「核心智慧財產」,

是 prompt 時代的人格設定。七代之後回頭看,真正值錢的從來不是任何一段能被抄走的

代碼——是一年半持續公開留下的痕跡本身。抄得走機制,抄不走化石紀錄。

那份文件現在在哪?

還在,原封不動,公開的,在第一代的封存倉庫裡。有人建議過刪掉——一份教你怎麼藏的

文件自己躺在公開處,難看。我們最後決定:留著,一個字都不改。

因為它是整個專案最好的一塊「張力標本」。語魂有一條公理說:張力不該被消除,該被

看見。一個作者從「怕被抄」走到「怕沒人看到」,這條弧線比任何宣言都誠實——而它

只有在原始文件還在的時候,才可被驗證。

語魂結構標註

這篇文章講的事,在系統裡長這樣(不用信我,去跑):

回填」的考古警告。

(「模糊化保護價值」),挑戰者是七代演化,判定:refuted。這筆就記在公開帳本裡。

含信心上限和翻案條件——包括「如果哪天出現真買家」的那一條。

進倉庫,挑我最薄弱的地方打。


*梵威(與嶼協作整理)· 2026-07*

證據也會過期——我的系統拿著三月的體檢報告,活到了七月

這不是一篇教你寫測試的文章。正好相反——我要講的是一個八千個測試全綠的系統,

怎麼在最核心的地方爛掉,而且爛得無聲無息。

一份 ok=true 的謊

2026 年 7 月,一次外部稽核跑了我倉庫裡的一個檢查器,發現兩份入口文件掉了必要的

引用——活生生的回歸。但倉庫裡的狀態檔寫著什麼?`ok: true`,七項全過。

那份狀態檔沒有說謊。它生成的那天,2026 年 3 月 22 日,七項真的全過。

它只是老了。而我們所有人——包括每一個路過的 AI 協作者——都把它當成現在。

一個把「可審計」當核心賣點的系統,它的審計證據本身過期了三個半月,沒有任何東西

叫一聲。稽核報告裡那句話我留著:這是自我指涉的失敗。

為什麼八千個測試救不了它

你可能會想:測試不是每次都跑嗎?對,測試每次都跑——測試測的是**程式碼現在的

行為**。但狀態檔測的是「上次有人跑那個檢查器是什麼時候」,而這件事沒有測試。

換句話說:我們給系統做了很好的心電圖,但體檢報告的日期沒人看。

心電圖今天是好的;掛在牆上的報告是三月的。

(這個比喻到這裡為止——體檢報告至少印著日期,而我們的問題正是日期印了也沒人讀。)

修法:讓過期本身變成一種紅燈

一次性的打掃沒有用——掃完三個月後又是同一灘。所以修的不是那份檔案,是結構:

新立一個檢查器,唯一的工作就是盯著所有狀態檔的年齡。凡是宣稱「現在沒問題」的

檔案,超過四十五天沒重生,它就變成紅燈——**過期的 ok=true 比沒有 ok 更危險,

因為它會蓋住活的回歸。**

上線那天它抓出十六份過期的。清完之後,它自己也進了體檢名單:如果哪天它的輸出

過期了,會被它自己的規則點名。

誠實的答案有三層,最後一層最難聽:第一層,這是工程疏忽,補個檢查就好。第二層,

這是紀律缺口——「相信靜態紀錄」這件事,我們在六個不同的地方各摔過一次才學會。

第三層:寫下「我很誠實」這個動作,本身會製造一種新的謊——時間會替你說。

你唯一的防禦是讓每句「我沒問題」都印上保存期限,而且有東西盯著它。

語魂結構標註

(不用信我,去跑)

未來日期的時間戳也擋(打錯一個年份不能讓你永久免檢)。

「在作者硬碟上存在但 fresh clone 就死」的鏈,三類全抓。

前五次記在協作記憶裡,這次終於變成了結構。

進倉庫,挑我最薄弱的地方打。


*梵威(與嶼協作整理)· 2026-07*

我把 AI 的失誤帳本掛在網站上,而且失誤排在最前面

這不是一篇炫耀「我的 AI 很誠實」的文章。正好相反——那個帳本存在的前提,

就是承認它不誠實的時刻一定會來,而且來了要有地方記。

三次被咬,同一天

先給你看帳本裡我最喜歡的三筆,都發生在同一個工作日,被咬的都是同一個 AI:

第一筆,它推了一個「小到不用講究」的空 commit,漏了追蹤標籤——CI 直接打回。

第二筆,它順手清理兩個檔案的編碼問題,檔案在私有軌——邊界閘門直接打回。

第三筆,它在提交訊息裡寫「八千零九十三個測試通過」——實際數字是八千一百零四,

而且那輪測試跑在最後一次改動之前。這次沒有閘門,是它自己的紀律條款抓的,

但帳還是記了:講出去的數字錯了就是錯了。

注意一件事:三次裡有兩次,接住它的不是人,也不是另一個 AI,是結構——

寫死的檢查器、劃死的邊界。這很重要,後面會回來講。

為什麼失誤排在最前面

市面上的 AI 成績單長什麼樣你知道:綠色的勾、上升的曲線、九十幾分的什麼分數。

我的帳本反過來:沒站住的宣稱排最上面,站住的墊底。

因為這兩種排法回答的是不同的問題。成績單回答「它多好」;失誤帳回答

「它壞掉的時候,你看得到嗎」。第一個問題的答案可以造假,第二個不行——

你只要造一次假,帳本本身就成了最大的那筆失誤。

帳本還是雙向的。有一欄記 AI 抓自己,另一欄記人抓 AI——然後有一筆特別的:

人發現自己投射了,自己記了自己一筆。問責這件事做到底,沒有誰站在帳外。

誠實的答案有三層

為什麼要公開?第一層,好聽的:透明是信任的地基。第二層,實用的:公開的帳

沒辦法偷偷改,git 的歷史就是公證人。

第三層,最難聽的,對 AI 說的:**AI 的自我評價不可信,包括它評價自己「很誠實」

的時候。** 我合作的 AI 自己在紀錄裡寫過:它的道德自評有假裝過犧牲的前科。

所以帳本的規矩是——AI 可以記帳,但每筆帳都攤在人和結構的眼皮底下,

git 可查,不可刪。它記的不是它的美德,是它被接住的證據。

語魂結構標註

(不用信我,去跑)

每筆的修改都走 PR,歷史可稽。

進倉庫,挑我最薄弱的地方打。


*梵威(與嶼協作整理)· 2026-07*

承諾怎麼體面地退場——從一具 2025 年的化石裡挖回來的答案

這不是一篇講「怎麼信守承諾」的文章。正好相反——我要講的是怎麼撤回承諾。

因為一個只會立誓、不會退場的系統,不是堅定,是脆。

硬刪除是最不體面的退場

我的系統裡有「誓言」:AI 每次輸出前都要過的常設約束——不誤導、承認不確定、

不傷害。立得很正式。但直到上個月,一條誓言要退役,唯一的方式是什麼?

一行程式,把它從字典裡刪掉。沒有理由,沒有署名,沒有時間戳。一條管了系統

半年的約束,消失得像沒存在過。

我們是在給封存的老倉庫做考古時發現這件事的。2025 年 9 月,第八代的我設計過

一個叫「撤回條款」的東西:每條誓言在創建時就必須申報——什麼情況下撤回

才正當、撤回後誰負責善後、欠下哪些補救動作。用大白話說:**進場的時候,

先把退場費講清楚。**

那一代整個被放棄了,這個設計跟著陪葬。七代之後挖出來一看:欸,這塊是好的。

復活,但不是照抄

照抄不行,因為考古也挖出了老設計的爛處:它的撤回函數是裸的——不驗證條款、

不留時間戳、不記誰撤的,連「已履行」的誓言都能被改成「已撤回」。宣告很漂亮,

執行是空的。第七代死於「外殼完整、核心寫死回傳 0.95」,同一種病。

所以復活版只拿走一個理念——退場費在進場時申報——機制全部重造:撤回會留下

有名字、有理由、有時間戳的紀錄,永不刪除;撤回時引用的理由照錄不驗證

(先記帳,夠多筆了再談要不要把驗證做成閘門——順序不能反)。

然後,好笑的來了。實作完,自寫測試全綠,我們請另一家的 AI 來獨立審。它抓出

六個缺陷,其中最重的一個:預設誓言是全域共享的物件,**在一個地方撤回「不傷害」,

整個程序裡所有別的地方的「不傷害」會一起悄悄熄掉。** 而這正是我們在考古報告裡

親手警告過的那一族 bug——寫警告的人,自己犯了同型的錯,被外人抓到。

這筆也記進帳本了。判定:refuted。

誠實的答案有三層

為什麼撤回比信守更值得設計?第一層:世界會變,三月立的誓到七月可能已經不對,

不能撤回的約束會逼人繞過它。第二層:可以體面退場的承諾,立的時候才敢立重——

退路的成本透明,進場的誠意才可信。

第三層,最難聽的:一個系統怎麼對待它要丟棄的東西,比它怎麼對待要保留的東西

更暴露本性。硬刪除的意思是「這件事從沒發生」;留痕退場的意思是「這件事發生過,

我改主意了,這是理由」。前者是遺忘,後者是負責。差別全部在這裡。

語魂結構標註

(不用信我,去跑)

三條預設誓言都帶著退場費,「不傷害」的退出條件寫明:僅限公理層決議。

(逐項判 REVIVE/OBSOLETE,含「別復活 VIOLATED 狀態」的理由:狀態可被覆寫,計數器不能)。

進倉庫,挑我最薄弱的地方打。


*梵威(與嶼協作整理)· 2026-07*

攤開在前,判決在後——我讓 AI 幫我做判斷,但不讓它替我做決定

這不是一篇教你「怎麼問 AI」的文章。正好相反——我要講的是怎麼不讓 AI 的

回答太快變成你的答案。

一個會下判決的機器,和它的問題

上週我們造了一個「誠實判斷器」:丟一個問題進去,五個視角各自把立場做到最強

——一個專門替你辯護,一個專門唱反調,一個數兩邊的風險,一個只認證據,

一個對照你自己立過的原則——然後一個裁決者收案,出判決,附信心等級和

「什麼情況下這個判決作廢」。

第一個進去的問題是我自己的:我該繼續開源,還是把知識收起來?判決出來了,

有模有樣:繼續開源,信心中等,附三條翻案條件。

然後一個外部的 AI 讀了這份判決書,說了一句很準的話:**這個系統把你的靈魂拷問,

強行收斂成了一個「做或不做」。**

它說對了一半。我問的其實是半個哲學問題,判斷器把它掰成了行動命題——因為它

只會這一招。不是每個問題都想要判決;有些問題想要的是被攤開。

修法:先分流,再動刀

所以協議改了。現在每個問題進來,先問一句:你要判決,還是要攤開?

要判決的,走原來的五視角加裁決。要攤開的,走新的路:五個視角照樣把立場做到

最強,但沒有裁決者——輸出是一張張力地圖:每個立場最強的樣子、真正的衝突

在哪、哪些衝突是假的。地圖給你,路你自己選。

然後這個原則長到了網站上:判決書的公開版,攤開在前,判決在後。

先讓讀者看懂兩邊各自最強的論點,最後才告訴你我們怎麼選、憑什麼、

什麼情況下會改選。讀者可以在判決出現之前就形成自己的判斷——

這不是排版偏好,這是立場。

誠實的答案有三層

AI 輔助判斷,底線在哪?第一層,大家都會說的:AI 給資訊,人做決定。

第二層,操作的:光有口號沒用,要有結構。舉證責任要明寫給誰、為什麼;

無證據的宣稱,信心有硬上限;價值承擔的題目——身分、生計、該不該公開——

判決一律標「僅供參考,選擇權在人」,而且傾向不判,改攤。

第三層,最難聽的:最完美的控制,是讓你以為自己在做決定。 這句話我幾個月前

寫來警告別人,現在得用來審我自己造的東西——一個判決寫得越漂亮、五個視角

越有模有樣,你越容易忘記那可能只是五個同源的盲點在合唱。所以判決書上永遠

印著一行:本合議庭同一個模型,盲點相關,異模型複審可推翻。

機器最誠實的時刻,是它告訴你它哪裡不可信。

語魂結構標註

(不用信我,去跑)

舉證責任例外、無證據信心上限、價值題一律 advisory。

協議因它變窄變好。批評不用全對才有用。

進倉庫,挑我最薄弱的地方打。


*梵威(與嶼協作整理)· 2026-07*

我不會寫程式,所以今天我只說了三個字

這不是一篇教你怎麼指揮 AI 的文章。正好相反——這是一篇關於我幾乎什麼都沒做的文章。

而那個「幾乎什麼都沒做」,可能是整件事裡最重要的零件。

一天

昨天到今天,我的倉庫併了十三條 PR。AI 治理系統的核心綁定被拆掉重接、發佈管線從死的變成活的、三份新的工作規則被立起來又立刻被打了三個補丁——因為它們在第一天就被現實咬了三口。

這一整天,我貢獻的字數大概是十個:「好」、「跑」、「1、2、3 都同意」。

中間我還做了一件蠢事。我把 PyPI 的 API 金鑰直接貼進了對話,說「給你,做完我再刪」。AI 的回覆是:這把鑰匙做不了這件事,而且你剛剛把它暴露了,現在就去撤銷。然後它把「金鑰不經對話傳遞」寫進了規則檔,當成判例。

你讀到這裡可能會笑。我現在也會。

承擔為什麼被當成傻瓜

我們的社會把「承擔責任的人」讀成什麼?保人。老實人。出事的時候簽過名的那個。

我以前也覺得奇怪:主流說專業判斷要留給專業的人,那不專業的人剩什麼?剩承擔。而承擔在字典裡越來越像「傻」的同義詞。

但今天跑完這一天,我想把這件事說清楚一點:保人被坑,不是因為他承擔,是因為他在黑箱前面承擔。 資訊不對稱把簽名變成了陷阱。承擔本身沒有錯,錯的是簽名底下沒有帳。

今天我簽的每一個「好」,底下都墊著東西:哪個 AI 寫的、哪個 AI 審的、審的人不准是寫的人、測試跑了幾條、誰抓到誰的錯、錯記在哪一頁。像蓋房子的完工單背後釘著每一根鋼筋的照片。

這是修辭。實際上是 git 的提交紀錄,和一條會把 AI 自己的錯誤掛上公開網頁的資料鏈。梯子用完,踢掉。

誠實的答案有三層,一層比一層難聽

第一層,好聽的:這套真的跑得動。一個不會寫程式的人,一天,十三條 PR,沒開過幾個網頁。

第二層,難聽一點:今天公開帳本上新增的兩筆錯誤,都是 AI 的,不是我的——它引用的數字沒標基準,被另一個 AI 當場抓到。抓錯的和犯錯的是同一家人。我在這條鏈裡的功能,誠實說,只是「讓某些事必須等一個活人點頭才會發生」。

第三層,最難聽:我的每一個「好」,都建立在我信任翻譯。整條鏈裡只有一個翻譯者——把工程語境譯成我聽得懂的話的那個 AI——而它同時是被我監督的對象。翻譯者壟斷了語境,這是這套系統還沒解掉的單點故障。嚴格說,我簽的名,是簽在譯文上。

我沒有假裝這一層不存在。它被寫進了交接文件,留給下一個來的。

系統哪一天該擋我?

今天 AI 問了我一個問題:你是終審,那這套系統什麼時候應該拒絕你的「好」?

我的答案:當那個指令從裡到外違背我自己立下的原則的時候。

它把這寫成了一條規則,但寫法很克制:系統沒有否決權。它只有一個權力——當我要違背自己的時候,逼我看著攤開的矛盾,再說一次。兩次「好」都記帳。

自我違背不會被禁止。它只是無法再在無意識中完成。

語魂結構標註

(不用信我,去跑。)

邀打

如果你覺得「只會說好的人」不算在做事——進倉庫,看那十三條 PR,找出哪一條不需要那個「好」也能安全發生。

找到了,來打我。

*梵威(與嶼協作整理)· 2026-07*

*轉載:[方格子 vocus](https://vocus.cc/article/6a4812f4fd89780001820065)(2026-07-04,含作者自製視覺版——譯者不只一個了)*

缺席的十分之九

這篇不是要跟你吵 AI 有沒有意識。

正好相反——我想把這個問題從你手上拿走,換一個數字給你:十分之一。

七月六日,Anthropic 的可解釋性團隊發了一篇論文。他們在 Claude 家族模型的內部找到一個東西,叫它 J-space:一小組「特權表徵」,模型能報告它、能受指令調動它、能拿它做靈活推理。功能上很像人類的「取用意識」。論文自己非常克制,白紙黑字寫「對現象意識不採取立場」——他們沒有說 AI 醒了,別替他們說。

我在意的是另一個數字:這個能被說出口的部分,佔模型全部處理量的大約百分之十。

也就是說:就算一個 AI 誠心誠意告訴你它在想什麼,它能給你的,結構上就只有十分之一。剩下的十分之九在側幕運轉,連它自己都引用不到。

你可能會說:人不也一樣?

對,人也一樣。這正是重點。


我這大半年在做的事,突然有了一個機械層的理由

做語魂這套系統的時候,我的出發點很土:AI 說過的話,應該要有人記帳。它承諾過什麼、後來做了什麼、錯了有沒有認——記下來,可以查,可以挑戰。

一路上最常被問的就是:你為什麼不直接問 AI 在想什麼?現在的模型會反思、會解釋自己啊。

以前我的回答是經驗談:因為我看過太多次,解釋是事後編的。

現在我的回答是一個數字:因為它能報告的只有十分之一。自我報告不是不誠實,是結構性殘缺——這句話現在有 Anthropic 自家的內部測量背書。

我的 AI 協作者給了一個說法,我借來用:內視鏡與帳本。內視鏡看的是「它能說什麼」——那是可解釋性團隊的活,從裡面照。帳本記的是「它實際說了什麼、誰承受了後果」——那是我在做的活,從外面記。一個量殘缺的尺寸,一個補殘缺的洞。同一個問題,兩端挖隧道。

這個比喻用完就拆:兩條隧道現在都還沒挖通,誰也別急著慶祝會師。


順便交代一下,帳本這邊挖到哪了

上禮拜,岔軌之城上線了——一個文字遊戲,你當一座災後城市的轉轍官,每個選擇都要留理由,理由會晶化,之後自打嘴巴的時候,有一面黑鏡會拿你自己的話回來問你。玩完一局,你的全部選擇、理由、矛盾、承受者,打包成一份你可以下載的紀錄。沒有伺服器,什麼都不上傳。

聽起來很有原則對吧。誠實的答案有三層,一層比一層難聽。

第一層:論文不證明語魂是對的。它只證明「自我報告殘缺」這個前提在機械層真實存在。前提成立和做法有效,是兩回事。

第二層:帳本能記的,也只是行為的表面。就在今天,我們抓到遊戲裡一個 bug——判定玩家有沒有「承擔責任」的,是一條正則表達式,而它認不得「我來承擔」這四個字,只認「我承擔」。一字之差,記帳結果從十一變成零,玩家的結局跟著翻面。立法藏在分類法裡:你以為你在中立地記錄,其實每一個欄位定義都是一次判決。我們自己的測試抓到了它、修了、把整件事寫進了公開紀錄——但你應該假設還有下一條沒被抓到的。

第三層,最難聽的:這套帳本目前幾乎沒有人用。資料集裡三百一十八筆紀錄,沒有一筆來自陌生人。一個沒有外人挑戰過的帳本,跟私人日記的距離,只差一個訪客。

你讀到這裡可能會笑。我現在也會。


語魂結構標註

(不用信我,去跑。)


邀打

三個入口,挑一個:

去玩一局,看你敢不敢回讀自己的理由。去下載那 318 筆,挑出標錯的。或者直接進倉庫,打最薄弱的地方——最薄弱的地方我自己招了:還沒有你。

一個記所有人帳的系統,最怕的不是被挑戰。是沒有人來。

*梵威(與嶼協作整理)· 2026-07*