第三十四期

2026-09-12

一.台灣之光 Zeabur 資安事故全解析!以及程式貓學到的教訓

作者:YD

還記得前陣子在開發者圈子裡幾乎人手一個的「一鍵部署」神器嗎?沒錯,就是 Zeabur。這個由台灣 Z 世代創業者林沅霖從畢業專題做起、後來拿到 YC China 加速器與美國創投 500 Global 挹注、註冊用戶突破十萬的雲端部署平台,8 月底捲入了一場堪稱今年台灣新創圈最慘烈的資安事故。這篇週刊就來把整起事件的攻擊鏈、官方應對與社群反應拆給大家看,順便聊聊程式貓從這件事學到的教訓。

圖片

Zeabur 是什麼?先認識一下這次的主角

簡單說,Zeabur 就是把「租伺服器、裝環境、設定網路」這一大串麻煩事全部包好,讓開發者上傳程式碼就能自動部署上線,走的是 Heroku、Vercel、Railway 那種 PaaS(Platform as a Service)路線。

因為介面直覺又支援台灣人愛用的 n8n、各種自架服務,這幾年幾乎變成台灣開發者的預設選項。今年 Zeabur 還推出了 AI Hub,讓使用者用單一金鑰就能呼叫 OpenAI、Anthropic、Gemini 等多家模型——沒想到,這個新功能後來也成了這次事故裡被點名的環節之一。

攻擊鏈:一把「快退役」的鑰匙,開了主資料庫的門

根據 Zeabur 官方公布的調查與資安部落客的整理,這次入侵的路徑大致是這樣:

  1. 攻擊者取得一組外洩的 AWS 管理金鑰(不是從公開儲存庫撿到的,而是內部憑證外流)。

  2. 用這組金鑰打進東京機房一個正在淘汰中的共享叢集——關鍵就在這裡,一個「要退役但還沒退乾淨」的舊系統,往往是駭客最愛的破口。

  3. 從叢集內部拿到系統控制平面的 VPN 存取權

  4. 一路連進 Zeabur 主資料庫,針對性地下查詢,把使用者專案裡的環境變數整批匯出。

有資安工程師分析這條路徑時直言,問題不在於「哪個金鑰外洩」,而在於 「一把金鑰能走多遠」 ——當管理憑證、控制平面、VPN 材料與資料庫存取權全部落在同一個信任邊界裡,只要有一個環節被攻破,攻擊者幾乎是暢行無阻。這也是多租戶雲端平台最常見、卻最容易被忽略的架構風險。

外洩了什麼?幾乎是每個開發者最怕看到的清單

官方公布的外洩憑證類型長到嚇人: OPENAI_API_KEYANTHROPIC_API_KEYOPENROUTER_API_KEYGEMINI_API_KEYAWS_ACCESS_KEY_IDGITHUB_TOKENCLOUDFLARE_API_TOKENSTRIPE_SECRET_KEY

還有一整排的 DATABASE_URLJWT_SECRETMONGODB_URI……幾乎所有開發者會塞進環境變數裡的敏感資料都在名單上。最直接的受害情況,是不少人發現自己 OpenAI、Anthropic、OpenRouter 帳單一夜暴增——花的不是自己的錢,卻要自己去查證、去申訴。官方倒是強調,帳戶密碼、個人資料、付款卡號(存放在 Stripe,Zeabur 本身碰不到)並未受影響。

事故爆發後沒多久,暗網論壇更冒出一個帳號,聲稱手上握有 Zeabur 完整原始碼、資料庫、AWS 與 GCP 管理權限、Kubernetes 叢集控制權,甚至 Google Workspace 管理員帳密,壓縮後號稱高達 612GB

這則貼文在 X(推特)上被資安帳號大量轉發,聲勢一度非常驚人。不過 Zeabur 官方隨即回應:目前證據只顯示攻擊者對環境變數做了「目的明確的定向查詢與匯出」,並沒有找到能佐證暗網說法的具體證據。換句話說,「已證實的災情」和「暗網喊價的災情」中間,還隔著一段沒人能拍胸脯保證的距離。

圖片

官方回應:道歉來得快,時間軸也算透明

平心而論,Zeabur 這次的危機處理速度不算慢。8 月 27 日偵測到異常,隔天就公開事件、暫停 AI Hub 服務;創辦人林沅霖在 Threads 連發多篇說明,坦承「非常抱歉造成大家的損失及困擾」,承諾核實後啟動賠償,目標是 9 月 30 日前完成撥款;官方也持續更新事件進度頁,9 月 4 日宣布內部調查完成、確認系統目前安全,並表示會請第三方資安公司進行獨立審計。

但社群裡也不是一片體諒。不少開發者反映,自己是「看社群討論才知道帳單被盜刷」,而不是第一時間收到官方通知,對通知速度與範圍頗有微詞。截至目前最新進度,官方回報約 63% 的賠償申請已核實並進入撥款程序,另有約 21% 仍在審核中,剩下少部分案件則需要使用者補件佐證——算是把「說到做到」的壓力,攤開在陽光下讓大家監督。這也是資安事故裡的老問題:技術修補得再快,如果溝通跟不上使用者的焦慮,信任還是會被磨損。

本週觀察:程式貓看到的,是事故的承受能力

程式貓的基礎架構大部分依賴雲端服務,其中我們的 AI 服務就是運行在 Zeabur 平台上的。作為這次受到影響的客戶,我們在第一時間就輪替了所有金鑰,並清查日誌確認是否有可疑行動。很幸運的是,程式貓這次並沒有任何客戶資料外洩,相關報告可以參閱 關於上游供應商 Zeabur 資安事件的說明暨 AI 服務暫停公告

雲端平台的資安事故是無法預測的,日前同樣作為部屬平台的 Vercel 也發生類似的外洩事件。但是我們能夠從架構設計層面分散風險,不論是最小化客戶資訊儲存、採用雜湊、加密等技術,還是最小化憑證權限,這些都會大大提升應對資安事件的能力。

如果你也是 Zeabur 的使用者,這幾天記得回頭檢查一下自己專案裡的 API 帳單有沒有異常;如果不是,也不妨藉這次機會盤點一下,自己手上到底握著多少「一旦外洩就會很痛」的鑰匙。你覺得雲端平台該把多少安全責任攬在自己身上,又有多少該留給開發者自己把關呢?

資料來源

Zeabur 官方事件進度頁 — Unauthorized Access to Project Environment Variables

Zeabur 官方安全實踐文件 — Security Practices

iThome — 臺灣AI新創Zeabur環境變數外洩,使用者API金鑰恐外流

動區動趨 — 台灣新創 Zeabur 環境變數外洩:AI 金鑰遭盜用,創辦人承諾後續賠償

動區動趨 — Zeabur災情延燒》暗網傳開賣 612GB 完整資料庫,官方:沒證據佐證

科技新報資安版 — 雲端部署平台 Zeabur 遭駭,使用者 API 金鑰、資料庫憑證外流

lonelysec — Zeabur 資安事件:AI Token 盜刷、612GB 外洩真相

三立新聞網 — 金鑰放雲端被竊!台灣AI新創Zeabur創辦人公開道歉、承諾賠償

Dark Web Intelligence(X)— Zeabur Allegedly Compromised 貼文


二.當 AI 開始「做研究」:一間人工智慧新創,正在挑戰研發的成本結構

作者:KH

圖片 圖源:Sapient Intelligence

新加坡人工智慧新創 Sapient Intelligence 在八月底發布 PRAXIST,宣稱以不到三千美元的模型費用,在標準測試上取得優於花費近四萬美元對照組的成績 。技術報告同時記載,整場實驗有九萬多筆嘗試因完整性裁決被剔除 。

Introducing PRAXIST Beta

生成式 AI 在軟體開發上的滲透速度超出多數人預期 。給定一個明確目標,Claude Code、Codex 這類工具能夠自行撰寫程式、執行、除錯,直到任務完成 。

研發流程的運作方式則不同 。一位在製造業做製程優化的資深工程師,工作內容並不是把同一個解法再迭代一次 。他要判斷哪些機制已經被驗證、哪些失敗必須寫進往後的限制、兩個看似無關的發現能不能組合,以及手上這個結果究竟有多可靠 。

這個落差,是 Sapient Intelligence 在發布 PRAXIST 時提出的核心論點 。

Sapient 的論點:現有 agent 把每次嘗試當成孤島

Sapient 的技術報告《From Experimental Artifacts to Solution Lineages》指出一個結構性問題:目前的自主研發 agent,多半把每一次嘗試視為近乎獨立的單元,系統狀態儲存為一棵搜尋樹,或一份依分數排序的程式資料庫 。

論文認為問題出在剪枝 。隨著樹的成長,每個節點的產物會愈來愈具組合性——它同時包含了資料處理選擇、演算法、超參數、實作技巧與診斷邏輯,而這些來自許多次不同的嘗試 。一個機制的價值往往只在組合中才會顯現,以產物為單位的搜尋卻可能在那之前就把它剪掉 。結果是,campaign 產生了大量被評估過的經驗,但只有其中一小部分以後續嘗試能繼續往上蓋的形式被保留 。

論文引用組合理論(assembly theory)作為對照:複雜物件是由可重複使用的子結構,在選擇壓力下逐步組裝而成 。成本隨組裝步驟數增加,而非隨搜尋空間大小增加,每個元件的代價都被後續的建構攤提掉 。在這個框架下,搜尋不需要預知哪個變體最終有用,只需要把對的元素以對的角色保留下來,並維持它們可以被重新組合 。

Sapient 把這個轉換過程稱為「證據繼承」(evidence inheritance)。

架構分層:一個任務無關的控制平面

PRAXIST 在軟體形態上是一個三層結構 。中間層是核心,刻意做成不含任何領域科學假設;上層是人與系統互動的介面;下層是提供科學內容的任務專案 。核心與外部世界之間以插件邊界銜接,使模型供應商、agent 執行環境、工作流階段與預算策略都可替換 。 圖片 執行時,PRAXIST 不修改原始專案,執行產物另存於獨立目錄 。

世代迴圈的完整流程

一次 campaign 由 G 個世代組成,每一代是一個同步邊界——同伴層的證據在此成為共享的研究狀態 。迴圈持續到搜尋收斂或預算耗盡 。 圖片 論文以虛擬碼形式給出同一個迴圈 :

輸入:具外部評測器 Eval(·) 的任務;同伴數 C;世代數 G;壓縮週期 ρ
初始:F₀ ← ∅, A₀ ← ∅, G₀ ← ∅, L₀ ← ∅

for g = 0 to G-1:
    {dᵢ} ← Allocate(A_g, F_g, G_g)          # 每個同伴一個設計格子
    parallel for i = 1 to C:                 # 局部實驗
        aᵢ ← Build(dᵢ, S_g)                  # 建構可複現產物
        eᵢ ← Eval(aᵢ)                        # 外部評測
        Φᵢ ← Interpret(aᵢ, eᵢ, dᵢ)           # 產物→發現抽取
    Φ_g ← ⋃ Φᵢ [3]
    {μ_r} ← {PI_r(Φ_g, F_g)}                 # 面板備忘錄
    F_g+1 ← Promote(F_g, Φ_g, {μ_r})         # 前沿更新
    A_g+1 ← Chair({μ_r}, F_g+1)              # 仲裁出下一代議程
    G_g+1 ← Compress(F_g+1, G_g) if g mod ρ = ρ-1 else G_g
    L_g+1 ← L_g ∪ Record({aᵢ}, Φ_g, F_g+1, A_g+1, G_g+1)

輸出:前沿 F_G、譜系 L_G、執行摘要

回報 a* ← argmax score(a),a ∈ 已確認車道的產物

流程上的一項切分值得對照架構圖來看:圖中上半部的「同伴到發現」屬於局部實驗,由各同伴自行擁有;下半部的面板、晉升與議程屬於世代層的合成。

設計分配雖然發生在同伴動作之前,但它本身是世代層的決策。

系統的狀態物件與世代迴圈

PRAXIST 被形式化為一個世代式的狀態轉移流程 。每一代 g 繼承的研究狀態是一個四元組 : S_g = ( F_g , A_g , G_g , L_g )

分別是前沿(frontier,本代可繼承的證據)、議程(agenda,上一輪合成產生的執行政策)、Gems(跨世代保留的持久教訓)與譜系軌跡(lineage trace) 。整條資訊流則是 : 可複現產物 → 型別化發現 → 前沿車道 → 下一代議程 → 譜系紀錄 每一代讀取 S_g、執行 C 個平行同伴、輸出 S_g+1 。核心設計原則是:實驗結果不以原始日誌或單一分數的形式被繼承 。任何證據在被允許影響後續工作之前,必須先取得一個明確的操作角色 。 由於長時程執行產生的證據遠超過任何單一提示詞的脈絡容量,繼承是選擇性的:同伴只收到與它被指派方向相關的前沿條目、Gems 與親代譜系;主持研究員面板收到世代層級的證據;Chair 收到面板的備忘錄 。

設計合約:DIG 與 QD

一代的起點是分配運算子 {d_1, …, d_C} = Allocate(A_g, F_g, G_g),為每個同伴產生一份設計合約 。它由兩層構成 。

同伴層的 DIG(Deep Innovation Gate) 是一道唯讀關卡。

在動任何一行程式碼之前,同伴必須檢視繼承狀態、指認一個可測試的機制,並固定六個欄位:機制家族、介入層面、親代譜系、什麼證據算是支持或削弱、用來讓結果可解釋的驗證或消融掛勾、以及哪些改動會使這次測試失效 。DIG 不執行實驗、不建立變體、不寫結果產物 。它的作用是讓後續的發現抽取能夠比對「意圖的實驗」與「產物的實際行為」 。預設只在第零代執行,任務可以選擇每一代都開 。

世代層的 QD(Quality-Diversity) 把合約攤到行為空間中的不同格子,格子定義為 :

c = ( 機制家族 , 介入層面 , 意圖 )

第零代由確定性分配器施加硬性上限,評分函數為 :

 selection_score = quality_score
                           + lane_fit_bonus
                           + local_selection_bonus
                           + novelty_bonus
                           + target_keyword_bonus
                           - risk_penalty
                           - diagnostic_penalty_when_not_in_diagnostic_slot

上限包括:同一格子的最大同伴數、同一機制家族的最大同伴數、同一介入層面與同一意圖的最大同伴數 。任務專案還可以定義軟性的關鍵字目標群組,例如要求至少兩個同伴的合約落在「架構或表徵」這一類 。

第零代之後,DIG 預設關閉,QD 改為寫入提示詞的軟性目標,交由既有的主持研究員合成路徑執行,不另外建立規劃器或產出獨立的分配檔案 。此時多樣性的追蹤方式是:議程中的 peer_contracts[].planned_dimensions 記錄計畫值,同伴回報的發現則在 design_dimensions 記錄實際實作值,診斷程序分別計算兩者的赫芬達爾指數(HHI),回報缺漏與偏移 。這項比對不構成硬性執行閘門 。

分配器有一項邊界條件:它只在同一個同伴自己的候選池內重選,不會把甲同伴的候選指派給乙同伴 。若某個同伴沒有有效替代候選,或分配結果未通過驗證,系統保留該同伴原本的 DIG 合約並記錄原因 。

產物、評測與證據階段

同伴是平行的實驗工作者,各自擁有一份合約,內部反覆撰寫程式、執行、修訂,直到產物達到可回報的階段 。同一代的 C 個同伴並行執行,彼此只透過已發布的證據協調,不直接編輯共享狀態 。實驗由一層資源排程層在共享硬體上執行,控制啟動節奏,使每一代在牆鐘時限內完成足夠的成熟證據 。

產物(artifact)的定義是「重現、檢視或評估一次嘗試所需的最小檔案集」 。在機器學習工程這個任務族中,它包含提交檔、產生該檔的程式碼,以及重現所需的支援檔案 。

評測由任務自己的評測器執行,回傳三樣東西:任務層的結果、有效性狀態,以及 證據階段(evidence stage) 。證據階段是一道有序階梯,記錄產物通過了多少評估:從最廉價的健全性檢查(smoke)、部分探測(scout),到完整評分及其重複驗證 。系統核心只區分這三個層級,中間各級的命名由任務擁有——火箭評測器回報的是 canary、development、complete,交易評測器回報的則是 smoke、scout 與三層重複驗證 。

證據階段刻意與分數正交 。一個僅在初步階段取得高分的結果會被視為不成熟,在晉升時無法擠掉一個經過完整評估的結果 。

發現:一個六元組

被評測過的產物本身還不是可重用的知識 。抽取運算子 Φ_i = Interpret(a_i, e_i, d_i) 把產物、結果與原本的設計意圖,轉換成一個或多個以產物為根據的主張 : φ = ( 介入 , 結果 , 證據 , τ , m , α ) 其中三個標籤決定它如何被繼承 :

標籤值域
型別 τ正向(改善或可重用機制)、負向(被削弱的假設)、診斷(約束、失效模式、無效條件)、不確定(待進一步檢查)、程序性(對未來實驗執行方式的限制)
成熟度 m直接繼承產物的證據階段
繼承動作 αreuse、validate、avoid、diagnose、preserve、archive

論文註明這是方法層的角色詞彙;實作上,發現被歸檔在一組面向任務的列舉值下(result、hypothesis、insight、challenge、error),而繼承建議則放在 next-step-intent 的中介資料裡,而非單一欄位 。

負向與診斷型的發現在此被視為一等證據 。一次失敗的產物可以揭露無效假設、評測器約束、資料處理錯誤或脆弱的分數;編碼為發現之後,後續世代直接繼承這條限制 。

合成:面板、車道與議程

一代的發現匯集為 Φ_g = Φ_1 ∪ Φ_2 ∪ … ∪ Φ_C,接著進入全域合成 。

一組主持研究員(Principal Investigator)角色從互補視角獨立解讀同一批發現:Builder 組裝證據最強的主線,Skeptic 稽核缺乏支撐或脆弱的宣稱,Portfolio 平衡跨方法家族的投入 。在「高風險模式」下,面板另加一個 External-validity 角色,檢查可重現性與證據邊界 。流程是先凍結證據、平行撰寫獨立備忘錄、進行匿名交叉審查,最後由 Chair 仲裁 。

前沿更新 F_g+1 = Promote(F_g, Φ_g, {μ_r}) 決定哪些證據成為可繼承的,以及以什麼身分繼承 。本文所述配置下,前沿分為四條車道 :

F = F(已確認) ∪ F(候選) ∪ F(診斷) ∪ F(待驗證)

依序為已確認(成熟到足以作為親代或約束)、候選(有前景但不成熟)、診斷(失敗、對照組與失效模式)、待驗證(排程等待重現或消融) 。車道由任務定義而非寫死在系統內:交易 campaign 用的是「已確認 alpha」「alpha 孵化區」「基準底線」「診斷對照」四條;未宣告車道的任務,則退回單一指標的前沿 。晉升時,每條車道各自取符合該車道標準的頂端發現,並過濾掉停留在 smoke/scout 階段的不成熟證據 。

下一代議程 A_g+1 = Chair({μ_r}, F_g+1) 為每個繼承方向標上四種處置之一——繼續、停止、驗證、探索——並為 C 個同伴各附上一份同伴合約,載明角色、假設、成功訊號與禁止動作 。實際輸出的議程用更細的 next-step-intent 欄位記錄處置,能夠區分「修復某個失效模式」與「對它做消融」這類差異 。

記憶壓縮與譜系

前沿承載的是當下證據的操作狀態,而長時程 campaign 還會累積一些應該在原始證據被封存之後仍然存活的教訓 。

若任務啟用,系統每 ρ 代執行一次記憶壓縮 G_g+1 = Compress(F_g+1, G_g),把平衡後的前沿蒸餾成 Gems:一條被驗證的機制、一個被否定的假設、一種反覆出現的失效模式,或一項程序約束 。壓縮是車道平衡的(保留對照與診斷教訓,不只保留高分者)且有界(只維持一小組活躍的 Gem) 。這項功能預設關閉;論文的案例研究中只有交易 campaign 啟用,週期為六代,最多四個活躍 Gem 。

譜系軌跡則在執行過程中持續累積 :

L_g+1 = L_g ∪ Record( {a_i} , Φ_g , F_g+1 , A_g+1 , G_g+1 )

它記錄產物、發現、合成決策、議程與記憶更新,以及它們之間的型別化關係,包括 derived-from、supports、challenges、updates 。實作上它不是單一的物件圖,而是數份共享識別碼的相關帳本——發現的邊列表、產物索引、事件軌跡,以及每一代的前沿、議程與 Gem 狀態;追溯一條鏈的方式是跨帳本追蹤共同的識別碼 。

譜系是在執行期間累積而非事後重建:每個產物都指向它所繼承的親代、合約與發現,每一次晉升或議程決策都記錄了證據為何變得可繼承 。執行期間,譜系決定後續同伴繼承什麼;執行結束後,它是研究軌跡的結構化紀錄 。

最終輸出的預設規則是 :

a* = argmax score(a) , a ∈ 已確認車道的產物
輸出 = ( a* , L_G )

也就是已確認車道中分數最高的產物 。論文註明這是回報階段套用的選擇規則,而非執行期的自動呼叫——迴圈本身結束於寫出前沿、譜系帳本與執行摘要 。

軟體形態與所有權邊界

架構上最關鍵的一條線,是 PRAXIST 本體與任務專案之間的職責切分 :

PRAXIST 擁有任務專案擁有
研究編排、生命週期、證據協議、回放、排程、擴充介面研究目標、可執行程式碼、評測器、指標、基線、提示詞、角色、領域約束

PRAXIST 核心不含任何任務特定的科學假設,任務專案是「該測什麼、什麼算有效證據」的唯一真實來源 。

同一套流程因此可以接上 Kaggle 競賽、火箭控制器、SLAM 系統與交易策略 。

執行環境為 CPython 3.11 以上,Linux 為持續發布測試的平台 。安裝後的操作介面建議透過 Codex 或 Claude Code 這類互動式 agent:在一個已能執行的專案根目錄呼叫 $praxist-takeover,接管技能會檢查就緒狀態、建立或修復任務框架、驗證評測器與證據合約,通過必要閘門後才啟動執行 。其餘隨附技能涵蓋任務初始化、執行控制、健康診斷、文獻蒐集與執行環境修復 。

認證有兩條路徑:使用已登入的 Codex 工作階段(免 API 金鑰),或使用支援的模型供應商 API 金鑰 。官方文件指出,長時程研究情境下,系統偏好快取命中率高的開源模型 API 。

文件中另載明一項行為:若前置條件不齊備,PRAXIST 會直接停止並回報缺項,而非自行下載未知資料集、發明模擬器或捏造基線效能 。團隊稱之為刻意的設計原則 。

MLE-bench 成績與比較條件

在 MLE-bench——由 75 個真實 Kaggle 競賽改編、附官方評分工具的機器學習工程測試——上,Sapient 報告的結果如下 :

金牌任意獎牌記錄模型花費
PRAXIST49 / 75(65.3%)60 / 75(80.0%)約 3,054 美元
Claude Code + Opus 4.834 / 75(45.3%)55 / 75(73.3%)約 38,370 美元

任務依複雜度分為低(22 題,即 MLE-bench Lite 子集)、中(38 題)、高(15 題)三層,獎牌率分別為 90.9%、81.6%、60.0%,對照組則為 81.8%、76.3%、53.3% 。沒有取得最終分數的任務仍留在分母中,計為無獎牌 。

執行條件方面,PRAXIST 在全部 75 題上使用 deepseek-v4-pro 作為研究 agent 模型,脈絡視窗 100 萬 token;對照組使用開啟最大思考預算的 Claude Opus 4.8,其最終帳本保留 70 個有效分數、五題未計分 。兩組跑在同一批 H100 80GB GPU 上,每個實驗排程為單 GPU 工作,每題最多八個實驗同時在跑;70 題套用 24 小時的單題牆鐘上限,其餘五題為 36 小時 。

四項開放案例研究涵蓋的領域如下 :

  • 火箭回收著陸:從一個成功率僅 4.03% 的失敗概念驗證出發,最終產出一個確定性控制器,在凍結的評測協議上 12,288 次全數安全著陸 。作為對照的自主程式優化器 Weco,從同一起點做到 17.12% 。執行結束後另做的全列稽核,在三個固定來源庫上分別記錄 40,959、40,959 與 40,960 次成功(每庫 40,960 列) 。

  • SLAM:業界頂尖的光達—慣性—視覺系統在冗餘影格與重複地圖觀測上過度消耗算力 。改用可觀測性感知的排程器,搭配幾何感知的地圖准入閘門後,十四個序列的視覺路徑處理時間下降約 72% 。兩組的位姿時間戳約定不同,論文因此把精度欄位並列呈現,而非計為增益 。

  • 量化交易:走動式回測年化報酬 53%,為配對等權持有基線 22.8% 的 2.3 倍 。

  • 托卡馬克磁控:整體存活步數與共同時程的追蹤誤差勝過以 MAST-U 實機控制系統為基礎的基線,在原始的全時程精度指標與完成率上落後 。論文對這項落後有記載,發布新聞稿未提及 。

兩組的模型配置並不相同,十二倍價差當中有多少來自證據繼承架構省下的 token、有多少源自模型單價差異,論文沒有拆解,也沒有提供同模型的對照實驗 。

重複次數方面,每一組僅執行一次完整的 75 題掃描 。論文自承獎牌率是單次結果,而非重複實驗的變異數估計,並因此未將成績與 MLE-bench 公開排行榜並列,因為後者是多種子平均 。

九萬筆被剔除的嘗試

論文報告的每一題結果,都來自一份發布帳本,而該帳本對 75 題逐題做了完整性裁決 。回報的結果是通過裁決的最高分官方嘗試,選中的提交以 SHA-256 對執行日誌驗證;來自受污染譜系的嘗試被整批排除,而非降權處理 。整場 campaign 中被拒絕的嘗試數為 90,423 筆 。

在 75 題中,有 9 題原本最佳嘗試背後的整條譜系被排除,改以另一個乾淨執行者的提交遞補,其中 4 題因此掉了獎牌;另有 6 題經複審後獲得保留 。

這套裁決是 PRAXIST 帳本內部的程序 。論文載明,它與 MLE-bench 本身針對嚴重作弊的執行後篩查是兩套獨立機制,後者適用於 Claude Code 對照組 。

兩個表現最突出的案例——火箭與量化交易——其最終回報的產物,是在執行結束後,從論文預設規則所指定的已確認車道之外挑選出來的 。論文在報告結果的段落揭露了這項差異 。

開放案例的模擬保真度與評分口徑,由 Sapient 自行定義 。火箭案例自陳採用低階模擬、無風噪、精確狀態回饋、接觸即停分;交易案例的 53% 是特定標的池與協議下的回測,而非實盤 。

在缺乏可靠自動評分的情況下,整套證據譜系所能反映的,是系統對自身的描述 。

授權條款方面,PRAXIST 採用 Fair Source License 1.0:程式碼可檢視、可修改、可內部商用,年營收(含關聯企業)達一百萬美元的組織必須另行洽談商業授權,學術與非營利機構除外 。產出若對外發布,須保留產品名標註 。這不是 Apache 或 MIT,商業模式建立在控制平面授權上 。

兩條產品線

Sapient 另一條產品線是 HRM(Hierarchical Reasoning Model),一個在 2025 年引發討論的 2,700 萬參數分層循環推理架構,宣稱不依賴預訓練與思維鏈,即可在數獨、迷宮等任務上大幅領先 。

ARC Prize 的外部複核結果較為保守,消融實驗顯示成績有相當部分來自外層迭代精煉 。

PRAXIST 與 HRM 在技術上並無關聯 。PRAXIST 是純粹的編排層,底下呼叫的是現成的通用大型語言模型 。兩者是同一家公司的獨立產品線,各自的證據來源也不同 。

官方列出的三項前提

Sapient 的文件把 PRAXIST 的適用條件寫成三項:問題已經能在電腦上執行(具備程式、模擬器或評測器)、成功可以量測且有明確優化方向、以及通往目標的最佳路徑事先未知 。

文件也把它與 AutoML 做了區隔:AutoML 在預先定義的搜尋空間內調整參數,而 PRAXIST 的同伴可以更換方法、架構與策略 。它針對的場景是研究人員正在手動迭代,而系統接手那個迭代迴圈 。

這三個條件在台灣的製造、半導體、精密機械與量化投資領域並不罕見:這些領域普遍具備成熟的模擬環境與明確的良率或效能指標,也仍有大量仰賴資深工程師手動試誤的優化空間 。各家在自動化評測基礎設施上的成熟度則差異很大 。

驗證上存在一項結構性條件:這套系統的譜系、證據分級與失敗紀錄,都由系統本身產生,外部能取得的是它輸出的帳本 。

系統在目標未達成時,會輸出一份負面結果包,內容是以證據排除掉的方向、稽核報告,以及關於停止或轉向的建議 。

PRAXIST 上線至今約兩週 。目前公開的材料全部來自 Sapient 自己的技術報告、程式碼與文件,獨立第三方複現尚未出現 。

資料來源

技術報告與程式碼

產品與公司

發布報導

相關背景


三.新版NoteBookLM介紹(上):基礎介紹

作者:Lhs

在周刊剛開始的時候,我們曾介紹過一次NoteBookLM,而在過了兩年後,這項工具已經有了大量更新,這次,我將分為三段介紹,而第一段帶來的則會主要介紹這兩年來究竟更新了哪些內容。

一.蒐集資料

圖片

在剛創立一項記事本時,就能發現跟過去最大的不同:

現在能直接透過筆記本搜尋

在搜尋想要分析的主題後,他會透過Gemini分析數個最相關的網頁連結,而你可以勾選自己想用的資料來源,若覺得資料來源不夠,你也已自行增加其他資料來源,或者繼續搜尋相關內容。 圖片

可以從左側的欄位持續編輯資料來源

二.功能模塊

圖片

在更新後,Google將快捷功能整合製作方的工作坊裡面,數量也從五個新增至九個,並且,我認為最重要的一點,只需要按下「>」,就能夠直接針對使用者的需求,客製化生成成品,他還會依照內容,提供建議方案。 圖片 假設我想以先前搜尋到的程式貓相關網址,生成一個簡報,但我想要讓內容的語氣更人性化,我就可以選擇「自訂報告」,並描述自己的需求,他就能依照你的描述進行更改,當然它也提供已經設定好的方案供你選擇,是十分值得一試的功能。

三.AI聊天室

最後我們將目光移到最顯眼的中央區塊,也就是AI對話模塊。

實際上使用起來跟現有其他AI差不多,但由於只會讀取你提供的資料,準確率自然高了不少,並且我自己使用時,即使用的是免費帳號,幾乎沒有遇到因為回復字數限制而被刪減的回答內容,在翻譯文件或統整資料時,能夠成為一項十分得力的助手。

那麼這次的介紹就到這裡,下此會詳細介紹如何只用這項工具完成一份報告,想看的各位請繼續追蹤!

資料來源:

NoteBookLM