分享年薪 75 萬美金的祕密:Anthropic 工程師揭秘大型語言模型(LLM)的五大核心真相


年薪 75 萬美金的祕密:Anthropic 工程師揭秘大型語言模型(LLM)的五大核心真相


在矽谷的頂尖 AI 實驗室如 Anthropic,一位資深工程師的年薪突破 75 萬美金(約 2,400 萬台幣)早已不是新聞。大眾往往好奇,為什麼一個本質上只是「預測下一個字」的任務,會需要如此昂貴的人才與複雜的工程學?儘管 LLM(如 ChatGPT, Claude, Gemini)的核心任務是建立機率分佈 P(X₁ … X_L),但要將這個機率模型轉化為能夠改變文明的生產力工具,其難度早已超越了單純的代碼編寫。這是一場關於算力代價、數據哲學與對齊技術的極限競速。以下是這群身價不凡的工程師所掌握的五個核心真相。


真相一:學術界愛談「架構」,但工業界深耕「數據與系統」


在 AI 研究的領域中,存在著一個深刻的鴻溝。學術界偏好在神經網路的「架構(Architecture)」與「訓練演算法(Loss & Algorithm)」上推陳出新,因為這更具美感且易於發表論文。然而,在產業界的眼光中,這只是冰山一角。開發 LLM 的五個關鍵組件分別是:架構、演算法、數據(Data)、評估(Evaluation)與系統(Systems)。


「大多數權威學術界專注於架構與訓練演算法。身為學術研究者,我們喜歡思考這些,因為這看起來很重要。但在實務上,真正重要的是其餘三個主題:數據、評估與系統,這正是目前產業最關注的地方。」

這裡涉及一個關鍵的哲學轉向:Richard Sutton 的「痛苦的教訓」(The Bitter Lesson)。歷史證明,利用大規模計算能力的通用方法,最終總會擊敗那些試圖加入人類先驗知識的精巧架構。這就是為什麼工業界不再糾結於模型架構的小改款,而是專注於如何從 15.6 兆個 Token 中清洗出高品質數據,以及如何讓系統穩定支持數萬顆 GPU 協同運作。


此外,工業界與學術界對於「訓練比例」的認知也有巨大落差。傳統的 Chinchilla 定律建議參數與數據比例約為 1:20,但為了追求推理性能的最優化(Inference-Optimal),像 Llama 3 這樣的模型實際上是以 1:150 的比例進行「過度訓練」。這種對推理成本的極限追求,才是工業界競爭的真實戰場。


真相二:分詞器(Tokenizer)是 LLM 數學能力的阿基里斯之踵(致命弱點)


LLM 並不認識「字」,它處理的是被稱為 Token(標記)的符號。目前主流的「位元組對編碼」(Byte Pair Encoding, BPE)機制雖然提高了壓縮效率,卻也埋下了模型缺陷。


分詞器剝奪了模型進行「數位級組合成(Digit-level Composition)」的能力。例如「327」這個數字,在分詞器中可能被識別為一個獨立的 Token 符號,而非三個連續的數位。這意味著模型看到的是一個整體的概念,而不是數字的構成。這正是為什麼 LLM 在處理數學運算或複雜代碼時會顯得掙扎的原因——它無法像人類一樣逐位運算。


業界共識是,為了徹底解決這個問題,未來的架構必須邁向「去分詞化」(Character/Byte-based),直接處理原始位元組,儘管這會帶來巨大的計算長度挑戰。


真相三:擴展定律(Scaling Laws)—— AI 研發的「水晶球」


在 2020 年之前,AI 開發者依賴的是「試錯法」:在超大型模型上反覆調整參數,直到運氣好撞見最佳性能。但對於 Anthropic 這種等級的實驗室,算力不允許這種浪費。


現代 LLM 的研發依靠的是「擴展配方」(Scaling Recipe)。工程師會先在微型模型上進行大量超參數實驗,擬合出計算量(Compute)、數據量(Data)與參數規模(Parameters)之間的精確線性關係。這套「水晶球」讓工程師能夠在模型規模擴大 100 倍之前,就精確預測其最終的損失函數。這種預測能力讓 AI 研發從藝術轉向了精密工程:即便不進行超參數微調,只要根據預測持續增加算力與高品質數據,模型性能的提升幾乎是必然的。


真相四:幻覺(Hallucination)可能是被「行為克隆」逼出來的


大眾常批評 AI 會「一本正經胡說八道」,但這其實是監督式微調(SFT)過程中的副作用。SFT 的核心是行為克隆(Behavioral Cloning):讓 AI 模仿人類助手的語氣來回答問題。


當 SFT 的強制要求與預訓練知識發生衝突時,幻覺就產生了。例如,當我們要求模型回答關於「買方壟斷(Monopsony)」的特定學術引用時,如果該引用在預訓練的 15.6 兆數據中從未出現過,模型內部的權重並沒有這些資訊。然而,SFT 的訓練規則卻強制模型必須像人類一樣給出答案。結果,模型學會了「克隆人類的語氣來編造看似正確的答案」。這不是 AI 道德有問題,而是訓練機制在獎勵這種「強行回答」的行為。


真相五:從 RLHF 到 DPO,對齊技術的極簡化革命


為了讓模型更符合人類偏好,過去的主流是「人類回饋強化學習」(RLHF),涉及極其複雜的 PPO 演算法。在工程師眼中,PPO 是一場「系統性災難」,涉及複雜的獎勵模型(Reward Model)訓練與不穩定的強化學習迴路。


目前的技術革命在於「直接偏好優化」(DPO)。DPO 透過精妙的數學簡化,將強化學習任務直接轉化為機率最大化問題。這裡有一個深刻的架構洞察:


經過對齊的模型(如 PPO/DPO 後的模型)在本質上已不再是單純的機率分佈模型,而是「策略(Policy)」模型。


這解釋了為什麼傳統的評估指標「困惑度(Perplexity)」對於經過對齊的模型是不適用的。對齊技術讓模型不再追求預測下一個字的準確機率,而是追求生成「最符合人類滿意度」的特定路徑。在規模化過程中,這種如 DPO 般簡單且自動化的技術,最終勝過了精巧但脆弱的系統。


結語:通往 AGI 的代價與未來


訓練頂尖模型的代價正以幾何倍數成長。以 Llama 3 400B 為例,其計算量高達 3.8 × 1025 FLOPS。這是一個充滿政治智慧的數字——它精確地控制在 1 × 1026 以下,刻意避開了拜登政府行政命令中所要求的「特別審查」門檻。這項工程投入了 1.6 萬顆 H100 GPU、長達 70 天的訓練,成本保守估計為 7,500 萬美金。


隨著計算量的持續倍增,我們即將撞上一道名為「數據牆(Data Wall)」的屏障:網際網路上的高品質乾淨文本即將被用盡。當我們開始依賴「合成數據(Synthetic Data)」來訓練下一代 AI 時,擴展定律是否還能持續奏效?當人類數據的養分枯竭,AI 是否能透過「自我進化」走向 AGI?這正是年薪 75 萬美金的工程師們,現在正試圖解決的終極難題。

參閱X中的貼文影片Anthropic pays engineers $750,000+ a year to understand how LLMs work.


古月部落格
每日進步一點點 https://aidailytw.blogspot.com古月部落格
2026-09-06 7:44 發佈
內文搜尋
X
評分
評分
複製連結
Mobile01提醒您
您目前瀏覽的是行動版網頁
是否切換到電腦版網頁呢?