智譜 AI(Z.ai)今日突襲發佈 GLM-5.3-Flash,一個以「高效能、低成本」重新定義開源大模型的旗艦級產品。作為 GLM-5 系列首個原生多模態模型,它以 320B 總參數、僅 18B 活躍參數的 MoE 架構,在 benchmark 與真實工作負載上全面超越 GLM-5.2,價格卻只需後者的十分之一,編程與 Agent 能力更逼近 Claude Opus 4.8。本文從架構創新、效能數據、生態支援與部署方案四個面向,拆解這個今日最重磅的開源 AI 消息。
GLM-5.3-Flash 是什麼?
GLM-5.3-Flash 是智譜 AI 於 2026 年 8 月 26 日發佈的開源大模型,採用 320B 總參數、18B 活躍參數的 MoE 架構,為 GLM-5 系列首個原生多模態模型。其效能超越 GLM-5.2、價格僅十分之一,編程與 Agent 能力逼近 Claude Opus 4.8,並以 MIT 授權開源。
GLM-5.3-Flash 是智譜 AI 在 2026 年 8 月 26 日正式發佈的開源大語言模型,型號名稱中的「Flash」揭示其定位:以最快的推理速度、最低的服務成本,提供接近頂級閉源模型的智能體驗。它是 GLM-5 系列第一個原生多模態模型,這意味着它在訓練階段就直接整合了視覺與文字理解能力,而非事後拼接,因此在圖像理解、視覺問答與多模態 Agent 任務上有更紮實的基礎。
從規模看,GLM-5.3-Flash 擁有 320B 總參數,但每次推理只啟動 18B 活躍參數——這是標準的 Mixture-of-Experts(MoE)設計。換句話說,模型「知道」320B 參數的知識,但每次回答只動用 18B 的計算資源,這就是它效能與成本兼得的核心秘密。
GLM-5.3-Flash 的價格與效能表現如何?
GLM-5.3-Flash 以十分之一的價格超越上一代旗艦 GLM-5.2,在編程與 Agent 基準上逼近 Anthropic 最頂級的 Claude Opus 4.8。其 320B 總參數、18B 活躍參數的 MoE 架構是性價比的核心來源,官方強調這是重新訓練、重新設計架構的結果,而非簡單的模型壓縮。
最令整個 AI 圈震動的,是官方給出的兩組對比數據:超越 GLM-5.2 的同時價格只要十分之一,以及在編程(coding)與 Agent 基準上逼近 Claude Opus 4.8。
Claude Opus 4.8 是 Anthropic 目前最頂級的閉源模型之一,在軟件工程與複雜 Agent 任務上一向被視為標竿。如今一個開源模型、以十分之一的價格逼近這個等級,對開發者生態的衝擊不言而喻——尤其 GLM-5.3-Flash 是真正開源(MIT 授權),可以自行部署、微調、甚至商用,無需被 API 廠商綁住。
官方 benchmark 亮點
- 編程能力:逼近 Claude Opus 4.8,在 Terminal-Bench 2.1 等真實終端任務表現突出
- Agent 能力:DeepSWE、Toolathlon Verified、AutomationBench 等多個 Agent 基準均達頂級水平
- 長上下文:支援高達 1M token 級別上下文(配合混合注意力架構),NL2Repo 等長任務可達 64K+ 輸出
- 多模態:BabyVision 等視覺基準,30T token 多模態預訓練語料支撐
GLM-5.3-Flash 的架構有什麼創新?
GLM-5.3-Flash 有三項架構創新:稀疏與線性混合注意力大幅降低長上下文成本;Manifold-Constrained Hyper-Connections(mHC)提升大規模訓練效率;以及基於 30T token 多模態語料的全新 base model。這些設計令模型以少量活躍參數提供接近頂級閉源模型的效能。
GLM-5.3-Flash 並非單純「更大更便宜」,它在架構層面做了三個關鍵創新:
1. 稀疏 + 線性混合注意力(Hybrid Sparse + Linear Attention)
這是 GLM 系列首次引入混合注意力架構。傳統 Transformer 的標準注意力(softmax attention)隨 context 長度呈平方級增長,長上下文服務成本極高。GLM-5.3-Flash 將稀疏注意力與線性注意力結合,大幅削減長上下文服務成本,同時保留精確的長上下文能力——這是它能以低價提供 1M token 級別上下文的技術基礎。
2. Manifold-Constrained Hyper-Connections(mHC)
模型採用了一種名為 mHC 的新型連接機制,進一步提升規模化訓練的效率。簡單講,這種設計讓深層網絡的梯度流動更穩定,令 30T token 級別的大規模預訓練更「抵」——同樣的算力,學到更多智能。
3. 全新訓練的 Base Model + 30T token 多模態語料
GLM-5.3-Flash 並非由 GLM-5.2 增量改造,而是從一個全新訓練的 base model 出發,配合 Z.ai 最新的 30T token 多模態預訓練語料。官方形容為「重新設計的架構與訓練配方」(architecture and training recipe redesigned around capability and efficiency)。
GLM-5.3-Flash 是否完全開源?
是的。GLM-5.3-Flash 已於 Hugging Face 以 MIT 授權發佈,可自由使用、修改、商用與二次分發,是開源陣營中最寬鬆的授權之一。它即日支援 SGLang、vLLM、KTransformers 等主流框架,並已上架 OpenRouter,開發者幾分鐘內即可接入使用。
GLM-5.3-Flash 已正式上線 Hugging Face(zai-org/GLM-5.3-Flash),採用 MIT 授權——意味住你可以自由使用、修改、商用,甚至二次分發,是目前開源大模型陣營中最寬鬆的授權之一。
即日支援的部署框架
| 框架 | 用途 | |——|——| | SGLang | 高效推理,官方 cookbook 已上線 | | vLLM | 生產級推理框架,官方 recipes 已更新 | | KTransformers | 個人電腦級部署,官方教學已提供 | | TokenSpeed | 輕量快速推理方案 |
對於沒有 GPU 的開發者,Z.ai 官方 API 平台已即日開放 GLM-5.3-Flash 服務,OpenRouter 亦已同步上架(z-ai/glm-5.3-flash),意味住你可以用 OpenAI 兼容的 SDK 幾分鐘內接入。
為什麼這個發佈如此重要?
這個發佈同時衝擊價格、開源與架構三個維度:它以十分之一價格提供超越上一代旗艦的效能,令頂級智能的單位成本大幅下降;以 MIT 授權提供原生多模態與頂級 Agent 能力的開源旗艦選擇;並展示混合注意力路線令長上下文成本全面下降,直接影響閉源 API 廠商的定價空間。
GLM-5.3-Flash 的意義不止於「又多一個開源模型」,而在於它同時衝擊了三個維度:
- 價格維度:1/10 價格超越上一代旗艦,正式把「頂級智能」的單位成本拉低一個數量級。對於初創公司同個人開發者,以前用不起的高端模型能力,而家門檻大降。
- 開源維度:MIT 授權 + 即日支援主流推理框架,代表開源模型陣營首次在「原生多模態 + 頂級 Agent 能力」呢個賽道上有咗旗艦選擇,直接威脅閉源 API 廠商的定價權。
- 架構維度:混合注意力 + mHC 等創新,展示「用更少算力換更多智能」的路線正在成為主流,長上下文服務成本有望全面下降。
GLM-5.3-Flash 有哪些實際應用場景?
開發者可將它作為 Claude Opus 的本地替代品處理程式碼生成與終端任務;初創公司用十分之一成本接入頂級 Agent 能力做自動化流程與多模態理解;研究人員可基於 MIT 授權自由微調;配備高效能 GPU 的個人用戶可用 KTransformers 本地運行 18B 活躍參數版本。
- 開發者:作為 Claude Opus 的本地替代品做程式碼生成、Code Review、終端命令操作(Terminal-Bench 表現突出)
- 初創公司:用 1/10 成本接入頂級 Agent 能力,做自動化流程、客服機器人、多模態內容理解
- 研究人員:MIT 授權可以任意微調,做 domain-specific 模型訓練
- 個人用戶:KTransformers 支援下,有高效能 GPU 的玩家可以在自己電腦跑 18B 活躍參數版本
常見問題有哪些?
GLM-5.3-Flash 同 GLM-5.2 有咩分別?
GLM-5.3-Flash 係 GLM-5 系列首個原生多模態模型,效能超越 GLM-5.2 之餘價格只需十分之一,並採用全新混合注意力架構,長上下文成本大減。
點樣用 GLM-5.3-Flash?
三種方式:① Z.ai 官方 API 平台(docs.z.ai)② OpenRouter(z-ai/glm-5.3-flash,OpenAI 兼容 SDK 即用)③ 本地部署(vLLM / SGLang / KTransformers)。
GLM-5.3-Flash 係咪真係免費開源?
係。Hugging Face 上以 MIT 授權發佈,可以自由使用、修改、商用,甚至二次分發。
前身 Ox Alpha Model 係咩?
GLM-5.3-Flash 的前身係 Z.ai 內部代號 Ox Alpha Model,經過完整重新訓練與架構重塑後,以 GLM-5.3-Flash 名義正式向公眾發佈。
參考來源:Z.ai 官方 Hugging Face 模型卡(zai-org/GLM-5.3-Flash)、Z.ai 官方 Blog、OpenRouter 模型頁面。