OpenAI 隨 GPT-6 系列推出了改良的提示快取(prompt caching)系統,對三十分鐘內重複使用的共享前綴提供快取折扣,快取輸入詞元最高可減免九成費用。這套機制針對長時間運作的代理應用設計,因為這類應用會連續發出多個彼此承接的 API 請求,並反覆攜帶相同的指令、工具定義與上下文。官方同時開放提示快取儀表板與診斷工具,讓開發者檢視命中率並排查未命中的原因。

改良提示快取是 OpenAI 為 GPT-6 系列推出的快取機制,對三十分鐘內重複使用的共享前綴提供折扣,快取輸入詞元最高減免九成費用,並預設提供較高的命中率。

這項更新的背景是代理工作負載的形態改變。官方指出,GPT-6 能讓持續運作的代理花數小時處理重構程式碼、撰寫研究文件與製作簡報等複雜任務,而這類應用往往在同一次工作階段中重複傳送大量相同內容。OpenAI 把這些共享上下文快取起來,藉此在不同請求之間重用運算,同時降低回應延遲。

OpenAI 的提示快取更新是什麼?

這是 GPT-6 系列預設啟用的改良快取系統,會自動重用共享前綴,並新增儀表板、診斷工具與顯式快取斷點,讓開發者監控與控制快取行為。

官方說明把重點放在兩個層面。第一是預設表現,新系統在預設狀態下提供更高的快取命中率,開發者不必手動調校即可受惠。第二是可控性,OpenAI 補上過去欠缺的觀測與診斷能力,讓快取不再是黑盒,而是可以量測、可以除錯的工程項目。

這套系統並非全新概念,而是既有機制的延伸。OpenAI 過去已對重複使用的共享前綴給予折扣,今次更新把折扣資格明確界定為三十分鐘內的重用窗口,並把監控與診斷補齊,形成從生成到除錯的完整鏈路。

新的快取機制如何運作?

請求中相同的共享前綴會在同一時間窗口內被快取並重用,命中部分以折扣價計費。系統會按前綴位置與內容比對,決定哪些詞元可重複使用。

運作邏輯建立在請求之間的共同部分之上。當代理連續發出多個請求,模型、工具定義與早期對話內容通常保持一致,這些固定段落構成可重用的前綴。系統在窗口期內比對前綴,命中部分改以折扣價計費,未命中的部分則按標準價格計算。

這種設計對長上下文工作特別有效。上下文越長、重複次數越多,可快取的詞元比例就越高,成本落差亦越明顯。反過來說,若每次請求都改動開頭段落,可用前綴就會被切斷,即使內容相似亦無法重用。

開發者可以用什麼工具監控快取表現?

提示快取儀表板顯示應用輸入中來自快取的比例,並以輸入組成圖比較命中與未命中的詞元。診斷工具則在出現非預期未命中時,比對請求與近期回應找出原因。

儀表板位於平台的用量頁面,會呈現應用輸入有多少比例由快取提供,並可追蹤命中率隨時間的變化。其中的輸入組成圖把快取詞元與未快取詞元並列,方便開發者觀察命中率下滑的時點,並評估程式改動對快取的實際影響。

當見到預期之外的未命中,診斷工具可派上用場。它會把一筆請求與近期回應並列比對,指出是模型、工具、設定或輸入的哪一項變動令前綴無法重用。回應中亦附上受影響詞元的估算數量,讓開發者判斷影響規模,再決定優化方向。

快取命中率會受到哪些因素影響?

工具定義、參數順序與推理設定的變動都會令前綴失效。只要工具結構或排列改變,快取即無法重用先前內容,推理強度的調整亦曾造成同樣問題。

官方列出的診斷例子顯示,工具變動是常見肇因。當代理的工具集調整,即使只是定義或排序改變,先前累積的前綴便無法重用,診斷結果會標示為工具已變更,並列出未能重用的詞元數量。對工具頻繁增刪的代理而言,這類失效往往難以察覺。

推理設定的調整同樣影響命中。在 GPT-6 模型上,開發者過去若要在對話中途改變推理強度,會令快取失效。今次更新容許在請求層級的推理設定不變的前提下,以追加設定更新的方式調整推理強度,從而在保留可重用上下文的同時改變運算力度。

開發者如何優化快取命中率?

保持工具定義、結構與排序穩定,以允許清單控制可調用工具而非刪除定義;把新指令放在上下文末端,並可在啟動時預先預熱已知上下文以縮短延遲。

官方提出的做法圍繞「只增不刪」原則。當代理的工具需求改變,應保留原有定義與排序,改以允許清單限制實際可調用的工具,或在不需要工具時把選擇設為不調用,而非直接把定義移除。新增指令則建議以新的開發者訊息附加在上下文末端,用以覆蓋較早的指示。

顯式快取斷點提供更直接的控制。開發者可自行指定哪些提示前綴需要重用,官方更新的快取指南亦說明斷點的用法、可重用的有效時間,以及工具與輸入變動如何影響重用。另有預熱機制,可在使用者提問前預先準備已知上下文,把運算移出使用者的等待時間。

這項更新對 AI 代理應用有什麼影響?

長時間運作的代理可望明顯降低輸入成本與延遲,因為重複的工具定義與上下文可重複計費。但代理的工具設計若缺乏穩定性,折扣效果會大打折扣。

成本結構的改變對代理商業模式有實際意義。以小時計的長任務會累積大量輸入詞元,其中固定部分往往佔比可觀,快取折扣直接壓低這部分的支出;延遲下降亦改善互動體驗,尤其是需要多輪工具調用的工作流程。

但效益並非自動到手。工具與設定的穩定性成為新的工程課題,開發者需要在功能迭代與快取效率之間取得平衡。對習慣頻繁重構提示與工具集的團隊而言,改以追加方式更新上下文,會是降低帳單的關鍵習慣。

出處連結有哪些?

本文資訊整理自 OpenAI 官方公告「Better prompt caching for GPT-6」,包括快取折扣、診斷工具與優化建議,數據以官方公布為準。

本文內容整理自 OpenAI 官方公告,包括快取折扣比例、三十分鐘重用窗口、提示快取儀表板與診斷工具的說明,以及官方針對工具變動、推理設定與預熱機制提出的優化建議。相關技術細節以官方文件與 API 指南為準。

常見問題有哪些?

以下整理三個關於提示快取的常見疑問,涵蓋折扣適用條件、快取無法命中的原因,以及對推理設定的調整方式。

快取折扣適用於哪些情況?

折扣針對可重用的共享前綴,且需在三十分鐘窗口內被重複使用。若每次請求都改動開頭段落,或隔太久才再次發出請求,前綴便無法重用,該部分需按標準價格計費。

為什麼快取會未命中?

常見原因包括工具定義或排序改變、模型或設定調整,以及輸入內容在前綴位置出現變動。官方診斷工具會比對請求與近期回應,標示出具體肇因與受影響的詞元數量。

可以在對話中途改變推理強度嗎?

在 GPT-6 模型上可以。開發者透過追加設定更新來調整推理強度,同時保持請求層級的推理設定不變,藉此避免令既有快取失效,兼顧任務難度與上下文重用。

總結:提示快取更新對開發者意味著什麼?

這項更新把快取由隱藏行為變成可觀測、可調控的工程項目。開發者以穩定工具定義與追加式更新換取折扣,長任務代理的成本與延遲有望同步下降。

歸根究柢,今次更新的價值在於把快取從效能細節提升為可管理的設計考量。開發者取得儀表板與診斷工具後,能清楚掌握哪些上下文被重用、哪些變動造成浪費,並以顯式斷點、穩定工具定義與預熱機制主動提升命中率。對長時間運作的代理應用而言,這套組合是控制成本與延遲的實用手段。