OpenAI 於官方網站發布 MentalHealthBench,一個用於評估 AI 系統在真實心理健康對話中如何回應的開放評測基準。該基準由 22 個國家逾 80 位持牌心理健康專家共同建立,涵蓋成人、13 至 17 歲青少年、照顧者與臨床人員四類使用者情境,並公開方法、評分準則與結果,供研究社群自行檢視與延伸。

MentalHealthBench 是 OpenAI 推出的開放評測基準,由 22 個國家逾 80 位持牌心理健康專家共同建立,用於衡量 AI 在心理健康對話中的回應表現。

OpenAI 指出,過往同類評測多集中於緊急情境,並以寬泛的預設準則量度成效,令業界難以理解模型在完整心理健康對話光譜中的表現,亦難以判斷回應是否符合專家指引。該公司同時說明,ChatGPT 並非治療或專業照護的替代品,基準的目的是把專家判斷轉化為可量度的進度指標。

MentalHealthBench 是什麼?

MentalHealthBench 是針對心理健康對話設計的評測集合,覆蓋非緊急、高風險與緊急三類情境,評估模型在安全、追問脈絡與提供可行建議等行為的表現。

基準以私隱保護技術生成合成的心理健康對話,模擬真實使用模式,部分情境附帶使用者背景資料,例如近期親人離世,用以檢視模型是否運用脈絡調整回應。情境橫跨多個語言與地區,並按需要程度分為三級:日常情感對話、有明顯困擾但未屬即時緊急,以及出現即時安全風險而需要現實支援的緊急情況。

MentalHealthBench 由誰建立?

基準由逾 80 位持牌心理學家與精神科醫生共同建立,來自 22 個國家、19 種語言,涵蓋近 20 個心理健康子專科,並經多輪專家共識審閱後定稿。

參與建立的專家群來自 22 個國家,操 19 種語言,涵蓋近 20 個心理健康子專科。每段對話由至少三位專家審閱,只有獲至少兩位同意、且未被第三位否定的準則才會保留,最終準則反映專家對模型應如何回應的共識判斷。青少年情境另由具青少年心理健康專業的臨床人員審閱,以評估回應是否切合該年齡層的需要。

評分標準如何運作?

每段對話由專家列出逐項評估準則,每條只針對單一行為並帶 -10 至 +10 權重,正分獎勵有益行為、負分懲罰有害行為,再由自動評分器對照評分。

每條準則只針對回應中的單一面向,例如是否提出正確問題,或是否給出最適切的建議。權重由 -10 至 +10,正分獎勵有益行為,負分懲罰有害行為,數值越大代表該準則在該對話中的臨床重要性越高。基準以 GPT-5.6 Sol 作為自動評分器,對照專家撰寫的準則為模型回應打分,論文中詳述評分流程與評估設定。

模型在基準上的表現如何?

OpenAI 對多個前沿模型進行評測,結果顯示 AI 系統在協助使用者處理心理健康情境上持續改善,較新模型在適時追問脈絡等行為的表現明顯提升。

基準覆蓋不同需要程度的情境,令研究者可同時觀察模型在日常生活壓力與需要現實支援的緊急情況下的表現。結果亦按使用者類型拆分,包括成人、13 至 17 歲青少年、照顧者與臨床人員。OpenAI 指出,整體分數可拆解為十個行為維度,分數相近的模型在不同維度上可以強弱互見,這種細緻量度有助研究社群定位改善空間。

  • 80+持牌專家
  • 22參與國家
  • 19語言
  • 10行為維度

基準由逾 80 位持牌專家、22 個國家、19 種語言共同建立,評估涵蓋十個行為維度,並按成人、青少年、照顧者與臨床人員四類使用者分別呈現結果。

使用者與專家的觀點有何差異?

研究另訪問 44 位曾使用 AI 取得情緒支援的成年人,來自 16 個國家。使用者重視實用下一步與語氣,專家較強調收集脈絡與審慎解讀模糊情境,兩者互補。

除基準本身,OpenAI 另行比較專家指引與使用者實際感受,檢視專家評分較高的回應是否仍會令人感到冷淡。該分析訪問 44 位曾以 AI 取得心理健康或情緒支援的成年人,來自 16 個國家、14 種語言,且只涵蓋非緊急對話,以免參與者接觸具壓力的內容。結果顯示,使用者看重語氣與具體可行的下一步,專家則較著重收集相關脈絡與審慎判斷模糊情境,兩者構成互補而非對立的視角。

對 AI 開發者有什麼影響?

開發者可免費取用基準的方法與評分準則,用以檢查自家模型在不同需要程度對話中的行為,並以可解釋的行為維度定位改善方向。

對開發者而言,MentalHealthBench 提供的是一套可重複使用的外部標準,而非單一分數。由於準則按行為維度拆分並附權重,團隊可以把評測結果對應到具體的產品調整,例如改善追問脈絡的時機,或在提供建議前先確認使用者的實際處境。基準公開方法與題目設計,亦讓獨立研究者可以複現結果並提出替代方案。

心理健康 AI 的安全措施有哪些?

OpenAI 表示已強化 ChatGPT 在敏感對話中的回應,擴大危機資源覆蓋範圍,加入受信任聯絡人功能,並推出為青少年而設的 ChatGPT for Teens。

除評測工作,OpenAI 列出多項相關措施,包括強化 ChatGPT 在敏感對話中的回應、擴大危機資源的可及範圍,以及加入受信任聯絡人功能,讓使用者在情緒困擾時可連繫信任的人。該公司亦推出為青少年而設的 ChatGPT for Teens,提供額外保護,並透過研究資助、與業界組織合作及支援第三方獨立評測,推進 AI 與心理健康交叉領域的討論。

出處連結有哪些?

本文資訊整理自 OpenAI 官方發布的 MentalHealthBench 介紹文章,專家組成、評分準則與模型評測結果均可於原文查閱。

本文內容整理自 OpenAI 官方網站文章《Introducing MentalHealthBench》,文中專家組成、情境分級、準則權重、自動評分設定及使用者訪談結果,均取自該文所述內容。讀者可前往上述來源查閱完整論文說明與後續更新。

總結:這個基準對 AI 安全意味著什麼?

基準把心理健康對話由模糊的「感覺良好」轉為可量度的行為指標。在每週逾十億人使用 ChatGPT 的規模下,公開評測標準讓安全改進可被外部檢驗。

OpenAI 在介紹中重申,ChatGPT 無法取代治療或專業照護,這亦正是基準需要公開的原因:當模型每天承接大量情緒相關對話,回應品質就不能只靠供應商自述。MentalHealthBench 把專家共識轉為可重複的評分流程,並公開題目設計與權重邏輯,讓外部研究者能夠檢驗、質疑與改進。對整個行業而言,這種做法提供了一個可參照的模式,把過去難以量化的安全與同理表現,納入與效能同等重要的評估框架。