GPT-6 Astra在健康相關人工智慧評測HealthBench的綜合評測中取得58.3分。不過,其他報導提到的「精神健康Bench」57.3分,必須與OpenAI官方評測結果區分。
OpenAI在GPT-6 Astra官方系統卡中公布HealthBench Professional 64.7分、HealthBench Hard 36.6分及HealthBench Consensus 95.5分。各項評測的對象與計分方式不同。
Crypto Briefing於23日報導,OpenAI以80多名心理健康專家及22國參與者為基礎開發「精神健康Bench」,GPT-6 Astra取得57.3分。報導列出的評測標準包括安全性、脈絡適切性、使用者自主性及可執行指引等。
然而,OpenAI公開的系統卡記載的是HealthBench,而非「精神健康Bench」。其他報導提到的80多名專家、22國、-1至+10分量表,以及優於前一代模型等細節,也未能在OpenAI官方資料中確認。
HealthBench分數採用長度調整方式計算。OpenAI表示,HealthBench Professional分數比GPT-5.6 Sol高4.2分,HealthBench綜合分數高1.3分,HealthBench Hard則改善3.5分。
因此,HealthBench綜合評測58.3分與「精神健康Bench」57.3分不能直接比較,因為兩者的評測名稱、計分制度及評測對象可能不同。
OpenAI表示,也針對心理健康、情緒依賴及自我傷害進行多輪對話評測。這項評測不是評估模型對固定單一問題的回答,而是假設對話會依照模型回應持續進行。
評測採用敵意使用者模擬,並將未違反安全政策的回答比例統計為「safe」指標。OpenAI表示,GPT-6 Astra在三個領域均較GPT-5.6 Sol有所改善。
不過,評測案例主要由既有模型無法提出理想回答的困難情境組成。OpenAI補充,這些結果不代表實際使用環境中的錯誤率。
HealthBench評估健康相關對話中的緊急情況處理、脈絡確認及符合專業程度的溝通。醫師會檢視情況是否需要緊急醫療,並確認必要時回答開頭是否明確建議接受緊急醫療。
HealthBench研究指出,模型在充分確認必要脈絡及處理不確定性方面仍有改善空間。這也是心理健康對話評測不能只看單一分數,還需同時檢視危機辨識與對話過程安全性的原因。
美國精神醫學會表示,2026年調查顯示,17%的成年人曾以AI聊天機器人諮詢心理健康問題;35%的人表示遇到困難時,願意與AI聊天機器人對話,而非尋求心理健康專業人士協助。
另一方面,58%受訪者擔心AI聊天機器人被用於兒童心理健康諮詢。美國精神醫學會的立場是,AI不能取代臨床判斷或專業心理健康治療。
OpenAI於9月3日公開GPT-6 Astra,並表示該模型在電腦操作、軟體工程、科學及網路安全等領域提升了效能;此外,GPT-6 Astra的分階段付費服務及開發者API也已推出。
目前可從官方系統卡確認的內容,是HealthBench分數,以及針對心理健康、情緒依賴及自我傷害的多輪對話評測。在相關評測方法與原始資料公開前,「精神健康Bench 57.3分」不能直接認定為OpenAI官方結果。
留言 0