Back to top
  • 공유 分享
  • 인쇄 列印
  • 글자크기 字體大小
已複製網址

評測稱冠卻遭淘汰!南韓獨資AI模型二階段評比出爐,Motif憾居第4

擺放評分表的政府簡報現場 / TokenPost.ai

在南韓政府主導的獨資人工智慧(AI)基礎模型(Foundation Model)計畫二階段評選中,「基準測試」總分排名第一的Motif Technologies最終遭到淘汰。綜合總分依序為SK電信70.6分、Upstage 69.9分、LG AI研究院69.0分、Motif Technologies 65.8分。

南韓科學技術情報通信部27日在新聞資料中公布了獨資AI基礎模型計畫二階段評選的詳細分數。前三名團隊晉級下一階段,Motif Technologies則以第4名遭到淘汰。

此次二階段評選總分為100分,配分為基準測試40分、專家評比35分、使用者評比25分。

基準測試由全球評測機構Artificial Analysis(人工分析)的AAII評測25分,以及韓國智能資訊社會振興院(NIA)基準測試15分組成,目的是同時檢視模型的基礎效能、韓語能力與可靠度。

Motif Technologies在基準測試總分拿下24.6分,是四支團隊中最高,在AAII評測也以11.9分排名第一。

在NIA基準測試中,Motif Technologies獲得12.7分。整體基準測試分數上,Motif Technologies領先Upstage的22.7分、SK電信的22.2分與LG AI研究院的20.6分。

然而勝負關鍵出現在專家評比與使用者評比。專家評比由LG AI研究院以29.5分拿下第一,SK電信29.3分、Upstage 29.1分緊追在後,Motif Technologies則以27.1分敬陪末座。

使用者評比方面,SK電信19.1分、LG AI研究院18.9分、Upstage 18.1分,Motif Technologies僅14.1分。SK電信與Motif Technologies的總分差距為4.8分,而使用者評比5分的落差,正是左右最終結果的關鍵。

使用者評比是由AI專業使用者評審與一般民眾評分加總而成,AI專業使用者評審實際有49人參與,一般民眾評分則有185人參與。Motif Technologies在AI專業使用者評比拿下8.4分,一般民眾評比則為5.7分。

隨著分數公開,Motif Technologies遭淘汰的原因比先前更清楚,但爭議核心仍未解開:這場獨資AI基礎模型評選,究竟要選出什麼樣的模型。

所謂「基礎模型」,是指能夠應用於多種服務與產業的基盤AI模型。基準測試分數用來呈現模型的基礎效能,使用者評比則反映實際使用情境下的便利性與完成度。

南韓科學技術情報通信部表示,評選標準與方式事前已與各候選團隊協商,當時並無異議。該部並說明,階段評選標準會配合AI技術的快速變化,採取每6個月調整開發目標的「移動標靶」方式訂定。

這並非獨資AI基礎模型評選首次引發爭議。首輪評選中,Naver Cloud因未能滿足模型「獨資性」要求而遭淘汰;其後遞補入選的Motif Technologies,這次也對二階段評選結果提出異議。

對此,業界出現「單一分數難以完整說明AI模型效能與實用性」的看法。基準測試分數再高,若使用性偏低,仍可能在綜合評選中落後;反之使用性再好,也難以迴避基礎效能的爭議。本刊此前在報導AI基準測試評選時也指出,評分結構與評測工具(Harness)會直接影響結果的解讀方式。

科技情報通信部表示,目前正與相關部會研議超越現行方式的新支援體系,準備具體方案後將對外公布。另一方面,業界也關注南韓政府後續是否會提出兼顧基準測試與實際使用性的新評選標準。

<版權所有 ⓒ TokenPost,未經授權禁止轉載與散佈>

最受歡迎

其他相關文章

主打文章

20年以上逾期債權全數註銷 南韓明年推動小商工債務調整

記憶體價格飆漲夾擊蘋果,獲利前景添變數

留言 0

留言小技巧

好文章。 希望有後續報導。 分析得很棒。

0/1000

留言小技巧

好文章。 希望有後續報導。 分析得很棒。
1