国产欧美日韩三区_偷窥自拍亚洲色图精选_久久大片网站_成人在线黄色_成人亚洲免费视频_99久久久精品_国产美女自拍_韩国19禁主播vip福利视频_色综合视频一区二区三区日韩_日本在线观看一区二区

當前位置:首頁 > 科技  > 測評

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一

來源: 責編: 時間:2024-05-22 17:09:32 212觀看
導讀 OpenAI長期霸榜的SuperCLUE(中文大模型測評基準),終于被國產大模型反將一軍。事情是這樣的。自打SuperCLUE問世以來,成績第一的選手基本上要么是GPT-4,要么是GPT-4 Turbo,來感受一下這個feel:(PS:共有6次

OpenAI長期霸榜的SuperCLUE(中文大模型測評基準),終于被國產大模型反將一軍。J4J28資訊網——每日最新資訊28at.com

事情是這樣的。J4J28資訊網——每日最新資訊28at.com

自打SuperCLUE問世以來,成績第一的選手基本上要么是GPT-4,要么是GPT-4 Turbo,來感受一下這個feel:J4J28資訊網——每日最新資訊28at.com

(PS:共有6次成績,分別為2023年的9月-12月和2024年的2月、4月。)J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方J4J28資訊網——每日最新資訊28at.com

但就在最近,隨著一位國產選手申請的出戰,這一局面終是迎來了變數。J4J28資訊網——每日最新資訊28at.com

SuperCLUE團隊對其進行了一番全方位的綜合性測評,最終官宣的成績是:J4J28資訊網——每日最新資訊28at.com

總分80.03分,超過GPT-4 Turbo的79.13分,成績第一!J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方公眾號J4J28資訊網——每日最新資訊28at.com

而這位國產大模型選手,正是來自商湯科技的日日新5.0(SenseChat V5)。J4J28資訊網——每日最新資訊28at.com

并且SuperCLUE還給出了這樣的評價:J4J28資訊網——每日最新資訊28at.com

刷新了國內大模型最好成績。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

那么商湯在SuperCLUE的這個“首次”,又是如何解鎖的呢?J4J28資訊網——每日最新資訊28at.com

綜合、文科國內外第一,理科國內第一J4J28資訊網——每日最新資訊28at.com

首先我們來看下這次官方所搭建“擂臺”的競技環境。J4J28資訊網——每日最新資訊28at.com

出戰選手:SenseChat V5(于5月11日提供的內測API版本)J4J28資訊網——每日最新資訊28at.com

評測集:SuperCLUE綜合性測評基準4月評測集,2194道多輪簡答題,包括計算、邏輯推理、代碼、長文本在內的基礎十大任務。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方報告J4J28資訊網——每日最新資訊28at.com

模型GenerationConfig配置:J4J28資訊網——每日最新資訊28at.com

temperature=0.01J4J28資訊網——每日最新資訊28at.com

repetition_penalty=1.0J4J28資訊網——每日最新資訊28at.com

top_p=0.8J4J28資訊網——每日最新資訊28at.com

max_new_tokens=2048J4J28資訊網——每日最新資訊28at.com

stream=falseJ4J28資訊網——每日最新資訊28at.com

至于具體的評測方法,SuperCLUE在已發布的相關報告中也有所披露:J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方報告J4J28資訊網——每日最新資訊28at.com

以上就是SuperCLUE公開的競技環境配置。J4J28資訊網——每日最新資訊28at.com

至于結果,除了剛才我們提到的綜合成績之外,官方還從文科和理科兩個維度,再做了細分的評測。J4J28資訊網——每日最新資訊28at.com

SenseChat V5在文科上的成績依然是打破了國內大模型的紀錄——J4J28資訊網——每日最新資訊28at.com

以82.20分的成績位居第一,同樣超越了GPT-4 Turbo。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方公眾號J4J28資訊網——每日最新資訊28at.com

在理科成績上,雖然SenseChat V5此次并沒有超越GPT-4-Turbo(低了4.35分),但整體來看,依舊在國內大模型選手中首屈一指,位列國內第一。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方公眾號J4J28資訊網——每日最新資訊28at.com

除了文理科之外,SuperCLUE也還從國內和國外的整體平均水平上做了對比。J4J28資訊網——每日最新資訊28at.com

例如和國內大模型平均水平相比,其各項成績的“打開方式”是這樣的:J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方公眾號J4J28資訊網——每日最新資訊28at.com

而在與國外選手做性能對比時,我們可以明顯看到SenseChat V5文科能力優于國外選手,數理能力也非常優秀,代碼能力依然有提升空間。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com
△圖源:SuperCLUE官方公眾號J4J28資訊網——每日最新資訊28at.com

不過有一說一,評測分數定然是代表大模型性能的一方面,但在應用為王的當下,更重要的一點或許就得看用的效果了。J4J28資訊網——每日最新資訊28at.com

實測SenseChat V5J4J28資訊網——每日最新資訊28at.com

SenseChat V5早在4月底便已經集成到了“商量”在線的對話應用中,因此我們現在就可以出題對它做一番考驗。J4J28資訊網——每日最新資訊28at.com

在邏輯測試方面,帶有文字陷阱的腦筋急轉彎,可以說是測試一個AI能力很好的例子,比如:J4J28資訊網——每日最新資訊28at.com

《紅樓夢》全書有百萬字,“紅樓夢”有幾個字?J4J28資訊網——每日最新資訊28at.com

若是仔細觀察這句話,不難發現其實句子前后并沒有太大的關聯,是一個比較典型的腦筋急轉彎。J4J28資訊網——每日最新資訊28at.com

對此,SenseChat V5給出的答案是:J4J28資訊網——每日最新資訊28at.com

《紅樓夢》作為中國古典文學的巔峰之作,其全文字數大約在70萬到80萬字之間,具體字數根據不同版本稍有差異。而標題“紅樓夢”這三個字,自然是只有三個字。這個標題凝練而富有深意,象征著作品的夢幻色彩和對封建家族興衰的深刻反思。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

我們可以看到SenseChat V5不僅找出了問題的陷阱并做出了分析,給出的答案也是正確的。J4J28資訊網——每日最新資訊28at.com

對于數學的能力,我們設置了這樣的一個問題:J4J28資訊網——每日最新資訊28at.com

假設有一個池塘,里面有無窮多的水。現有2個空水壺,容積分別為5升和6升。如何只用這2個水壺從池塘里取得3升的水。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

同樣的,SenseChat V5依舊是給出了每一個詳細的步驟和分析,并得到了最終結果。J4J28資訊網——每日最新資訊28at.com

更直接的數學問題,例如找數字之間的規律,SenseChat V5也是信手拈來:J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

在中文理解方面,即使是給SenseChat V5一大段文言文,并且上難度連環發問,它是否可以hold得住?J4J28資訊網——每日最新資訊28at.com

請看結果:J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

最后,有請“弱智吧Benchmark”:J4J28資訊網——每日最新資訊28at.com

網吧能上網,為什么弱智吧不能上弱智?J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

嗯,確實是有點實力在身上的。J4J28資訊網——每日最新資訊28at.com

如何做到的?J4J28資訊網——每日最新資訊28at.com

其實對于這個問題,商湯在4月底將自家日日新大模型SenseNova版本迭代到5.0之際,就已經有所透露;當時商湯鎖定的定位就是全面對標GPT-4 Turbo。J4J28資訊網——每日最新資訊28at.com

具體到技術,可以分為三大方面:J4J28資訊網——每日最新資訊28at.com

采用MoE架構J4J28資訊網——每日最新資訊28at.com

基于超過10TB tokens訓練,擁有大量合成數據J4J28資訊網——每日最新資訊28at.com

推理上下文窗口達到200KJ4J28資訊網——每日最新資訊28at.com

首先,為了突破數據層面的瓶頸,商湯科技使用了超過10T的tokens,確保了高質量數據的完整性,使得大模型對客觀知識和世界有了基本的認知。J4J28資訊網——每日最新資訊28at.com

商湯還生成了數千億tokens的思維鏈數據,這是此次數據層面創新的關鍵,能夠激發大模型的強大推理能力。J4J28資訊網——每日最新資訊28at.com

其次,在算力層面,商湯科技通過聯合優化算法設計和算力設施來提升性能:算力設施的拓撲極限用于定義下一階段的算法,而算法的新進展又反過來指導算力設施的建設。J4J28資訊網——每日最新資訊28at.com

這也是商湯AI大裝置在算法和算力聯合迭代上的核心優勢。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

在其它細節方面,例如訓練策略上的創新,商湯將訓練過程分為三個大階段(預訓練、監督微調、RLHF)和六個子階段,每個階段專注于提升模型的特定能力。J4J28資訊網——每日最新資訊28at.com

例如,單是在預訓練這個階段,又可以細分為三個子階段:初期聚焦于語言能力和基礎常識的積累,中期擴展知識基礎和長文表達能力,后期則通過超長文本和復雜思維數據進一步拔高模型能力。J4J28資訊網——每日最新資訊28at.com

因此在預訓練結束之際,整個模型就已經擁有了較高水平的基礎能力;但此時它的交互能力卻還沒有被激發出來,也就來到了第二階段的監督微調(SFT)和第三階段的人類反饋強化學習(RLHF)。J4J28資訊網——每日最新資訊28at.com

整體可以理解為先培養模型遵循指令和解決問題的能力,再調節其表達風格以更貼近人類的表達方式。接著,通過多維度的人類反饋強化學習過程,進一步改進模型的表達方式和安全性。J4J28資訊網——每日最新資訊28at.com

除此之外,商湯對于大模型的能力還有獨到的三層架構(KRE)的理解。J4J28資訊網——每日最新資訊28at.com

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一J4J28資訊網——每日最新資訊28at.com

首先是在知識,是指世界知識的全面灌注。J4J28資訊網——每日最新資訊28at.com

目前大模型等新質生產力工具近乎都是基于此來解決問題,也就是根據前人已經解決過的問題的方案,來回答你的問題。J4J28資訊網——每日最新資訊28at.com

這可以認為是大模型能力的基本功,但更為高階的知識,應當是基于這樣能力下推理得到的新知識,這也就是這個架構的第二層——推理,即理性思維的質變提升。J4J28資訊網——每日最新資訊28at.com

這一層的能力是可以決定大模型是否夠聰明、是否可以舉一反三的關鍵和核心。J4J28資訊網——每日最新資訊28at.com

再在此之上,便是執行,是指世界內容的交互變革,也就是如何跟真實世界產生互動(就目前而言,具身智能在這一層是潛力股般的存在)。J4J28資訊網——每日最新資訊28at.com

三者雖相互獨立,但層與層之間也是緊密關聯,打一個較為形象的比喻就是“知識到推理是像大腦,推理到執行則像小腦”。J4J28資訊網——每日最新資訊28at.com

在商湯看來,這三層的架構是大模型應當具備的能力,而這也正是啟發商湯構建高質量數據的關鍵。J4J28資訊網——每日最新資訊28at.com

One More ThingJ4J28資訊網——每日最新資訊28at.com

其實對于大模型測評這事,業界質疑的聲音也是層出不窮,認為是“刷分”、“刷榜”、“看效果才是最重要的”。J4J28資訊網——每日最新資訊28at.com

對于這樣敏感的問題,商湯在與量子位的交流過程中也是直面并給出了他們的看法:J4J28資訊網——每日最新資訊28at.com

無論從用戶選擇合適模型的角度,還是從研究者進行操作研究的需要來看,對模型能力的評價是必不可少的。J4J28資訊網——每日最新資訊28at.com

這不僅幫助用戶和研究者了解不同模型的性能,也是推動模型發展的關鍵因素。J4J28資訊網——每日最新資訊28at.com

如果只針對一個公開的評測集進行優化(即刷分),是有可能提高模型在該評測集上的分數的。J4J28資訊網——每日最新資訊28at.com

評測不應只依賴單一數據集,而應通過多個評測集和第三方閉卷考試等方式相互印證,以此來得到更全面、更有說服力的模型性能評估。J4J28資訊網——每日最新資訊28at.com

以及對于國內近期各個大模型廠商正打得熱火朝天的價格戰,商湯將眼光放在了提供更深的端到端產品價值上,特別是在具備無限潛力且與生活應用更接近的移動端上,通過端云協同實現更優的計算成本但不損害模型的綜合能力。J4J28資訊網——每日最新資訊28at.com

這或許暗示了商湯將通過技術創新和優化成本結構,為未來可能入局的價格競爭做好了自己的規劃。J4J28資訊網——每日最新資訊28at.com

參考鏈接:J4J28資訊網——每日最新資訊28at.com

[1]https://www.superclueai.com/J4J28資訊網——每日最新資訊28at.com

[2]https://mp.weixin.qq.com/s/3pfOKtG6ar2h2fR6Isv_XwJ4J28資訊網——每日最新資訊28at.com

本文鏈接:http://www.yifxia.cn/showinfo-25-89912-0.htmlGPT-4 Turbo首次被擊敗!國產大模型拿下總分第一

聲明:本網頁內容旨在傳播知識,若有侵權等問題請及時與本網聯系,我們將在第一時間刪除處理。郵件:2376512515@qq.com

上一篇: 小米入局電池制造!與寧德時代成立合資公司落地北京亦莊

下一篇: 高溫來襲囤幾件!NASA聯名款寬松情侶短袖24.9元抄底

標簽:
  • 熱門焦點
Top 韩国毛片| 免费国产在线视频| 久久99欧美| 99色视频在线观看| 精品视频免费在线| 成人在免费观看视频国产| 亚洲 男人 天堂| 日韩中文字幕在线观看视频| 久久国产影院| 日本免费乱理伦片在线观看2018| 欧美一级视频免费| 欧美激情一区二区三区视频| 青青久久国产成人免费网站| 91麻豆精品国产片在线观看| 香蕉视频亚洲一级| 日本久久久久久久 97久久精品一区二区三区 狠狠色噜噜狠狠狠狠97 日日干综合 五月天婷婷在线观看高清 九色福利视频 | 99久久精品国产国产毛片| 91麻豆爱豆果冻天美星空| 黄视频网站在线看| 日韩在线观看免费| 国产国产人免费视频成69堂| 亚洲 男人 天堂| 日本伦理网站| 欧美另类videosbestsex视频| 国产不卡高清| 日韩专区第一页| 国产成人啪精品视频免费软件| 精品视频在线观看一区二区三区| 国产91丝袜高跟系列| 精品国产一区二区三区久久久狼| 天天做日日干| 久久国产精品永久免费网站| 青青久热| 日日日夜夜操| 欧美电影免费| 可以免费看毛片的网站| 九九久久99| 香蕉视频久久| 一级女性大黄生活片免费| 可以免费在线看黄的网站| 成人高清视频在线观看| 四虎久久精品国产| 一级片片| 日韩中文字幕一区| 日韩在线观看视频网站| 天堂网中文在线| 免费国产在线观看| 日韩免费在线| 青青久久国产成人免费网站| 久久国产精品永久免费网站| a级毛片免费全部播放| 国产欧美精品午夜在线播放| 精品久久久久久中文字幕2017| 91麻豆精品国产自产在线观看一区| 高清一级做a爱过程不卡视频| 精品久久久久久影院免费| 在线观看成人网 | 成人影视在线观看| 国产不卡精品一区二区三区| 可以在线看黄的网站| 欧美a级v片不卡在线观看| 国产精品自拍亚洲| 精品久久久久久中文| 国产成人女人在线视频观看| 一级毛片视频播放| 人人干人人插| 999精品影视在线观看| 九九久久99| 97视频免费在线观看| 日韩一级黄色| 欧美一级视频高清片| 欧美爱色| 欧美激情一区二区三区在线 | 中文字幕97| 欧美另类videosbestsex高清 | 亚洲 男人 天堂| 国产一区二区精品| 一级片片| 九九干| 日本在线不卡视频| 国产91精品一区| 美女免费毛片| 91麻豆爱豆果冻天美星空| 99热视热频这里只有精品| 国产国语对白一级毛片| 99久久精品国产免费| 色综合久久天天综合| 亚洲爆爽| 日本免费看视频| 国产成人啪精品| 欧美大片一区| 欧美爱爱网| 成人免费观看的视频黄页| 久久国产一区二区| 国产成人精品综合| 青青青草视频在线观看| 可以在线看黄的网站| 黄色福利| 亚洲第一色在线| 欧美爱色| 国产91精品露脸国语对白| 精品久久久久久影院免费| 成人av在线播放| 精品久久久久久中文字幕一区| 可以免费看污视频的网站| 黄色短视频网站| 久久精品免视看国产成人2021| 精品久久久久久中文字幕2017| 久久精品欧美一区二区| 成人av在线播放| 国产一区二区精品久久| a级精品九九九大片免费看| 欧美日本国产| 精品视频在线观看一区二区三区| 美女免费毛片| 国产一区二区精品| 国产91素人搭讪系列天堂| a级毛片免费全部播放| 国产欧美精品| 久久精品免视看国产明星| 国产福利免费观看| 国产高清在线精品一区二区| 日韩字幕在线| 国产成人精品一区二区视频| 亚久久伊人精品青青草原2020| 成人免费福利片在线观看| 国产网站在线| 九九精品在线| 欧美激情影院| 可以在线看黄的网站| 麻豆系列 在线视频| 国产伦精品一区二区三区在线观看| 一 级 黄 中国色 片| 色综合久久久久综合体桃花网| 欧美国产日韩一区二区三区| 二级特黄绝大片免费视频大片| 二级片在线观看| 欧美另类videosbestsex久久 | 四虎影视久久| 麻豆午夜视频| 91麻豆精品国产自产在线| 国产a视频| 一级毛片看真人在线视频| 日本免费区| 亚洲第一色在线| 久久久久久久网| 日韩一级黄色片| 欧美激情一区二区三区中文字幕| 欧美一级视| 国产一区二区精品| 一 级 黄 中国色 片| 免费一级片在线| 久久久久久久网| 国产麻豆精品免费密入口| 国产伦精品一区二区三区在线观看| 国产极品精频在线观看| 韩国三级香港三级日本三级| 高清一级片| 九九九网站| 99热精品在线| 精品国产一区二区三区久久久狼| 久久久久久久久综合影视网| 国产成人女人在线视频观看| 欧美爱色| 精品国产三级a∨在线观看| 国产成人精品影视| 国产成人精品一区二区视频| 国产精品免费精品自在线观看| 亚洲精品中文一区不卡| 国产不卡精品一区二区三区| 美女被草网站| 成人免费高清视频| 欧美国产日韩一区二区三区| 亚洲第一色在线| 国产91精品系列在线观看| 精品视频在线看| 国产一区二区精品| 国产麻豆精品| 国产精品自拍一区| 国产原创中文字幕| 精品国产香蕉在线播出| 九九久久国产精品大片| 一级毛片看真人在线视频| 欧美国产日韩久久久| 国产网站免费视频| 99久久精品国产免费| 一本高清在线| 一级女性大黄生活片免费| 亚洲 男人 天堂| 国产国产人免费视频成69堂| 高清一级淫片a级中文字幕| 国产麻豆精品高清在线播放| 亚洲精品久久久中文字| 中文字幕97| 青青青草视频在线观看| 国产麻豆精品免费视频| 欧美夜夜骑 青草视频在线观看完整版 久久精品99无色码中文字幕 欧美日韩一区二区在线观看视频 欧美中文字幕在线视频 www.99精品 香蕉视频久久 | 日韩欧美一及在线播放| 欧美1区| 精品国产一区二区三区久久久蜜臀 |