中國讓開源大模型工作更長時更“聰明”
北京大模型初創公司月之暗麵日前髮佈了全球最大規模開源模型Kimi K3,參數規模達2.8萬億,其在複雜推理、代碼生成、長上下文處理及智能體任務執行等核心能力方麵實現明顯躍昇。 The post 中國讓開源大模型工作更長時更“聰明” appeared first on Business Intelligence.

北京大模型初創公司月之暗麵日前髮佈了全球最大規模開源模型Kimi K3,參數規模達2.8萬億,其在複雜推理、代碼生成、長上下文處理及智能體任務執行等核心能力方麵實現明顯躍昇。
企業業務負責人黃震昕表示,K3的突破不止於“信息能夠裝得更多”,更在於處理信息的方式更加高效。
這波大模型浪潮中,注意力機製成爲全球主流大模型的技術基石。參數規模決定模型“能裝下多少知識”,注意力機製則決定模型“會不會抓重點”,能不能從海量信息中快速找到關鍵、建立聯繫並形成答案。
黃震昕表示,K3的第一項創新,在於團隊自主研髮的KDA混合線性注意力機製。傳統全注意力機製處理長文本時,計算量隨文本長度增加而産生接近平方級的增長。當模型讀取內容增加一倍,計算量就增至約四倍,這正是超長文本難落地的關鍵原因。
“KDA通過混合線性設計,把這一開銷降到接近線性增長。”黃震昕説,這意味着,在同等算力下,模型能讀得更長、處理更多信息、完成更複雜任務。 第二項創新是注意力殘差技術。“模型越大、層數越多,信息傳遞的‘通路’就越長,信號容易衰減、失真,訓練也就越容易‘翻車’。”黃震昕説,這是全球頭部實驗室共同麵對的工程難題。
黃震昕介紹,注意力殘差技術改進了信息在不同網絡層之間的傳遞和複用方式,相當於爲大模型加裝了一套“穩定器”,使2.8萬億參數不僅“訓得出來”,還能穩定高效地用起來。
KDA混合線性注意力機製解決的是“如何讓大模型幹活時長更長”,注意力殘差技術應對的則是“超大模型怎樣能越訓越聰明”。兩項自主研髮技術共同説明,中國大模型企業的競爭力,正從擴大參數規模,延伸到基礎架構和原創算法層麵。
Kimi K3的髮佈引髮國際研究機構關注。高盛集團在相關研報中,將Kimi K3視爲中國模型走向定價權的新節點,並認爲中國開源及開放權重模型的智能水平,正在達到麵向全球擴散的關鍵臨界點。
針對海外部分質疑,黃震昕回應稱:“K3性能躍昇的核心來自底層原創架構創新,並非對現有模型蒸餾複刻。此次K3的突破恰恰印証了,開源模型與中國大模型都不應當被貼上‘低價標籤’。”
據悉,Kimi K3能夠高效處理海量醫學文獻、藥品説明書及臨床指南,快速生成結構化、精準的輔助用藥建議,且已實現標普與萬得數據的插件接入,能夠自動抓取並分析上市公司財報、債券評級、資金流向等數據,爲金融行業降本增效。
黃震昕表示,中國開源大模型不僅是效率工具,更是連接技術紅利與社會福祉的橋梁,能夠讓技術服務更公平更高效地惠及更廣泛人群。“這正是以人爲本髮展理唸在中國科技領域的一個具體例証。”
The post 中國讓開源大模型工作更長時更“聰明” appeared first on Business Intelligence.