小參數高性能,階躍新模型全球開源前三
正向外拓展帕累托邊界線,實現“同樣的成本,智能更高﹔同樣的智能,成本更低”
訂閱已訂閱已收藏
收藏昨天,上海大模型企業階躍星辰發布新一代旗艦基座模型Step 5 Preview(以下簡稱“新版基座模型”)。目前,模型已全面開放第三方接口,並將於10月15日全面開源完整權重。
在全球權威榜單AA綜合智能指數(Artificial Analysis Intelligence Index)中,階躍新版基座模型取得44分,位居全球開源模型前三,但單任務成本僅為美國旗艦模型的八分之一。
“帕累托邊界”再進一步
據介紹,階躍新版基座模型依然採用稀疏混合專家(MoE)架構,總參數量6000億,每個詞元實際激活的參數僅270億,支持100萬詞元的上下文窗口,原生支持文本與視覺輸入,重點面向AI編程、軟件工程、專業知識工作和金融等場景。
小參數不等於能力低。榜單顯示,在軟件工程評測上,階躍新版基座模型得分67.7,僅次於美國兩大旗艦基座模型GPT-6 Astra和Claude Opus 5兩款閉源旗艦。
目前,大模型仍受“規模法則”的制約,通常來說能力越強,算力成本越高,業內通常用“帕累托邊界”來描述:在帕累托邊界線上,提升一分智能就需要多付一份成本。而階躍星辰表示新版基座模型正在把帕累托邊界線往外拓展,“相當於同樣的成本,智能更高﹔同樣的智能,成本更低。”
AA綜合智能指數顯示,階躍新版基座模型每完成一項智能指數任務的成本約為0.71美元,輸入、輸出價格分別為每百萬詞元1美元和2.7美元。官方測算,在智能水平相當的情況下,單任務成本約為美國Claude Opus 5的八分之一。
金融是超長任務“試金石”
在訓練新版基座模型過程中,階躍星辰把金融列為重點驗証場景。
外部基准“前沿金融”(FrontierFinance)包含了220道專業金融問題、11543項評估標准,覆蓋六類投資應用場景。測評結果顯示,階躍新版基座模型得分66.4,領先GPT-6 Astra及其他參評開源模型,位列全球第二。
圍繞“公司研究”這一高難度金融工作流,階躍星辰還自建了三項內部評測,分別考察模型檢索核驗實時金融信息、把數據和假設轉化為可復現的估值,以及產出完整研究報告的能力。在上述金融基准上,階躍新版基座模型均取得開源模型中的領先成績。
金融場景的能力,是大模型在超長任務鏈、超長上下文和調用工具等方面的縮影之一。
據介紹,階躍星辰專門構建了覆蓋553個獨立代碼倉庫、9類任務、20個應用領域和33種編程語言的“階躍代碼工作台”,包含漏洞修復、功能開發、代碼重構、環境配置等任務。在內外部專家評估中,約七成參與者認為,新版基座模型能自主解決中高復雜度的編程任務。
連續三代追求“以小博大”
值得注意的是,階躍星辰連續三代基座模型都在追求“以更小算力博得更大性能”。
近3個月以來,階躍星辰相繼推出端側模型和語音模型。無論是新版基座模型、端側模型還是語音模型,都是服務於階躍星辰的“模型+終端”策略。比如,階躍模型手機裝機量已超過4200萬台,日均服務近2000萬人次,合作覆蓋國內超過半數頭部手機品牌,應用於識屏問答、智能搜索、內容生成和跨應用任務執行。
階躍星辰研發團隊負責人表示,過去大模型“規模法則”的邏輯,是用更多計算換取更強智能。但隨著模型規模和任務復雜度同步增長,算力成本急劇上升。下一階段“規模法則”不只是更多計算,也包括更高效率的計算。
在萬億參數超大模型的趨勢下,階躍新版基座模型能否憑借“小參數高性能”重回全球第一梯隊,還要等待10月15日全面開源后的實測檢驗。
(來源:解放日報 記者 查睿)
分享讓更多人看到
- 評論
- 關注
































第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量