小参数高性能,阶跃新模型全球开源前三
正向外拓展帕累托边界线,实现“同样的成本,智能更高;同样的智能,成本更低”
订阅已订阅已收藏
收藏昨天,上海大模型企业阶跃星辰发布新一代旗舰基座模型Step 5 Preview(以下简称“新版基座模型”)。目前,模型已全面开放第三方接口,并将于10月15日全面开源完整权重。
在全球权威榜单AA综合智能指数(Artificial Analysis Intelligence Index)中,阶跃新版基座模型取得44分,位居全球开源模型前三,但单任务成本仅为美国旗舰模型的八分之一。
“帕累托边界”再进一步
据介绍,阶跃新版基座模型依然采用稀疏混合专家(MoE)架构,总参数量6000亿,每个词元实际激活的参数仅270亿,支持100万词元的上下文窗口,原生支持文本与视觉输入,重点面向AI编程、软件工程、专业知识工作和金融等场景。
小参数不等于能力低。榜单显示,在软件工程评测上,阶跃新版基座模型得分67.7,仅次于美国两大旗舰基座模型GPT-6 Astra和Claude Opus 5两款闭源旗舰。
目前,大模型仍受“规模法则”的制约,通常来说能力越强,算力成本越高,业内通常用“帕累托边界”来描述:在帕累托边界线上,提升一分智能就需要多付一份成本。而阶跃星辰表示新版基座模型正在把帕累托边界线往外拓展,“相当于同样的成本,智能更高;同样的智能,成本更低。”
AA综合智能指数显示,阶跃新版基座模型每完成一项智能指数任务的成本约为0.71美元,输入、输出价格分别为每百万词元1美元和2.7美元。官方测算,在智能水平相当的情况下,单任务成本约为美国Claude Opus 5的八分之一。
金融是超长任务“试金石”
在训练新版基座模型过程中,阶跃星辰把金融列为重点验证场景。
外部基准“前沿金融”(FrontierFinance)包含了220道专业金融问题、11543项评估标准,覆盖六类投资应用场景。测评结果显示,阶跃新版基座模型得分66.4,领先GPT-6 Astra及其他参评开源模型,位列全球第二。
围绕“公司研究”这一高难度金融工作流,阶跃星辰还自建了三项内部评测,分别考察模型检索核验实时金融信息、把数据和假设转化为可复现的估值,以及产出完整研究报告的能力。在上述金融基准上,阶跃新版基座模型均取得开源模型中的领先成绩。
金融场景的能力,是大模型在超长任务链、超长上下文和调用工具等方面的缩影之一。
据介绍,阶跃星辰专门构建了覆盖553个独立代码仓库、9类任务、20个应用领域和33种编程语言的“阶跃代码工作台”,包含漏洞修复、功能开发、代码重构、环境配置等任务。在内外部专家评估中,约七成参与者认为,新版基座模型能自主解决中高复杂度的编程任务。
连续三代追求“以小博大”
值得注意的是,阶跃星辰连续三代基座模型都在追求“以更小算力博得更大性能”。
近3个月以来,阶跃星辰相继推出端侧模型和语音模型。无论是新版基座模型、端侧模型还是语音模型,都是服务于阶跃星辰的“模型+终端”策略。比如,阶跃模型手机装机量已超过4200万台,日均服务近2000万人次,合作覆盖国内超过半数头部手机品牌,应用于识屏问答、智能搜索、内容生成和跨应用任务执行。
阶跃星辰研发团队负责人表示,过去大模型“规模法则”的逻辑,是用更多计算换取更强智能。但随着模型规模和任务复杂度同步增长,算力成本急剧上升。下一阶段“规模法则”不只是更多计算,也包括更高效率的计算。
在万亿参数超大模型的趋势下,阶跃新版基座模型能否凭借“小参数高性能”重回全球第一梯队,还要等待10月15日全面开源后的实测检验。
(来源:解放日报 记者 查睿)
分享让更多人看到
- 评论
- 关注
































第一时间为您推送权威资讯
报道全球 传播中国
关注人民网,传播正能量