🎯 AI大模型 · 端侧推理
一、百万Token上下文,端侧模型"长记忆"时代到来🔥 科大讯飞星火X2.5开源,端侧模型首次原生支持百万Token上下文,本地AI能力上限被彻底改写
9月1日,科大讯飞全资子公司词元星火正式推出并开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型。作为端侧模型中首个原生支持最长100万Token上下文的模型,星火X2.5将百万级信息处理能力直接带入手机、PC、汽车座舱、智能家居和机器人等本地设备。过去,端侧模型处理长文档往往要切成多段分别询问,容易出现忘记前情、遗漏信息、已读乱回的问题;而星火X2.5原生支持百万Token上下文窗口,可以在一次任务中接收和理解更大规模的信息。端侧模型首次真正具备"一次读完全文、持续理解复杂任务"的能力。
以产品售后场景为例,用户可将完整的产品手册导入星火X2.5-4B,模型能够关联退换货、故障处理和例外条件等跨章节规定,给出综合判断。面对偏远地区、设备存有家庭地图等新增条件,模型还可保持前文情境,结合物流、数据清除、费用承担等规则提供后续建议。百万级上下文并非单纯"塞下更多字",而是让模型基于完整信息,在连续交互中持续理解和处理复杂问题。
二、不止会"读",还能"干"——端侧智能体能力全面升级长上下文解决的是"信息能不能看全",智能体和工具调用能力解决的则是"看完之后能不能动手"。星火X2.5端侧模型围绕智能体、代码、数学和指令遵循等核心能力进行优化,可面向个人办公、代码开发、智能硬件和机器人等场景提供本地化智能能力。在个人办公场景中,用户上传销售明细表并提出销售分析和中英文部门业绩报告的交付需求后,星火X2.5-4B首先编写脚本完成数据汇总、关键指标提取和趋势分析,随后生成约3000字的中文部门业绩报告,并沿用原有结构和格式生成英文版报告,最后完成内容、结构和排版校验,实现从原始数据分析到双语报告交付的完整流程。
在代码开发场景中,星火X2.5-4B在算法实现、代码补全与生成等任务中,可对标参数规模大2至3倍的云端模型。开发者可通过DeepSeek Harness、OpenCode、Codex、Pi等开源Harness,将模型接入本地开发和自动化脚本流程。智能家居方面,在Domux测试集上,星火X2.5-1.7B控制指令端到端执行正确率达90.3%,平均响应时间仅0.85秒。机器人等需要持续感知和连续执行的场景,模型部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。端侧模型从"问答工具"进化为"本地工作助手"。
三、国产算力底座+多框架适配,开源降低部署门槛星火X2.5-4B和1.7B基于全国产算力平台完成全流程训练,使用约20万亿Token多样化数据进行预训练,并通过高质量监督微调和强化学习训练持续提升模型表现。在部署层面,两款模型支持英伟达、华为、海光及后摩等硬件平台,兼容vLLM、SGLang、llama.cpp等主流推理框架,可通过Ollama、LM Studio等工具快速部署,并支持使用LLaMA-Factory开展增量训练。多硬件、多框架适配,进一步降低了开发者和行业伙伴在不同环境中部署、微调和应用端侧模型的门槛。
值得一提的是,9月7日科大讯飞还将正式发布星火X2.5-293B通用大模型,进一步升级代码和智能体等核心能力。随着大模型加速进入各类终端设备,端侧AI的竞争已从"能不能跑"转向"能跑多好",百万Token上下文只是起点,本地AI能力的下一次跃升,正在开源社区中加速酝酿。
综合科技日报、中国经营报、上游新闻报道 | 2026年9月2日