讯飞开源两款小模型:一次能啃下一整本书,API 限时免费
讯飞开源两款小模型:一次能啃下一整本书,API 限时免费
一句话说清:科大讯飞开源了星火 X2.5-4B 和 X2.5-1.7B 两个「小个子」模型,最大的本事是一次能读完一整本书(100 万字级别),还能在断网的普通电脑上跑。不想折腾的话,直接用它限时免费的 API 也行。
发生了什么
2026 年 9 月 1 日,科大讯飞全资子公司词元星火正式推出并开源了两款端侧模型:
| 模型 | 大小 | 适合跑在哪 |
|---|---|---|
| 星火 X2.5-4B | 40 亿参数 | 台式机、好一点的笔记本 |
| 星火 X2.5-1.7B | 17 亿参数 | 普通笔记本、手机、智能家居、机器人 |
三个关键点:
- 首次把 100 万 Token 上下文做到「端侧」。所谓「端侧」就是不联网、在你自己的设备上跑。100 万 Token 大概等于一本很厚的书,或者一整套完整的产品手册、几百页的合同。以前这是云端大模型的专利,小模型根本装不下这么长的内容。
- 不只是能读,还能干活。官方举的例子:把一整本售后手册塞进去,问「买了 10 天的设备坏了、还用过第三方耗材,能不能换货」,它能自己把散在不同章节的退换货规则、故障处理、例外条款串起来给你一个综合判断。
- 全程用国产算力训练,模型权重已经放到 Hugging Face 和 GitHub 上,用 Ollama、LM Studio 这类常见工具就能一键跑起来;不想装的话,对应的 API 已经上线讯飞星辰 MaaS 平台,限时免费。
另外官方透露,9 月 7 日还会发布新一代旗舰模型星火 X2.5,代码和智能体能力会再升级。
对我有什么用
先说实话:如果你只是想找个 AI 聊两句、写写东西,这条对你没什么直接用处,直接用千问、豆包这些现成 App 更省事。
但下面这几种情况,它就有意思了:
- 你有一些不能上传云端的东西:合同、财务数据、没公开的稿子、私人病历记录。装在自己电脑上跑,数据一步都不出门。
- 你需要一口气喂给它一大堆资料:几十页的说明书、一整本手册、几百页的 PDF,普通小模型读到一半就「忘了前面说了啥」,这两个不会。
- 你想免费用 API:讯飞星辰 MaaS 上的对应 API 现在是限时免费的,注册拿到密钥,填进任何一个支持自定义 API 的客户端(比如 Cherry Studio、Chatbox)就能当免费聊天后端用。
我可以怎么做
路线 A:最省事,用免费 API(推荐先试这个)
第 1 步:浏览器打开讯飞星辰 MaaS 平台
第 2 步:在模型广场里搜索「X2.5」,找到星火 X2.5 系列,申请开通(页面上会标明限时免费)。
第 3 步:在控制台里创建一个 API 密钥,复制下来(一串以 sk- 开头的字符)。
第 4 步:打开任意一个支持「自定义 API」的免费客户端(Cherry Studio、Chatbox 都可以,官网直接下载),在设置里:
- 接口类型选 OpenAI 兼容(大部分都是)
- 接口地址填讯飞 MaaS 页面上给的那个地址
- 密钥粘贴刚才复制的那一串
- 模型名选 X2.5
第 5 步:回到聊天界面直接开聊。先拿一篇长文章试它,比如丢进去一个几十页的 PDF,问「这份文件讲了哪几件事」。
路线 B:装在自己电脑上跑(想彻底离线的人)
第 1 步:装一个跑模型的工具,新手推荐 Ollama(官网 ollama.com,下载安装,一路下一步)。
第 2 步:打开命令行(Windows 按 Win + R,输入 cmd 回车),输入命令拉取模型。具体模型名以 Hugging Face 页面为准:
第 3 步:拉完之后在同一个窗口输入 ollama run 模型名,就能直接在命令行里聊了;想用图形界面,就在 LM Studio 里加载同一个模型文件。
如果命令行这步觉得头大,那就走路线 A,效果一样,只是数据要过云端。
温馨提醒
- 「限时免费」是有期限的,不是永久免费。用之前在 MaaS 页面上看一眼当前的价格说明,别到时候收到账单才反应过来。
- 4B 和 1.7B 都是「小模型」,别指望它能跟动辄几千亿参数的云端大模型正面硬刚。写复杂代码、做高难度推理,它不如大的;但读长文档、整理资料、跑在断网环境里,是它的主场。
- 在自己电脑上跑需要一定硬件。1.7B 相对轻,普通笔记本能扛;4B 建议有独立显卡或者内存大一些的机器,纯 CPU 跑会比较慢。
- 100 万 Token 是「能装下」,不等于「装满了还好用」。塞得越满,响应越慢,实际用的时候按需要给就行,不用次次都塞满。
- 模型是开源免费,但你的电费和显卡是自己的。
💬 说说你的看法