产品简介
AstaBrief 是 Ai2 于 2026 年 10 月 2 日开源的 80 亿参数科学报告生成模型,从 Qwen3-8B 后训练而来,走的是 SFT 加 DPO 的路线,没有用强化学习。它做的事很聚焦:给一个研究问题和一批检索到的文献片段,一次性生成一份带引用的报告。
它已经在 Ai2 的 Asta 产品 Generate a report 功能里作为 Fast mode 上线,与 Claude 驱动的 Thinking mode 并列。快是它最直接的差异,AstaBrief 被训练成根据查询和检索片段一遍直接产出最终报告,绕过了 Thinking mode 里昂贵的片段摘要与聚类阶段,也不逐节生成。完整流程下平均每份报告 51.1 秒,Thinking mode 是 178.5 秒,快约 3.5 倍。
权重在 Hugging Face 的 allenai/AstaBrief_8B,训练数据也一并开放。官方博客没有写明具体的许可证名称,只说明是开放权重与开源。
核心功能
- 一次成稿的带引用报告:输入研究问题与检索到的文献片段,直接输出完整报告,不逐节生成;报告中的每条陈述都附带支持它的引用
- 作为 Fast mode 上线 Asta:在 Asta 的 Generate a report 功能中与 Claude 驱动的 Thinking mode 并列提供,平均每份报告 51.1 秒,Thinking mode 为 178.5 秒
- 权重与训练数据同时开放:模型权重在 Hugging Face 的
allenai/AstaBrief_8B,训练数据一并发布:SFT 约 47000 条样本、DPO 约 6000 条偏好样本 - 围绕引用质量的训练与过滤:用输出与输入 token 比、引用相关性、引用密度、引用多样性等指标过滤合成报告,其中过滤低引用密度的样本带来的提升最大
- 双 judge 一致的偏好数据:DPO 偏好对由 GPT-4.1 与 DeepSeek-R1 两个 judge 分别比较,只有两者一致才保留,与人类偏好一致率 95%
- 可自托管部署:开放权重允许机构把模型部署在自有基础设施里,包括防火墙之后,也可以用自有 PDF 走通生成报告的示例工作流
适合谁用
以下类型的用户会特别受益于 Ai2 AstaBrief 8B:
- 需要在防火墙内或自有基础设施上跑文献综述的机构与研究团队
- 想先拿到一份带引用的报告初稿、再由研究者迭代打磨的科研工作流
- 需要批量处理研究问题、对单份报告生成延迟敏感的文献调研
- 研究引用溯源与证据接地问题的团队,可以拿开放的训练数据做进一步工作
优点亮点
- 80 亿参数就能跑,单张专业级或消费级显卡可以承载
- 完整流程下报告生成约 51.1 秒,比 Claude 驱动的 Thinking mode 快约 3.5 倍
- 权重与训练数据都开放,既能自己部署也能拿去继续研究
- 训练数据来自 Asta 与 ScholarQA 的真实研究查询,过滤后得到 9 万条
- 14 个问题的小规模人类研究中,3 位研究者有 2 位在引用准确性上更偏好它
- 官方如实说明了训练与评测在 2025 年完成,未针对最新前沿模型重跑完整评测
价格与方案
模型权重与训练数据免费开放下载,官方博客未标注具体许可证名称。在 Ai2 的 Asta 产品里,它作为 Fast mode 与 Claude 驱动的 Thinking mode 并列提供,可通过 asta.allen.ai 直接使用。
总结与建议
AstaBrief 的价值不在于它比前沿大模型写得更好,官方自己的结论也只是说它在回答与引用质量的多个度量上与 Claude 驱动的流程和 DR Tulu 处在同一区间,14 个问题的小规模人类研究里整体偏好还是 DR Tulu 领先。它的价值在于把「生成一份带引用的报告」这件事的成本压下来:80 亿参数、51 秒、开放权重,你可以把它装进自己的机器里跑。
引用准确性是它真正站得住的地方,3 位研究者有 2 位在这一项上更偏好它。对一个只在文献综述环节做加速的工具来说,这个取舍是清楚的。要注意的是官方说明了训练和评测主要在 2025 年完成,没有针对当前最新的前沿模型重跑。
版本演进
- AstaBrief 8B 开源发布 (2026-10-02):Ai2 开源 80 亿参数科学报告生成模型 AstaBrief,基于 Qwen3-8B 经 SFT 与 DPO 后训练,把研究问题与检索到的文献片段一次性转成带引用的报告。已在 Asta 的 Generate a report 中作为 Fast mode 上线,平均每份报告 51.1 秒,Claude 驱动的 Thinking mode 为 178.5 秒。权重发布于 Hugging Face 的 allenai/AstaBrief_8B,训练数据同步开放,SFT 约 47000 条、DPO 约 6000 条偏好样本,其中 9 万条研究查询来自 Asta 与 ScholarQA 的真实用户日志