Liquid AI 发布 LFM2.5-Encoder-230M 与 350M 双向编码器,长上下文 CPU 推理提速
Liquid AI 发布基于 LFM2 混合架构的双向编码器 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,支持 8,192 token 上下文,面向分类、自然语言理解和 token 级任务微调,模型已上线 Hugging Face。
Liquid AI 发布基于 LFM2 混合架构的双向编码器 LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M,支持 8,192 token 上下文,面向分类、自然语言理解和 token 级任务微调,模型已上线 Hugging Face。
Liquid AI 发布 LFM2.5-2.6B,一个可完全在设备端运行的 2.6B 参数智能体模型,Base 与后训练版本已在 Hugging Face 开放。
推荐理由:原文给出完整的四阶段后训练流程、多基准对比和 CPU 与手机端实测速度,读者可据此评估它对端侧 Agent 部署的适配度。
Instagram 宣布其独立 Edits 应用新增 AI 创作助手,可调取用户账号的点赞、观看、留存和分享等数据,回答热门趋势、内容表现差异等问题,并给出选题、脚本、文案、音频等方面的建议。
据 The Information 报道,Google 启动试点计划,按内容对 AI Overviews、AI Mode 和 Gemini 的贡献程度向出版商付费,约 100 家出版商参与。一位早期加入的出版商一年获得超过 100 万美元,另一位加入数月的获得约 5 万至 6 万美元。该计划推出之际,Google 正面临出版商诉讼及英国和欧盟监管机构对其 AI 搜索影响流量的审查。
Meta 发布 Muse AI 智能体,宣称可帮用户处理邮件、在线购物等任务,用户需交出数据甚至信用卡才能使用。此后 Meta 宣布了类似电子宠物的 Muse Charm 配件、面向企业的 Muse Enterprise Platform、Mac 应用和智能眼镜支持,并修补了一个可让攻击者控制该智能体的漏洞;Amazon 屏蔽了 Muse 智能体。
Goodfire AI 发布 Silico 平台使用条款,界定客户访问和使用其 AI/ML 模型理解、测试、评估、改进、引导、监控与对齐平台的权利义务。条款明确 Customer Materials、Goodfire IP、Usage Data、Workflow Data 等定义,并授予客户非独占、不可转让的内部业务使用权。
柏林初创公司 Restate 获 2000 万美元 A 轮融资,由 Singular 领投,Redpoint Ventures 和 Capital One Ventures 参投。
Goodfire Research 为 Silico 推出企业版,团队可在前沿基础设施与算力上运行长周期、异步实验。页面提供演示申请入口,提交后团队会通过邮件跟进是否符合合作条件,同时可查看研究人员在 Silico 上运行的项目。
Cerebras Systems CEO 兼联合创始人 Andrew Feldman 将在 TechCrunch Disrupt 2026 的 Disrupt Stage 发表“Can AI Keep Scaling?
斯坦福 HAI 隐私与数据政策研究员 Jennifer King 建议 AI 聊天机器人用户谨慎分享信息,具体做法包括:上传医疗等敏感文件前先隐去全部个人信息、使用临时对话、在可选情况下关闭数据用于训练、定期查看政策更新以调整设置。
斯坦福 HAI 发布政策简报,探讨为何治理世界模型是比大语言模型更复杂的政策挑战。简报将世界模型分为渲染器、模拟器和规划器三类,指出其带来物理风险、国家安全影响和数据集中问题;李飞飞等人建议资助测量科学、以采购要求独立测试、投资共享数据基础设施,并强调当前没有基准足以支持安全关键部署审批。
斯坦福 HAI 发文梳理 AI 加速科学发现的进展:Brian Hie 团队打造的 Evo 2 是迄今最大的生物学 DNA 语言模型,基于 9 万亿碱基对、400 亿参数训练,可像聊天机器人一样补全基因序列。Emma Lundberg 团队则正构建模拟人类细胞的基础模型,用于加速药物发现与个性化医疗,并为此开发了 Biomni 供生物学家交互分析数据。
斯坦福 Marlowe 超算配备 248 块 NVIDIA H100 GPU、31 个计算节点,横跨全部七所学院服务 190 多个研究组,30 天平均分配率 95%,累计交付 315 万 GPU-hours。
论文提出 SynthIDBio,一组可将可检测且不损害功能的水印嵌入 AI 生成蛋白序列与结构的方法。
针对棋盘战争游戏 Stratego 设计的 AI 系统 Ataraxos,为强化学习与搜索在不完全信息下的结合建立了一套有效设计模式。该成果发表于 Nature,指向战略决策领域长期追求的目标:在大量隐藏信息条件下仍能实现可扩展的决策。
一项覆盖 28,279 人的多祖先全基因组关联研究(GWAS)发现 BACH2 是胎儿血红蛋白(HbF)表达的调控因子,其通过抑制 NRF2 介导的 γ-珠蛋白基因转录激活来发挥作用。
该页面为 Nature 的 404 错误页,所请求内容不可用,无法获取关于 X-ray liquidography 解析偶氮苯异构化复杂运动的正文信息。页面仅提示链接可能失效或已不存在,未提供该研究的任何方法、数据或结论。
科学文献中正出现名为 Elena、Aris、Marcus 的 AI 生成“幽灵”作者,污染学术记录。Nature 报道指出,这类虚构署名正在侵入科研出版体系。
Fireworks 发布 FireRouter with Opus,将常规轮次路由到开源模型、仅在需要的轮次保留 Claude Opus 5.5,单次会话成本降低 57%,并支持缓存感知路由。
Trilogy AI Center of Excellence 围绕 Fireworks 上的 Kimi K3 发布公开 AI 网络安全手册与练习包,包含交互式手册、仓库和十个针对本地训练应用的练习。
Fireworks 宣布 Kimi K3 支持其 Serverless Training 的 Multi-LoRA 服务与训练,进入私测阶段。K3 是总参数约 2.8T 的 MoE 模型,原文称其为首个达到 3T 规模的开源权重模型。
月之暗面的 Kimi K3 以开源权重发布,共 2.8T 总参数、104B 激活参数、896 专家、1M 上下文,并在 Fireworks 上线 Day-0 推理与训练。
推荐理由:原文汇总了 K3 的参数规格、多项第三方基准成绩和与 Opus 5 的成本对比,读者可据此评估开源模型在自有工作流中的可行性。
Fireworks AI 发布低成本嵌入模型微调方法,用 InfoNCE 对比学习在平台上微调 Qwen3-Embedding-8B,成本不到 $10、约 150 步。
推荐理由:原文给出用 Qwen3-Embedding-8B 做对比微调的完整配方和三个真实检索任务的实测数据,还总结了哪些场景不会有效。
Fireworks AI 在 Qwen3.5-9B 上用 Placement、寄存器分配和 Nexa VM 三个可自动验证任务做对照实验,提出在把 LoRA 换成 FullFT 前先依次测试数据覆盖、学习率等训练配方和 adapter rank。实验显示单任务场景下调数据或配方基本消除 FullFT 优势,固定预算混合任务中 FullFT 仍领先 4.29 个百分点,并将进一步发布后续实验。
Fireworks 成为 Voyage AI by MongoDB 首个且唯一合作的专用推理平台,Voyage 4 系列、voyage-multimodal-3.5 与 rerank-2.5 现已原生运行于 Fireworks,检索到生成全流程可在同一 API 上完成。
Meta 发布 Muse Glimmer 30B 开源模型(Apache 2.0),并已在 Fireworks 提供 serverless 和按需部署。
推荐理由:原文给出 Muse Glimmer 的架构细节、基准对比和推荐参数,读者可据此评估它是否适合长期运行的多轮 Agent 工作流。
Fireworks AI 在 Kimi K3 和 Qwen3.5-9B 上复现了 Anthropic 提出的 Jacobian Lens(J-Lens),用拟合探针读取模型各层隐藏状态,在输出 token 之前就恢复出与最终答案相关的词汇,称为静默信号。
Harvey 发布首个模型 Tenet,基于 Kimi K3 用 Fireworks Training API 的异步强化学习后训练,面向长周期法律工作。
Fireworks AI 用 CyberGym 测评 DeepSeek V4 Pro 0813、Kimi K3、GPT-5.5 和 Claude Opus 4.8,V4 Pro 在 840 个对抗性安全任务中零拒绝、全部产生原生工具调用,进入验证率 97.3%。
Fireworks AI 发布对 DeepSeek V4 Pro 0813 的评测,SWE-Bench Verified 得 95.2%(Fable 5 为 85.4%),SWE-bench 单任务成本 $0.309 对 Fable 5 的 $0.808。
推荐理由:Fireworks 用自家同一套评测对比 DeepSeek V4 Pro 与 Fable 5,给出单模型与 oracle 路由的成本和准确率数据,可作选型参考。
Fireworks AI 宣布 Training API 正式可用,并推出 Fireworks Lab 服务。
Fireworks AI 发文梳理企业迈向专业化智能的三阶段路径:先租用闭源前沿模型并围绕其搭建提示词、上下文与 harness 工程,再引入更便宜的开源模型优化成本与延迟,最终为真正属于自己的问题训练定制模型。文中以 Kimi K3 与 GPT 5.6 Sol 在 OSWorld 2.0、UIPad 上的对比为例,说明基准只能用于初筛,自建评测才是性能的最佳指标。
Genspark 与 Fireworks Lab 合作,将开放权重多模态模型 MiniMax M3 后训练为 Gen-1 Slides,可端到端规划、撰写并自查幻灯片。
Fireworks 上线 DeepSeek-V4.1-Flash,在 DeepSWE 上以 74.34% 的 Pass@1 达到 GPT-6 Astra 水平,每任务成本 $0.43,约为 Astra 的 1/15。
推荐理由:原文给出 DeepSWE、Terminal-Bench 2.1 和 HLE 的具体成本与准确率数据,可帮助开发者评估智能体编码工作流的模型选型。
Phylo 在 Fireworks 上部署开源权重模型,实现月环比用户增长 2 倍、成本降低 60%,大部分流量已转向开源模型,首 token 时间约减半。其 Biomni Lab 是首个集成生物学环境,智能体单次任务可运行数小时至数天、调用数百次工具,新开源模型可在 24 小时内上线生产。
Cursor 团队分享为云端智能体搭建开发环境的经验,核心思路是把开发环境当作用户是智能体的产品来做。他们让云端 VM 与本地开发环境对齐,构建 anydev CLI 简化智能体运行服务的流程,并通过 Cursor Cloud MCP 和 Cloud Doctor 自动化功能实现环境的自愈与持续改善。
推荐理由:Cursor 团队分享了自家云端智能体环境的搭建经验,包含 anydev CLI、Cursor Cloud MCP 等做法和可迁移的判断标准。
Cursor 团队与 SpaceXAI 今日联合发布 Grok 4.6,基于 Grok 4.5 打造,专注于长时间运行的智能体、更复杂的交互与视觉工作。在 Artificial Analysis Intelligence Index 上它与 GPT-5.6 Sol 持平(61 分),训练上进行了更长时间的补充训练、重新生成的 SFT 轨迹和广泛的智能体 RL。
推荐理由:原文给出训练方法、基准分数和定价细节,读者可以据此评估它在智能体编程场景中的定位。
Cursor 推出构建功能,在后台预先准备可直接使用的开发环境副本,智能体启动即可运行,无需额外费用。默认每小时创建一次新构建,环境损坏时智能体沿用上一次成功构建;Cursor 内部环境启动速度提升 10 倍、首个 token 生成速度提升 3 倍。8 月 17 日起所有新建和现有环境将默认启用构建。
推荐理由:官方原文给出启动速度倍数、构建频率和失败回退机制,读者可据此评估其对云端智能体工作流的影响。
Cursor 宣布通过 AIUC-1 智能体安全、安全性和可靠性认证,认证由 Schellman 开展独立审计,并在数千个场景中对智能体进行对抗性测试,覆盖 IDE 和云端智能体的规则、钩子和 Auto-review 等防护措施。
Epoch AI 的 FrontierMath 是一个由数百道未公开、高难度数学题组成的基准,分为 Tiers 1–4 四个难度层级。Tiers 1–3 覆盖从本科到适合高年级研究生的探索性问题,Tier 4 则是研究级数学。