Meta 的 SAM 3 与 DINOv3 支撑 Genesis Mission 首批 SYNAPS-I 科学成像项目
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
Meta 介绍其开源模型 Segment Anything Model 3(SAM 3)和 DINOv3 成为由能源部 Genesis Mission 旗下 SYNAPS-I 项目分割管线的核心。
SGLang、Qwen 和 NVIDIA 团队在 SGLang 中实现了 NVFP4 KV cache,将 K/V 以 4 位 NVFP4 格式存储并在 decode 阶段于注意力 kernel 内即时反量化到 FP8。
Meta 的 DINOv3 与 SAM 正被匹兹堡大学 RAMMP 项目用于辅助机器人,在电池供电的边缘设备上实现实时环境感知。RAMMP 的感知系统基于 RF-DETR,并用 DINOv2 嵌入微调、由 SAM 自动标注训练数据,实现 360 度环境感知与自适应物体检测。团队已把基于 DINO 的图像传感器查询功能集成进首个原型,可检测自动门按钮、杯子和路缘,目前正转向语音与触控输入。
SGLang 团队介绍用 /v1/score 接口为 JEV 类决策模型做标签打分,调用方通过 label_token_ids 显式指定标签,无需依赖生成结果的 top-k logprobs。
Meta Superintelligence Labs 发布 Muse Spark 1.1,一个面向智能体任务的多模态推理模型,在工具与计算机使用、编码和多模态理解上较 Muse Spark 有明显提升,支持 100 万 token 上下文管理和多智能体编排。
Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,已上架 Hugging Face。相比 LFM2-VL-3B,屏幕理解、函数调用、grounding 和多图输入显著提升,ScreenSpot-v2 达 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。
Liquid AI 发布 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 的 4-bit Q4_0 检查点,采用量化感知蒸馏(QAD)训练,四款模型均保留约 97% 的 BF16 平均性能。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三个模型发布 DSpot 草稿模型权重,通过投机解码在不改变输出质量的前提下大幅提升解码速度,草稿模型约为 3 亿参数。
Liquid AI 发布面向视觉语言模型 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,以约 280M 参数(增加 8.9% 内存占用)换取更快解码,GPU 解码吞吐最高提升 2.66 倍、边缘设备最高 3.13 倍,端到端分别最高 2.27 倍和 2.62 倍。
Liquid AI 推出 LongevityBench,一个覆盖五个生物数据领域的 17 项任务开放基准,并用它评估了来自六个开发团队的 18 个前沿 AI 系统。同期研究还包括 In-Place Tokenizer Expansion,可在不损失质量的前提下将非英文 token 数量最多减少 4 倍。
Liquid AI 的 Liquid Foundation Models(LFMs)主打在真实约束下运行,可在 GPU、CPU、NPU 上无缝部署于可穿戴设备、机器人、手机、笔记本、汽车等终端。每个 LFM 均可免费下载、运行和微调(含商用),直到公司年收入超过 $10M。模型面向毫秒级延迟、端侧韧性与数据隐私设计,支持本地、云端及混合 AI 部署。
来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。
Z.AI 发布面向智能体工程的新模型 GLM-5.3,沿用与 GLM-5.2 相同的 744B-A40B MoE 底座,能力提升全部来自在更多样真实任务环境上的规模化后训练。
智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。
Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Baseten Base Labs 推出 Inkling 模型,API 中模型标识为 inferact/inkling-nvfp4,返回结果包含 reasoning_content 字段,可输出推理过程。示例请求中 prompt_tokens 为 9、completion_tokens 为 295,其中 reasoning_tokens 占 182。
DeepSeek 发布 DeepSeek-V4.1-Flash,一个 552B 参数的多模态 MoE 模型,prefill 激活 8B、解码激活 16B,支持 1M token 上下文,采用 Causal Encoder-Decoder 架构与 Compressed Sparse Attention 2。
Baseten 的部署(deployment)是模型在平台上运行的一个版本,拥有独立 API endpoint,每次 baseten model push 都会创建一个部署,同一模型可同时运行多个部署以便在不影响生产流量的情况下测试新版本。
斯坦福大学发布 2026 AI Index 报告,总结出 12 项关键发现,指出 AI 领域在取得突破性能力的同时,也引发了对环境成本、透明度以及技术受益群体的紧迫疑问。斯坦福自 1963 年由 AI 奠基人 John McCarthy 创立人工智能实验室以来,持续支持 AI 科研、应用探索与公共政策制定。
Goodfire 面向学术与安全实验室开放 Silico 研究访问,价格为每月 1000 美元,企业访问需另行申请演示。团队正分批邀请研究人员,并将通过邮件跟进;研究人员可在其页面查看已有研究案例。
Goodfire Research 正在招聘认同可解释性研究价值的人才,共同构建 AI 的未来。所有岗位均为全职,需每周五天到旧金山 Telegraph Hill 办公室现场办公。招聘面向有智能体思维、使命感强且友善的候选人。
Goodfire 是一家 AI 可解释性研究实验室,构建可解释性智能体与基础设施,用于理解、监控并对齐 AI 模型。该实验室由曾在 OpenAI 和 Google DeepMind 推动可解释性领域研究的研究者创立,总部位于旧金山,已从 Menlo、Lightspeed 和 B Capital 等投资方融资超 $200M。
Goodfire Research 为 Silico 推出企业版定价,面向规模化部署 AI 研究的团队。企业版在 Academic & Safety 版基础上增加专属研究员支持、组织级计费与席位管理,并提供 Zero Data Retention 选项。
Goodfire Research 发布 Silico,一款用于机器人与视觉基础模型的物理 AI 研究工具,可在生成任何一帧前直接从潜空间验证模型是否学到真实物理结构。
Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。
Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。
Goodfire Research 发布可解释性智能体 Silico,可围绕研究目标自主制定实验计划、并行运行并监控进度,支持任意规模模型。它集成 auto-interp、探针与 SAE 训练、模型对比、因果分析、数据归因、神经几何和激活 verbalizer 等可解释性方法与库,用于解释模型行为、调试回归问题、构建多阶段护栏以及复现对齐研究。Silico 已提供 macOS 版本下载。
Fireworks AI 基于 DeepSWE v1.1 的 113 个任务分析称,按任务选模型的 oracle 路由在 18 个模型上可达 97.6% 通过率、每任务 $1.88,比最佳单模型 GPT-6 Astra(74.1%、$6.52)高 23 分且成本不到三分之一;仅用开源权重模型也能达 90.3%、$1.45。
Fireworks AI 发布 Specialized Intelligence Index(SII),汇集开放、闭源和专用模型在医疗、法律、网络安全、金融、客服、生产力、软件七个领域的从业者设计基准上的表现。
Fireworks Research 发布专用模型 Ember-1,基于 Kimi K3 训练,在保持质量的同时减少约 35–50% 推理 token。团队做了 50 多次训练实验和 200 多次评估,在 Terminal Bench 2.1、SWE-bench Verified 等 7 个基准和两家客户生产流量的 A/B 测试中质量持平,每任务 token 约省 35%。
推荐理由:原文给出多组基准和生产 A/B 数据,读者可以据此评估用更低 token 成本跑 Kimi K3 级质量的可行路径。
Fireworks 发布 ARCv3 权重更新压缩器,在 1000 个生产 RL 权重更新 delta 上,BF16 权重载荷比 ARCv2 缩小近 50%,平均 delta 约为原始 BF16 权重的 0.19%,低于 ARCv2 的 0.36%,且可无损还原训练器的精确 BF16 权重。
Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。
Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。
推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。
NVIDIA 为 ROS 2 Lyrical 贡献了 CUDA buffer backend,配合 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时以零拷贝方式交换 GPU 常驻数据,否则自动回退 CPU 路径。
NVIDIA 用机密计算(CC)在 Blackwell GPU 上跑生产级 LLM 推理,TensorRT LLM 通过 CC 感知优化把吞吐保留在基线的 96.1%–98.2%,平均 TPOT 开销仅 1.2%–4.3%。测试基于单台 DGX B200(8 张 B200)、DeepSeek-R1-0528-NVFP4、32K 输入/1K 输出、TP=8,并发 1–16。
NVIDIA 联合 SGLang 团队推出 SWE-Serve 基准,从 83 个已合并的 SGLang pull request 中构建 53 个可执行任务,用于评估智能体对推理服务软件仓库级改动的真实效果。
Cursor 宣布 Firetiger 团队加入 Cursor。Firetiger 由 Rustam Lalkaka 和 Achille Roussel 于 2024 年创立,构建的智能体可在软件上线后监控发布、发现回归、调查事件并将发现反馈给编程智能体。
Cursor 官宣已被 SpaceX 正式收购,始于 4 月与 SpaceXAI 合作的收购流程正式完成。Cursor 表示将使用全球最大的 GPU 集群,以更低成本构建和提供能力更强的模型,并提及周三发布的 Grok 4.6 初步展示了合作成果;Cursor 将继续帮助用户少写代码、专注于更有挑战性的问题。
推荐理由:收购方官方亲述交易完成与后续算力、模型计划,读者可借此了解 Cursor 未来产品与成本走向。
Cursor 工程师 Vicent Martí 撰文介绍其 Git 存储系统 Continuity:以 S3 中兼容对象存储的预写日志(WAL)作为唯一事实来源,本地副本为 NVMe 上的普通 Git 仓库,通过 S3 CAS 与 UDP gossip 实现乐观复制,无需路由表和共识选举,所有 push 线性化且完全持久化前不确认。
Cursor 发布云端智能体自托管机器功能,工具执行可迁移到团队自管的基础设施,智能体循环、推理和规划仍留在 Cursor 云端。
推荐理由:原文给出了自托管机器的适用场景、worker 机制和沙箱合作生态,读者可以据此判断是否把智能体执行迁回自有环境。