Cohere Labs 发布 Embed 5 系列嵌入模型,含 Pro 与 Fast 两档
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
Cohere 发布 Embed 5 系列嵌入模型,含 Embed 5 Pro 和 Embed 5 Fast 两档,均支持 128K token 上下文、100+ 语言、文本与图像输入和共享嵌入空间,定价分别为每百万 token $0.12 和 $0.08。
OpenBMB 发布 2.6B 参数稠密推理模型 MiniCPM5-2B,以 Apache 2.0 协议开放权重,在 Artificial Analysis Intelligence Index v4.2 得分 15,为 4B 以下总参数开源权重模型最高。
Artificial Analysis 发布 GPT-6 Astra 基准测试报告,该模型在 Intelligence Index 得 53 分、Coding Agent Index 得 62 分,均与 Claude Fable 5.1 并列第一,且成本分别约为其 40% 和 60%。
推荐理由:原文给出 GPT-6 Astra 在两大指数中的得分、成本和 token 效率数据,可据此比较它与 Claude Fable 5.1 的实际表现。
ARC Prize 用同一基线测试框架实测 OpenAI o1-preview 和 o1-mini:o1-preview 在 ARC-AGI 公开评测得 21.2%,与 Claude 3.5 Sonnet(21%)相当,但单任务平均耗时 4.2 分钟,约为 Sonnet 的 10 倍,400 道公开题共花 70 小时,而 GPT-4o 和 Sonnet 只需 30 分钟。
推荐理由:ARC Prize 用同一测试框架给出 o1 在 ARC-AGI-Pub 的基线分数和耗时对比,并分析了测试时计算扩展的效率问题。
OpenAI 新版 o3 在 ARC-AGI 半私评测集上以 1 万美元算力上限取得 75.7%,高算力(172 倍)配置得分 87.5%,成为公共榜首。
推荐理由:官方测试方披露了 o3 各算力档的得分与每任务成本,并给出对其程序搜索机制的独立分析。
ARC Prize Foundation 发布 o3 和 o4-mini 在 ARC-AGI 上的首次公开评测:o3-medium 在 ARC-AGI-1 Semi Private Eval 得 53%,o4-mini-medium 得 42%,两者在 ARC-AGI-2 上均低于 3%。
推荐理由:ARC Prize 官方实测给出了 o3 与 o4-mini 在 ARC-AGI 两代基准上的准确率、成本和 high 推理不完整覆盖的数据细节。
ARC Prize 发布 GPT-6 Astra 在 ARC-AGI-3 Semi-Private 上的评测结果:Standard harness 下得分 62.7%、成本 $26K,Provider Adapter harness 下得分 99.9%、成本 $19K,均为当时最佳成绩。
推荐理由:ARC Prize 官方实测数据完整,读者可以据此比较 GPT-6 Astra 在两种评测条件下的得分、成本与人类动作效率差异。
Anthropic 发布 Claude Haiku 4.5,称其是最快、最具性价比的模型,在编码、计算机使用和 Agent 任务上媲美 Sonnet 4,SWE-bench Verified 得分 73.3%。
推荐理由:官方给出性能、价格与可用渠道的关键数字,读者可据此评估它在低延迟和多智能体场景中的适用性。
Anthropic 发布 Claude Sonnet 5.5,比 Sonnet 5 运行快 30%,典型负载成本最多低 30%,定价为每百万输入 token $2、输出 token $10,支持 1M 上下文窗口,可通过 Claude API、AWS、Google Cloud 和 Microsoft Foundry 使用。
推荐理由:官方页面给出价格、token 用量与多客户评测数据,读者可以据此评估它在成本与性能间的取舍。
Anthropic 发布 Claude Opus 5.5,面向高强度编码和 AI 智能体的混合推理模型,具备 1M 上下文窗口,典型工作负载运行成本比 Opus 5 低约 40%。
推荐理由:官方给出了定价、token 成本与多个客户实测数字,可帮助开发者评估升级到新 Opus 的成本与效率收益。
Anthropic 发布 Claude Fable 5.1,定位为其最强编码与知识工作模型,面向 Pro、Max、Team、Enterprise 用户及 Claude Platform、AWS、Google Cloud、Microsoft Foundry。
推荐理由:官方页面给出定价、缓存降价、回退机制和客户实测引用,读者可以据此评估长时智能体与编码工作流的成本收益。
Anthropic 发布 Claude Mythos 5.1,是其面向网络安全和生物学研究的最强模型,目前仅向少量经审核的组织开放,定价为每百万输入 token $10、每百万输出 token $50。同底座的 Claude Fable 5.1 提供带护栏版本,生物护栏对良性请求的干预比 Fable 5 减少 85%,使用 Mythos 5.1 默认需接受 30 天数据保留政策。
推荐理由:原文给出 Mythos 5.1 的受限开放方式、定价与 Fable 5.1 的护栏细节,读者可以据此了解高风险能力如何被分层开放。
Introducing Cohere Embed 5: our new state-of-the-art family of embeddings models. Get frontier capabilities with Embed 5 Pro or low-latency performance with Embed 5 Fast.
Zyphra Research 公布其下一代基础模型系列,涵盖语言、音频、思维与视觉四个方向。语言模型为 ZAYA,音频模型为 ZONOS,思维模型为 ZUNA,视觉模型为 ZAYA-VL。相关模型在其云平台上提供。
Preferred Networks(PFN)从零自研的日本大语言模型 PLaMo,主打日语理解与生成能力,旗舰版 PLaMo Prime 以紧凑模型规模提供世界级日语性能,可通过云端 PLaMo API(付费)和 PLaMo Chat 使用,并借 Amazon Bedrock Marketplace 支持本地部署。
World Labs 发布实时生成世界模型 RTFM(Real-Time Frame Model),可在用户交互时实时生成视频,现已以研究预览形式开放浏览器演示。RTFM 在单张 H100 GPU 上以交互帧率运行推理,不依赖显式 3D 表示,作为端到端训练的学习式渲染器工作;它将带位姿的帧作为空间记忆并通过 context juggling 检索邻近帧,使世界在长时间交互中持续存在而不丢失。
月之暗面(Moonshot AI)的 Kimi K3 模型以 moonshotai/Kimi-K3 标识出现在一份 API 响应示例中,该响应返回了 chat.completion 对象。示例显示其 usage 包含 189 个 prompt_tokens、82 个 completion_tokens,其中多模态图像 token 为 96。
GLM-5.3-Flash 出现在 Baseten Base Labs 的模型研究内容中,原始标题仅给出该模型名称,正文为一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。
Z.AI 发布 GLM-5.3,定位智能体工程,与 GLM-5.2 使用相同的 744B-A40B MoE 底座,全部能力提升来自在更多样真实任务环境(完整代码库、文档、测试工具、多步工作流)上的规模化后训练。
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 家族首个实验性多模态模型,在 DeepSeek-V4-Flash 架构上加入视觉模块并继续训练以获得视觉理解能力。
Baseten Base Labs 模型研究页面展示了 DeepSeek V3.1(模型标识 deepseek-ai/DeepSeek-V3-1-0819)的一次文本补全调用,输入 14 个 prompt token,输出 226 个 completion token,共 240 token,内容为 FizzBuzz 编程题解答,finish_reason 为 stop。
Baseten Base Labs 模型研究页面出现名为 DeepSeek V4 Pro 的条目,但正文仅有一段 chat.completion 格式的 API 返回示例,model 字段为空,未披露任何模型参数、benchmark 分数或可用性信息。
Baseten 上线 DeepSeek V4 Pro 0813,一个 1.7T 参数的前沿开放权重模型。它可与较小的 V4 Flash 0731 搭配用于 coding agent,由 Pro 驱动主 agent、Flash 运行子 agent,使整个编码栈跑在开放权重模型上。
Baseten 旗下 Base Labs 推出嵌入模型 Zembed 1,模型标识为 zembed-1,通过 API 返回 embedding 对象列表。该接口按 prompt_tokens 计费,示例请求消耗 37 个 token。
BAAI/bge-en-icl 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型量化至 FP8 部署,由 Nvidia 最新 GPU(如 H100、H100_40GB 或 L4)支持,量化可选但能带来更高效率。
Nomic Embed Code 的示例响应显示,其返回的 embedding 向量为单元素数组,model 字段标注为 thenlper/gte-base,usage 中 prompt_tokens 与 total_tokens 均为 512。
EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。
Every 发布对 GPT-6 Astra 的 Vibe Check 评测,认为它是大幅升级,写作、软件操作和视觉设计表现令人印象深刻,但也存在一些坏习惯。
TypeSafe 发布新模型 Jev,可将自然语言问题直接输出为 0 到 1 的概率或自定义类别,供代码直接调用。它原生支持结构化输出,无需像 DSPy 那样额外引导 LLM,因此速度极快、成本极低,适合在后台为 AI 智能体做实时判定。其实际效果目前仍待验证。
OpenAI 的 GPT-6 Sol 与 Anthropic 的 Claude Opus 5.5 同日发布,Every 基于日常工作的实测与评测对两者做了对比,结论是存在一个明确的取舍。该对比旨在回答该用 Sol 6 还是 Opus 5.5 的问题,完整内容需订阅阅读。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
CAMB.AI 推出前沿文本转语音模型 MARS6,支持 10 种语言的音色与韵律克隆,需商业授权方可使用。模型至少需要文本、参考音频、参考文本和目标语言四项输入,输出默认采用 ADTS AAC 流式响应,也可配置为 flac 流式或返回 base64 编码的 flac 文件。
哔哩哔哩 Index LLM 团队发布基于 Qwen3.5 的 Index-Translate 多语言翻译模型家族,2B / 9B / 35B-A3B(preview)权重已在 Hugging Face 与 ModelScope 开放。
xAI 发布 Grok Voice Transcribe 2.0,官方称其为当前最准确的转录模型之一,准确率是 1.0 的两倍且价格不变,在 Artificial Analysis 排行榜 32 个流式模型中准确率第一。
World Labs 发布下一代世界模型 Atlas,一个从零预训练的全能模型,可原生处理文本、图像、视频和 3D。
Sarvam AI 于 2026 年 3 月 6 日开源 Sarvam 30B 和 Sarvam 105B 两个从零训练的 MoE 推理模型,训练完全在 IndiaAI 任务的算力上于印度完成,权重可从 AI Kosh 和 Hugging Face 下载。
推荐理由:官方发布开源推理模型,给出完整训练与推理细节和基准对比,可了解印度本土全栈模型的做法。
Sarvam AI 发布语音识别模型 Saaras V4,采用音频编码器加 3B 混合状态空间 LLM 解码器的架构,解码器完全从零自研训练。
Sarvam AI 发布 Sarvam Vision 2.1,在 olmOCR-Bench(87.3)与自研 Indic OCR Bench(总体准确率 87.39)上取得领先成绩。
MiniMax 正式开源下一代通用视频模型 MiniMax H3,支持文本、图像、视频、音频的多模态统一理解,可生成最长 15 秒、768p(经 H3-Regenerate-2K 可达 2K)、24 FPS 并带 32 kHz 立体声音频的视频。
推荐理由:官方开源公告给出了完整的三模块系统结构、模型规格和本地部署方式,读者可以据此评估在自己的视频生成流程中如何接入。
千问(Qwen)团队开源 Qwen3.8-Flash-Next,一个多模态 MoE 模型,被视为 Qwen4 架构的早期预览。模型总参数 125B 加 51B N-gram Embedding,每 token 激活 6B,48 层中含 36 层 GDN 线性注意力和 12 层 QSA 稀疏注意力,MoE 使用 512 专家 top-10 路由。
推荐理由:原文给出该模型混合架构细节和 SGLang 的 day-0 推理支持数据,读者可以据此评估长上下文部署的实际收益。