跳到正文

全部动态

今日 46 条
8月25日周二
8月24日周一
  1. Meituan LongCat65

    美团 LongCat 官方宣布 LongCat-2.0 已上线 opencode 的 Go,邀请用户试用并反馈用其构建了什么。引用内容显示 LongCat-2.0 为 1.6T/48B 参数、支持 1M 上下文、完全开源。

    引用OpenCode@opencode

    LongCat-2.0 now available in Go 1.6T/48B · 1M context · fully open source

    推荐理由:LongCat 官方宣布模型接入 opencode,读者可以了解该开源模型在编码工具中的可用入口。

8月22日周六
8月21日周五
  1. Hugging Face:Blog(RSS)66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2 倍

    Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,采用推测解码,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍,输出质量不变。

    推荐理由:原文给出各模型在 GPU 和端侧的实测加速数据与 llama.cpp、SGLang 接入命令,读者可直接评估是否用于部署。

8月19日周三
8月17日周一
8月14日周五
  1. Demis Hassabis70

    Gemini 3.7 Flash 发布,Demis Hassabis 称其在软件工程、Web 开发和知识工作方面有重大升级。introductory 定价为原 3.6 Flash 价格的一半,现可开始使用。

    引用Google DeepMind@GoogleDeepMind

    Gemini 3.7 Flash is here. It’s stronger for coding, knowledge work, and web development. 🧵

    推荐理由:DeepMind 官方宣布 Gemini 3.7 Flash 发布,写明了能力方向和半价定价,读者可据此评估是否替换现有模型。

8月13日周四
8月12日周三
  1. Michael Truell61

    Grok 4.6 发布,官方称具备前沿智能,同价位下较 Grok 4.5 显著提升。作者补充称 4.6 在困难任务和知识工作上明显更强,结合了 Opus 级智能与打磨度,同时保持低成本和高速度,Grok 正逐步成为更能干的数字同事。

    引用SpaceXAI@SpaceXAI

    Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.

    推荐理由:转发并补充了 Grok 4.6 在难度任务和知识工作上更强、兼顾低成本低速度的定位,可作了解该版本能力方向的参考。

8月11日周二
  1. Jensen Huang57

    NVIDIA 发布 Nemotron 3.5 Lightning,一个开放权重的 30B MoE 模型,活跃参数 3B,面向持续运行、高吞吐的智能体任务。官方称其输出速度可达同规模模型的 4 倍。Jensen Huang 转发该发布并称其 smart、fast、efficient and open。

    引用NVIDIA AI@NVIDIAAI

    Introducing NVIDIA Nemotron 3.5 Lightning⚡ An open 30B MoE model with 3B active parameters, built for always-on agents to complete high-volume, specialized tasks faster. It delivers up to 4x the output speed of similar-sized models.

8月10日周一
8月7日周五
8月6日周四
8月4日周二
  1. Mistral AI:News(网页)62

    Mistral 发布 3B 开源多模态安全分类器 Shieldstral,Apache 2.0 开放权重

    Mistral 发布 Shieldstral,一个 3B 开源权重多模态安全分类器,将内容审核建模为策略自适应的问答任务,在推理时接受自然语言策略,无需重训即可适配文本与图像审核。它以 Apache 2.0 协议开放权重,在文本安全上匹敌最大 7 倍于其体积的开放审核模型,可在单张 16GB NVIDIA GPU 上运行,并输出经校准的连续安全分数。

    推荐理由:原文说明了将审核策略写成自然语言问题即可在推理时切换的机制,读者可据此评估它替代固定分类审核模型的可行性。

  2. Microsoft Research 博客(RSS)75

    Microsoft Research 开源 Orchard 智能体框架并发布三个领域模型

    Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 内直接训练智能体。

    推荐理由:官方开源了环境服务和三条训练配方,小参数量模型在 SWE-bench Verified 等基准上的具体结果可直接对照复用。

8月2日周日
7月31日周五
  1. Mark Chen81

    OpenAI 宣布 GPT-5.6 系列降价与功能更新:GPT-5.6 Luna 输入价格降至 $0.20 per million tokens、输出 $1.20,降幅 80%;GPT-5.6 Terra 降价 20% 至 $2/$12;GPT-5.6 Sol 在 API 中新增 Fast mode,速度最高提升 2.5x,价格为 2 倍,智能水平不变。Mark Chen 评论称这是迈向"便宜到无需计量"的智能的又一步。

    引用Sam Altman@sama

    major price cuts today: *80% drop for GPT-5.6 Luna, now $0.20 per million input tokens and $1.20 per million output *20% drop for GPT-5.6 Terra, to $2/$12 *GPT-5.6 Sol gets Fast mode in the API, up to 2.5x the speed for 2x the price, same intelligence

    推荐理由:OpenAI 首席研究官转述官方降价信息,读者可以据此更新 GPT-5.6 系列的 API 用量成本。

  2. Mira Murati64

    Thinking Machines 发布 Inkling-Small,性能与 Inkling 相当而体积仅为其四分之一,总参数 276B、激活参数 12B,完整权重已开放。可在 Tinker 上微调,或在 Tinker Playground 以文本、图像和音频方式与它对话。

    引用Thinking Machines@thinkymachines

    Today, we are releasing Inkling-Small. Inkling-Small achieves comparable performance to Inkling at a quarter of its size. It features 276B total parameters, 12B active. We are making the full weights available. https://thinkingmachines.ai/news/inkling-small/ Fine-tune it on Tinker today, or chat with it in text, image, and audio on Tinker Playground.

7月30日周四
  1. Google DeepMind:Blog(RSS)69

    Google DeepMind 发布 Gemini Robotics ER 2,强化视频理解、任务编排与多机器人协作

    Google DeepMind 发布 Gemini Robotics ER 2,面向机器人的具身推理模型,支持视频理解、任务进度跟踪、工具编排与多机器人协作,并可将执行交给下层 VLA 模型。

    推荐理由:官方发布给出进度分类、moment finding 等具体数字和公开 API 入口,读者可以据此评估其机器人编排与视频理解能力。

7月28日周二
7月27日周一
7月25日周六
  1. Midjourney:Updates(RSS)47

    Midjourney 发布 V8.2 图像模型

    Midjourney 推出 V8.2 图像模型,本次更新聚焦美学、图像质量与个性化。官方称图像将更具创意、大胆、精致、前卫和新颖,低质量图像的随机情况应会大幅减少。V8.2 的个性化档案拥有更大且更优的图像池,能更好理解用户个人品味,尤其适合在个人档案下积累了大量评分的用户。

7月21日周二
7月19日周日
7月17日周五
  1. Google DeepMind:Blog(RSS)61

    Google DeepMind 发布网络安全模型 Gemini 3.5 Flash Cyber

    Google DeepMind 发布基于 3.5 Flash 微调的轻量网络安全模型 Gemini 3.5 Flash Cyber,用于快速发现、验证并修复漏洞,将通过限access试点先面向政府和可信伙伴经 CodeMender 开放。

    推荐理由:以轻量模型多次调用替代单次大模型调用做漏洞挖掘,并用 Chrome 真实流水线等无污染基准展示对比结果,方法与数据都可参考。