🔥社区从不停下折腾的脚步。 不只是基于 H3 做开发,还在不断深入内部,寻找让它更聪明的新方法。
流行のJevをMiniMax H3に組み込んで、動画生成を高速化してみた!Attention処理のスパース化にJevを使用。 ・層ごとにJevが重要度を判定(4step 49層が対象) ・Jevがスパース率1%, 3%, 5%, 10%を選択 RTX4070で6分7秒→3分34秒で41.7%短縮!動画生成中にJevクラウドに問合せしているのに速い!
🔥社区从不停下折腾的脚步。 不只是基于 H3 做开发,还在不断深入内部,寻找让它更聪明的新方法。
流行のJevをMiniMax H3に組み込んで、動画生成を高速化してみた!Attention処理のスパース化にJevを使用。 ・層ごとにJevが重要度を判定(4step 49層が対象) ・Jevがスパース率1%, 3%, 5%, 10%を選択 RTX4070で6分7秒→3分34秒で41.7%短縮!動画生成中にJevクラウドに問合せしているのに速い!
小米 MiMo 在 GitHub 开源 mimoagent,一个仅约 100 行代码的 AI 智能体,可解决 GitHub issue 或在命令行中辅助用户。项目主打极简设计,无需庞大配置和大型 monorepo,并在 SWE-bench Verified 上取得超过 74% 的分数。仓库地址:https://github.com/XiaomiMiMo/mimoagent
OpenAI Academy 新增面向员工、开发者、管理者、教育者和学生的学习路径,用于培养和展示实用 AI 技能。
小米 MiMo 在 GitHub 新建仓库 verl,其 HybridFlow 是一个灵活高效的强化学习后训练框架。该仓库定位为 RL post-training 框架,强调灵活性与效率,目前原文未披露参数规模、benchmark 分数或开源许可等细节。
V7 使用 GPT-5.6 Luna 将成本削减 78%,同时提升准确率。该方案利用 GPT-5.6 把分散的公司文件转化为智能体可用的上下文,以完成复杂的、带来源链接的工作。
vLLM 公布 Qwen3.8-2.4T 在 GB300 NVL72 集群上的 PD 分离部署结果:8K/1K 负载下高吞吐场景达每 GPU 5000 total token 吞吐,低延迟场景每用户 180 生成 token,并给出完整 pareto 前沿。
Hugging Face 发布 tokenizers v1,输出与 v0.23 完全一致的 token ID,但速度常达 v0.23 的数十倍。v1 将单个 crate 拆为 workspace,引入无分配合并、bitcannon SIMD 分片、侵入式双向链表合并循环、线程本地词缓存和原生多线程并行。
大体同意。一些实际启示: (1) 优先做能用新数据定期更新的分析 (2) 公开地做研究(根据新证据修正观点) (3) 承认不确定性;做出可证伪的预测 (4) 认真且谦逊
A few (personal) thoughts on reading empirical AI papers on the economy. Economists have gotten used to reading papers with super clean identification, arguing about the validity of an instrument, making sure parallel trend assumptions are satisfied. This is what gets you into a top journal, and it is *very* important research (no question here). But it also takes years and sometimes decades to get these types of papers right---people often don't find a good instrument to answer a specific causal question decades after the natural experiment. We will eventually have this type of research for AI as well, and it is absolutely necessary. But right we also need signals *right now*, even if they are noisier than what we are used to. We need papers where we can trust that researchers did their best methodologically, while at the same time acknowledging that the space is moving way too fast to wait for perfect identification. This will allow us to accumulate enough signals, coming at the same question using different angles, for example, to say "yes, X is likely happening in the economy". The AI exposure and early career hiring papers are a good example of this. There is no silver bullet paper with super clean identification. But at this point we have several independent teams reaching the same general conclusion, enough where we can say "there seems to be a slow down in AI-exposed, early career hiring."
Nous Research 在 GitHub 发布 Hermes Agent 模型提供方插件 hermes-plugin-claude-subscription-directsdk,可通过官方 Claude Code CLI 使用 Claude Pro/Max 订阅,目前为实验性功能。
Gary Marcus 发文列举 Dario Amodei 在七天内损害自身公信力的三种做法:其一是让与 Anthropic 关系密切的 METR 和已有业务往来的 Accenture 充当独立监督方;其二是 Anthropic 正筹备自建湿实验室,却缺乏常规机构审查委员会监督;其三是嘴上呼吁"pace the frontier",实际仍指向 IPO。
Claude Code v2.1.278 将 Claude API、Enterprise 用户以及 Bedrock、Vertex、Foundry 和网关上的 auto 模式默认切换为服务端分类器,不再收取分类器开销,计费回退时会给出警告。
Gary Marcus 指出,NYT 报道特朗普出于经济考量淡化 AI 风险并抵制监管,他认为这可能带来糟糕后果。他提到自己曾在美国参议院警告,AI 生成的不准确信息可能引发意外战争,而类似情况已经出现,下次未必还能侥幸。
NVIDIA 发布 AIPerf,用于对大规模 LLM 推理做基准测试,解决 curl 命令、手写 asyncio 脚本或一次性压测工具受单进程性能、Python GIL 并发上限等问题。该工具面向模型部署后的性能评估场景。
Claude Code v2.1.277 新增 AGENTS.md 支持:项目无 CLAUDE.md 时会改读 AGENTS.md,可在 /config 的 "Project instructions" 中修改(Bedrock、Vertex、Foundry 暂不支持)。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 开放。
MIT Libraries 的 MIT Reads 项目在十周年之际转型,将重点转向虚构与回忆录,以在 AI 时代促进社交连接与共同人性。MIT 校长 Sally Kornbluth 选定 Ted Chiang 的《Exhalation》为 2026 年秋季书目,该书探讨人类与 AI 的关系等议题。MIT 教学与科研中 AI 使用特设委员会报告引用该项目,称其有助于推动校园关于共同规范的对话。
Gary Marcus 认为,近期真正值得担忧的不是失控的超级智能,而是失控的智能体 AI 大规模发动互联网攻击。他援引《华尔街日报》评论版 Brian Gross 的文章称,主流媒体中少有机构梳理这一整体图景,并表示完全认同该文观点。
GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,只是审查力度应按风险分级;Skills 与 MCP 解决不同问题,MCP 提供工具与数据的标准接入,Skills 封装团队流程与最佳实践,二者可组合使用;RAG 并未消亡,检索能为模型提供训练数据之外的信息,减少 token 消耗并让回答更有依据。
a16z 图表周报引用近期论文和 SensorTower 数据指出,AI 代码生成工具让每月新应用数量在 iOS、Android 和 Chrome 上翻倍甚至翻两番,但下载量和评分基本停滞,达到 10+ 评分或 100+ 下载等规模的应用占比大幅下降。
MiniMax Code CLI 现已开放: https://github.com/MiniMax-AI/minimax-code
https://x.com/i/article/2100908964779040768
OpenAI 发布澳大利亚青年安全蓝图,这是一份包含六大支柱的路线图,目标是打造更安全的 AI 体验,以保护和赋能年轻人。
この3x3画像を1枚 r2v でAI動画化すると以下の設定でおおよそそのまま映像になる Minimax H3 Max r2v 480p 15秒 Prompt調整:Quality 参照強度:標準 「左上から右下のパネルにカットが切り替わる2Dアニメーション、 複数パネル禁止、BGM禁止」
Introducing VC-Attention: fast and accurate low-bit attention without retraining. On MiniMax-H3, VC-Attention speeds up attention by 1.6× on B200 and 1.5× on B300 over FlashAttention-4, with better fidelity than SageAttention2. It also works with existing sparse attention methods. Two key innovations: • V-Smooth reduces value quantization error. • ExpCast-FP8 speeds up softmax. Nunchux Attention, our proprietary extension, pushes the speedup to 1.9× on B200 and 1.8× on B300. Blog: http://www.nunchux.ai/blog/attention-is-the-video-bottleneck Technical Report: http://arxiv.org/pdf/2609.15810 Joint work by researchers at MIT, CMU, UC Berkeley, Stanford, and NVIDIA.
Claude Code 发布 v2.1.276,修复了当 ANTHROPIC_BASE_URL 指向代理或网关时每个请求都因 400 报错而失败的问题,该问题为 2.1.275 引入的回归。此版本自 v2.1.275 以来共合并 43 个提交。
Introducing Benchmark Reviews: our new initiative to audit AI benchmarks. We are launching with 15 benchmarks: 4 Verified, 9 Flawed, and 2 with not enough information for a review.
Apple 研究团队提出 Dynamically Scaled Activation Steering(DSAS),一种与具体方法无关的激活引导框架,将"何时引导"与"如何引导"解耦,按层和输入自适应调节现有引导变换的强度,仅在检测到不良行为时强力干预。
vLLM 集成 PyNvVideoCodec(NVDEC 的 Python 接口),把视频解码从 CPU 转移到 NVIDIA GPU,消除多 GPU 视频描述任务的 CPU 瓶颈。
一家全球金融科技公司把编码智能体工作负载迁到 Together 的 Dedicated Model Inference,运行 GLM-5.2 并采用多副本 B200、256K 上下文配置。
Claude Code 发布 v2.1.275,新增登录账号显示、ctrl+enter 立即发送排队消息,以及将 claude.ai 账号启用的技能和插件同步到终端会话。该版本还修复了恢复会话时提示缓存失效、全屏模式滚动卡顿、插件市场更新误删本地副本等问题,并改进 --system-prompt 中 __SYSTEM_PROMPT_DYNAMIC_BOUNDARY__ 行的提示缓存。