跳到正文

全部动态

今日 85 条
9月30日周三
  1. LlamaIndex:产品、工程与评测44

    LlamaIndex 推出 LlamaExtract:从复杂文档中提取带引用与置信度分数的结构化数据

    LlamaIndex 发布 LlamaExtract,可从复杂文档中提取字段级数据,并给出逐列置信度分数与可追溯引用。该工具支持多字段提取、布局与上下文感知推理、自定义或自动检测 schema,以及多种解析模式以平衡成本与精度。LlamaParse 已累计处理超 10 亿份文档,月下载量超 2500 万次,用户超 30 万。

  2. LlamaIndex:产品、工程与评测30

    LlamaParse:面向复杂文档的多模态解析工具

    LlamaIndex 推出 LlamaParse,可将复杂版式、表格、图表、手写内容、复选框和图片解析为干净的 markdown。该工具支持版式感知、多模态解析和多种解析模式,可处理数百万页文档,开箱支持 100+ 种语言,并支持本地云部署。官方称已处理超 10 亿份文档,LlamaParse 用户超 30 万,包月下载量超 2500 万次。

  3. LlamaIndex:产品、工程与评测26

    LlamaParse:兼顾成本与精度的前沿智能体文档处理

    LlamaIndex 的 LlamaParse 提供端到端文档理解,覆盖解析、提取与索引三个环节,可处理复杂版式、表格、图表、手写和图像。其 Extract 支持带置信度分数和引用的上下文感知数据提取,Index 通过智能分块与嵌入让数据可直接用于检索。

  4. Baseten Base Labs:模型研究15

    Qwen3.5 35B-A3B

    来源显示 Qwen3.5 35B-A3B 这一模型标识,正文仅包含一段 API 返回的 JSON 示例,其中 model 字段为空,usage 记录 completion_tokens 145、prompt_tokens 38、total_tokens 183。原文未提供该模型的参数、benchmark 或可用性等更多信息。

  5. Baseten Base Labs:模型研究18

    GLM 5

    智谱 GLM 5 出现在 Baseten Base Labs 的模型研究页面中,原始标题仅给出模型名,正文为一段 chat.completion 格式的 API 返回示例,包含 38 个 prompt_tokens、145 个 completion_tokens、共 183 个 total_tokens,模型字段为空。

  6. Baseten Base Labs:模型研究9

    Llama 3.3 70B Instruct

    Baseten Base Labs 模型研究页面列出 Llama 3.3 70B Instruct,正文仅给出一段 chat.completion 格式的 API 返回示例,其中 model 字段为空,completion_tokens 为 145、prompt_tokens 为 38、total_tokens 为 183。

  7. Goodfire Research(网页)37

    Goodfire 推出 Silico for Life Sciences:面向生命科学的模型可解释性工具

    Goodfire 发布 Silico for Life Sciences,可追踪模型内部可解释特征,验证预测依赖真实生物结构还是数据集伪相关,并从模型内部直接挖掘生物标志物与机制假设。该工具已用于 Mayo Clinic 合作项目,对 ClinVar 全部 420 万个变异给出可解释预测,其中 83.9 万个变异实现 SOTA 致病性预测,并开源可解释预测数据库。

  8. Goodfire Research(网页)50

    Goodfire 推出 Silico:用内部表征做奖励信号,幻觉降低 58%

    Goodfire 发布面向 LLM 的可解释性工具 Silico,用模型内部表征的轻量探针作为奖励信号训练 Google Gemma 3 12B,幻觉降低 58% 且性能基准无退化,成本比 LLM-as-a-judge 低约 90 倍。该工具还支持基于探针定位有害行为对应的训练数据点,过滤后重训可使相关行为减少 63%,识别并剔除问题数据源后减少 84%。Silico 已提供 macOS 版下载。

  9. Goodfire Research(网页)41

    Goodfire 推出可解释性智能体 Silico,面向团队提供前沿模型机制分析

    Goodfire Research 发布可解释性智能体 Silico,可围绕研究目标自主制定实验计划、并行运行并监控进度,支持任意规模模型。它集成 auto-interp、探针与 SAE 训练、模型对比、因果分析、数据归因、神经几何和激活 verbalizer 等可解释性方法与库,用于解释模型行为、调试回归问题、构建多阶段护栏以及复现对齐研究。Silico 已提供 macOS 版本下载。

  10. Fireworks AI(网页)47

    Fireworks 多区域部署:一次部署实现全球扩展

    Fireworks 推出 GLOBAL 多区域部署选项,让单一部署身份和端点跨区域调度 GPU 容量,避免将工作负载钉在单一区域造成容量上限。其调度不进入请求路径,由 DNS 就近选择健康网关并按预生成路由记录转发,支持 GLOBAL、US、EUROPE、APAC、CANADA 范围。七天生产观测显示,可全球部署客户部署的请求成功率从单区域的 99.269% 升至多区域的 99.992%。

  11. Fireworks AI(网页)68

    Fireworks AI 发布 FireRouter with Opus,编码成本降 57%

    Fireworks AI 推出 FireRouter with Opus,在 Claude Opus 5.5、GLM 5.3 和 GLM 5.3 Flash 之间按每轮任务做缓存感知路由,首次可作为独立 serverless 端点供任意 Fireworks 账号调用。

    推荐理由:厂商给出内部 A/B 测试的成本与准确率数据,读者可以据此评估缓存感知路由在编码工作流中的省费空间。

  12. Cursor Blog74

    Cursor 推出 Projects:用协调智能体承接大规模开发工作

    Cursor 推出 Projects,让开发者以项目为单位承接功能开发、迁移和长期维护等工作,可维持数月上下文、向数千个子智能体委派任务并自动处理周期性工作。每个 Project 默认在云端运行并同步共享上下文,协调智能体只负责委派而不写代码,还可订阅 Slack 频道、按计划运行或跟踪 PR。

    推荐理由:官方介绍了 Projects 的协调智能体机制和内部使用数据,读者可以对照自己的多 PR 工作流评估是否适用。

  13. Cursor Blog61

    Cursor 推出软件开发 Bots:Rollouts 与 Security Reviewer

    Cursor 推出两款软件开发 Bots,Rollouts 全程监控变更从 PR 到生产环境、自动标记回归并支持回滚,Security Reviewer 在每个 PR 上像安全工程师一样审查代码并支持一键修复。

    推荐理由:原文来自官方,详细说明了两个 bot 的工作机制和适用场景,读者可对照自身部署与安全审查流程评估可用性。

  14. Cognition 模型 / Devin 博客(网页)78

    Cognition 研究员用 Devin 构建 GPU 格子筛分解 RSA-260,成本较此前公开最优低约 10 倍

    Cognition 研究员 Eric Lu 带领多个 Devin 会话构建了目前性能最高的 GPU lattice siever,用修改版 CADO-NFS 在约 4,900 GPU 天、约 $400k 的成本上完成 RSA-260 分解,创下公开解决的 RSA Factoring Challenge 最大规模纪录,超过 2020 年 2 月的 RSA-250。

    推荐理由:原文详细披露 GPU 格子筛实现、成本估算和人机分工,读者可以了解 Agent 驱动大型科研工程的实际工作流。

  15. Cognition 模型 / Devin 博客(网页)71

    Cognition 将 Fusion 双智能体 harness 引入 Devin Desktop 和 CLI

    Cognition 在 Devin Desktop 和 CLI 中开放 Fusion,一个由前沿模型主导规划审查、高性价比模型执行编码的双智能体 harness,官方称在主要编码基准上最高节省 39% 成本。

    推荐理由:原文给出双智能体架构、实测成本数据与模型配对调优经验,读者可据此理解按任务定价与多智能体分工的设计取舍。

  16. Claude:Blog(网页)72

    Claude 合并 Cowork 与聊天,并推出 Claude Docs、Slides 和 Design 集成

    Anthropic 宣布 Claude Cowork 与聊天合并为一个 Claude,任务不再需要用户选择入口,可在合上电脑后继续完成。同时发布 Claude Docs 和 Claude Slides,Claude Design 也可在对话中直接使用,三者均在付费计划上处于 beta。

    推荐理由:官方说明了 Cowork 与聊天合并的原因和落地方式,读者可以据此判断现有工作流会受哪些影响。

  17. Claude:Blog(网页)27

    Anthropic 推出 Claude 平台 Console:Messages 直连模型,Managed Agents 托管智能体

    Anthropic 上线 Claude 平台 Console,提供两种开发方式:Messages 为直连模型,需自行构建每轮对话、管理会话状态并编写工具循环;Managed Agents 提供全托管智能体基础设施,支持有状态会话与持久事件历史。平台同时提供 Claude 模型家族选型指引,涵盖研究、编码、写作等场景,Haiku 4.5 主打最快速度与最低成本。

  18. Claude:Blog(网页)44

    Claude Code 开发者文档:入门指南

    Anthropic 发布 Claude Code 入门文档,该智能体编程工具可读取代码库、编辑文件、运行命令,支持终端、IDE、桌面应用和浏览器四种使用界面。终端 CLI、VS Code 和 JetBrains 插件还支持第三方模型提供商,多数界面需 Claude 订阅或 Anthropic Console 账户。

  19. Claude:Blog(网页)73

    Claude 桌面与移动端应用提供 macOS、Windows、Linux、iOS、Android 下载

    Claude 提供桌面与移动端应用下载,覆盖 macOS、Windows(含 arm64)、Linux(beta,支持 Ubuntu 和 Debian)以及 iOS 和 Android,所有套餐(Free、Pro、Max、Team、Enterprise)均可使用,部分功能仅限付费计划。

    推荐理由:原文汇总了 Claude 桌面与移动端应用的下载入口、各平台支持范围和付费限制,读者可据此判断是否迁移工作流。