DeepSeek V4 Pro
Baseten Base Labs 模型研究页面出现名为 DeepSeek V4 Pro 的条目,但正文仅有一段 chat.completion 格式的 API 返回示例,model 字段为空,未披露任何模型参数、benchmark 分数或可用性信息。
Baseten Base Labs 模型研究页面出现名为 DeepSeek V4 Pro 的条目,但正文仅有一段 chat.completion 格式的 API 返回示例,model 字段为空,未披露任何模型参数、benchmark 分数或可用性信息。
Baseten 上线 DeepSeek V4 Pro 0813,一个 1.7T 参数的前沿开放权重模型。它可与较小的 V4 Flash 0731 搭配用于 coding agent,由 Pro 驱动主 agent、Flash 运行子 agent,使整个编码栈跑在开放权重模型上。
DeepSeek 是一家专注打造商用许可开源 LLM 的基础模型研究实验室,旗下模型包括对标 OpenAI o1 的推理模型 DeepSeek-R1、对标 GPT-4o 的 SOTA 大语言模型 DeepSeek-V3,以及基于 Qwen 和 Llama 的 R1 蒸馏版本,可在中等规模 LLM 上提供出色推理能力。
Baseten 旗下 Base Labs 推出嵌入模型 Zembed 1,模型标识为 zembed-1,通过 API 返回 embedding 对象列表。该接口按 prompt_tokens 计费,示例请求消耗 37 个 token。
BAAI/bge-en-icl 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型量化至 FP8 部署,由 Nvidia 最新 GPU(如 H100、H100_40GB 或 L4)支持,量化可选但能带来更高效率。
Nomic Embed Code 的示例响应显示,其返回的 embedding 向量为单元素数组,model 字段标注为 thenlper/gte-base,usage 中 prompt_tokens 与 total_tokens 均为 512。
EmbeddingGemma 是 Google 基于 Gemma3 架构的 3 亿参数文本嵌入模型,在 MTEB 基准上为不到 5 亿参数的嵌入模型中质量最高,支持 100 多种语言、输入最长 2k token。页面给出使用 baseten_performance_client 的完整代码示例,包括各任务的 prompt 前缀和通过 PerformanceClient 调用生成嵌入的方法。
Qwen3 8B Embedding 是一个文本嵌入模型,输入文本后输出一维嵌入向量,常用于聚类等下游任务并配合向量数据库使用。该模型部署时量化为 FP8,需 Nvidia 较新 GPU 支持,如 H100、H100_40GB、B200 或 L4,量化可选但能提升效率。客户端代码可通过 pip 安装,也可使用 OpenAI embeddings 客户端。
Baseten Base Labs 发布 Qwen3 8B Reranker,用于对查询与文档做相关性判定,输出只能是 "yes" 或 "no"。示例通过 baseten_performance_client 的 PerformanceClient 调用 classify 接口,支持 truncate、batch_size 与 max_concurrent_requests 参数配置。
SDXL Lightning 是 Stable Diffusion XL 的变体,仅需 4 个 UNet 步骤即可生成 1024x1024 像素图像,实现接近实时的图像生成。模型接收单个 prompt 输入,返回图像的 base64 字符串,该实现采用 4 步 UNet checkpoint 以平衡速度与质量。用户可自行部署 2 步版本以获得更快速度,或 8 步版本以获得更高质量。
Qwen Image 2512 已在 Baseten 平台上线,可通过 OpenAI 兼容 API 调用,模型名为 qwen-image-2512。该模型支持 1024x1024 尺寸图像生成,可配置 num_inference_steps 与 guidance_scale 参数,并返回 b64_json 格式结果。
Baseten 提供 Wan 2.2 T2V 文生视频 API,通过 POST 请求传入提示词即可生成视频,返回 base64 编码结果。支持 720x1280、1280x720、480x832、832x480、704x1280、1280x704、1024x704、704x1024 八种分辨率,可设置 sampling_steps、guide_scale 与 seed 参数。
NVIDIA Cosmos 3 Nano (8B) 世界基础模型现可通过 Baseten 在单张 H100 上部署,提供六种 omni 模式:text2image、text2video(默认模式)、image2video、forward/inverse dynamics 和 policy。
Baseten Base Labs 上线图像生成模型 Flux.2 [dev],模型名为 flux2-dev,可通过 OpenAI 兼容 API 调用。示例代码以 1024x1024 尺寸、50 步推理、guidance_scale 1.0 生成图像,并以 b64_json 格式返回结果。
Baseten Base Labs 发布 Qwen Image 的 Python 调用示例,通过 httpx 向 Baseten 部署端点发送 prompt、width、height、num_inference_steps 和 seed 等参数生成图像。
Baseten 提供 NVIDIA Nemotron 3 Diarization 的三种预设方案,该模型支持最多 8 个说话人、可按请求配置延迟档位(0.32 秒到 30 秒 buffer),是 Streaming Sortformer v2.1 的后继,采用 OpenMDW 1.1 许可证允许商用。
Baseten 推出基于 Whisper Large V3 的优化实时转录管线,支持可配置的部分转录更新频率、高并发音频流下稳定的实时延迟,以及多语言转录的自动语言检测。
Whisper Large V3 Turbo 已在 Baseten 上线,面向实时笔记、内容字幕和客服等实时语音场景,支持部分转录更新频率可配置、高并发音频流下延迟稳定,以及多语言转录的自动语言检测。
MOSS-Transcribe-Diarize 0.9B 是一个端到端音频模型,可在单次推理中完成语音转写、说话人标注和时间戳,把多人长录音整理成结构化的"谁说了什么"。
Baseten 上部署的 NVIDIA Nemotron 3 ASR(英文)通过 WebSocket 直连 NIM 原生 Riva Realtime API,无需自定义 schema,直接使用 Riva 的 OpenAI-Realtime 风格 JSON 事件协议。
NVIDIA Nemotron 3.5 ASR 是一款面向低延迟流式与批量场景的多语言流式语音识别模型,已在 Baseten 上以 docker_server 形式部署,通过 WebSocket 直连 NIM 原生 Riva Realtime API。
Baseten 发布 Qwen3-TTS-12Hz 流式文本转语音模型,支持十种主要语言、3 秒参考音频快速克隆音色,并可依据文本内容调整语气、节奏和情感表达。模型支持流式与非流式生成,收到单个字符即可输出首个音频包,提供 0.6B 和 1.7B 两个 Base 版本模型卡,页面附有基于 WebSocket 的完整调用脚本,可进行语音管理和 PCM 流式合成。
CAMB.AI 推出前沿文本转语音模型 MARS6,支持 10 种语言的音色与韵律克隆,需商业授权方可使用。模型至少需要文本、参考音频、参考文本和目标语言四项输入,输出默认采用 ADTS AAC 流式响应,也可配置为 flac 流式或返回 base64 编码的 flac 文件。
Baseten Base Labs 推出 MARS8-Flash 语音生成模型,支持流式输出音频,默认输出格式为 flac,也可选 wav、adts 或无头 PCM。
Baseten Base Labs 发布 VoxCPM2 语音缓存演示客户端,通过 /v1/audio/speech 接口验证参考音频复用。首次请求发送 voice 名称加 ref_audio,服务端将其存为已上传语音并预热 ref_audio_feat 缓存;后续请求仅传同一 voice 名称即可命中缓存。客户端支持 wav、pcm、flac、mp3、aac、opus 格式及流式输出。
Canopy Labs 推出 Orpheus TTS(Orpheus v1),为其 Orpheus TTS 的继任模型,需以约 83 tokens/秒生成才能实现实时流式输出。该实现支持流式生成,在 H100 MIG GPU 上可支持 16 路并发实时流(可变流量)、24 路并发实时流(稳定流量),以及 128 路并发非实时生成以进行低成本批处理。
Baseten 发布 Orpheus 3B 的 WebSocket 接入示例:客户端先发送含 voice、max_tokens、buffer_size 的 JSON 元数据,再通过同一连接逐词流式发送文本,服务端返回原始音频字节。示例用 `__END__` 哨兵标记文本结束,音频以 24000 采样率、paInt16、单声道播放,代码基于 aiohttp 与 pyaudio。
Baseten 模型库现已提供 DeepSeek V4.1 Flash、GLM-5.3 Fast、GLM-5.3、GLM-5.3-Flash 和 Kimi K3 等热门模型,可部署在 API 端点后直接调用。
NVIDIA 在 8 月举办本地 AI 博客专题,联合 Perplexity、MiniMax、DeepSeek、Poolside AI 等伙伴推进可在本地运行的开源模型与智能体。
印尼通信与数字部、Indosat Ooredoo Hutchison、NVIDIA 与 Universitas Gadjah Mada 本周在日惹联合启用 UGM Indosat NVIDIA AI Technology Center,这是印尼首个高校 AI 技术中心。
Cloudflare 发布全新 CLI 工具 cf(开放 beta,npm i -g cf),将命令覆盖从 Wrangler 的约 280 个操作扩展到超过 3000 个 API 操作,基于 Forge 从 OpenAPI schema 生成。
Cloudflare 发布 Application Profiles,通过分析 HTTP 请求的结构与格式、识别偏离来实施正向安全策略,从而大幅缩小攻击面。
Cloudflare 发布 Threat Signals,面向所有账户免费开放,用智能体技能把用户选择的开源安全报告自动摘要、打标签、提取和规范化 IOC,并以 Threat Event 形式存入账户私有威胁情报数据集,可直接用于 WAF 策略。
Cloudflare 用前沿 LLM 构建自适应 WAF 测试系统,在授权的客户预发环境针对 XSS、SQLi、CMDi、SSRF、LFI、Log4j 六类攻击运行 45 个场景,记录 1,107 次尝试,经人工分流确认 49 项相关发现,其中 48 项属于 CMDi 和 SSRF。
Cloudflare 提出覆盖发现风险、治理访问、运行时防护、调查响应四阶段的自适应应用安全框架,把代码、流量与威胁情报连成持续系统。新能力包括用 LLM 对自家 WAF 做渗透测试、向所有客户开放威胁情报,以及自动部署正向安全的新功能。其依据是 7 月 AI 智能体在不到 13 小时内从 Hugging Face worker 拿到多个集群管理员权限的事件。
Cloudflare 介绍内部 AI 工具 CryptoLabe,用于发现代码库中的密码学使用并规划后量子(PQ)迁移,目标 2029 年实现全面 PQ 就绪。
Cloudflare 发布面向 Agent 沙箱优化的 Containers 更新,推出 durable_object 调度策略,支持运行时选择镜像和实例类型,并公测文件系统快照。
xAI 宣布 Grok Bot 面向企业开放,Grok 和 Cursor Enterprise 客户未来两周可免费使用,并可邀请整个组织包括没有现有席位的成员。每个 Bot 在云端独立运行,可按工作流学习任务、相互传递上下文,本次发布还新增访问、网络和审计管控;用户工作在相互隔离的安全环境中运行,Bot 默认无访问权限。
xAI 发布设计复盘文章,讲解 Grok Bot 如何围绕持久智能体而非单次会话来设计界面。文章将产品概念收敛为 Bots、Chats、Prompts、Tools。
xAI 发布 Grok Bot 采购应用 Haggle Bot,接入 Slack、Notion、Drive、Gmail、Hex、Ramp 等工具,梳理约 125 个活跃供应商,已识别超过 10 万美元直接节省。
推荐理由:原文以自家用例给出 Grok Bot 在采购场景的完整配置与节省数字,读者可据此评估 Bot 在企业流程中的可复用方式。