Diffusion Controller 如何统一并简化 AI 图像生成
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用轻量转向网络在冻结基础模型的前提下引导生成。
来自「超级智能新闻」(SI NEWS) 的实时聚合 · 按时间倒序 · 每条附 AI 评分与原文出处
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用轻量转向网络在冻结基础模型的前提下引导生成。
NVIDIA AI 工厂通过高产能、耐用性与通用性三大特性最大化投资回报率。SemiAnalysis AgentX 数据显示,NVIDIA Vera Rubin NVL72 系统每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 模型上每百万 token 成本最多低 45 倍。
AI 正在改变开发者工作,GitHub 提出三项需要强化的技能:指挥 AI 智能体、不盲信 AI 的首个答案、用 AI 解决更大的问题。例如让第二个 AI 模型审查第一个模型的输出:GitHub Copilot 内置的 Rubber Duck 智能体即用第二模型在推进前评审方案、代码与测试。当 AI 承担更多实现,清晰定义问题、评估权衡与做出技术决策等人类判断力反而更关键。
OpenAI 在 ChatGPT 推出新的视觉广告格式,并扩展衡量工具、归因合作与品牌适宜性,面向广告主提供投放与评估支持。
OpenAI 说明了在欧盟规则下如何处理文本水印,涵盖水印的适用范围、检测机制,以及为何检测权限优先向研究人员开放。
Amazon SageMaker AI 通过 Agent Toolkit for AWS 推出 aws-ai-ml 智能体技能,让 Kiro、Claude Code、Codex 等支持 MCP 的编码智能体获得推理优化与基准测试能力。
AWS 官方博客介绍如何在 AWS GovCloud (US) 中通过 Amazon Bedrock 运行 Claude Code,让受 ITAR 等合规要求约束的工作负载也能进行 AI 辅助开发。
Microsoft Research 发布 Quine,一个面向生物学的多模态世界模型与交互式研究系统,把模型、科研工具、文献与湿实验连接进闭环。在与 Broad Institute(哈佛与 MIT)合作的胰腺导管腺癌研究中,Quine 用一个周末完成数千化合物的预测与排序,最高排名化合物在多个湿实验中产生了最大的靶向细胞状态转变。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与语音克隆模型。榜单以 Qwen3 ASR 转写计算 WER/CER 衡量可懂度,以 RTFx 和 TTFA 衡量 H200 GPU 上的批量推理与流式延迟,并以 WavLM 嵌入余弦相似度衡量说话人相似度,把单个模型评测从数周缩短到数小时。
GPT-6 Astra Ultrafast 现已通过 OpenAI API 提供,运行在 NVIDIA Blackwell GPU 上,并向符合条件的 ChatGPT Work 和 Codex 用户开放。
NVIDIA 推出 DGX Spark 64GB 统一内存配置,本月由 Acer、ASUS、Dell、Gigabyte、HP、MSI 销售,10 月 23 日起售价 $4,999。
Google Research 宣布新一代联邦学习系统,利用可信执行环境(TEE)提供完全可验证、可审计的数据匿名化保证,Gboard 已率先采用。新系统由客户端加密上传与访问策略、基于 RAFT 共识的 KMS 密钥管理、用 Federated Language 编排的 TEE 训练循环以及加密恢复状态协同工作,训练时间从此前的 1-2 个月大幅缩短,同时模型准确率提升。
Ai2 开源 AstaBrief 8B,它把研究问题与检索到的文献片段直接转成带引用的报告,训练数据一并开放。模型基于 Qwen3-8B,用 SFT 加 DPO 训练;在 Asta 的 Fast mode 下平均 51.1 秒生成一份报告,约为 Claude 驱动的 Thinking mode(178.5 秒)速度的 3.5 倍。
OpenAI 发布 GPT-6 系列模型实践指南,说明创业公司如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具,并为生产环境准备工作流。
Google DeepMind 发布前沿模型 Gemini 4 Argon,面向真实软件工程、法律金融等企业知识工作与网络安全防御,可在长程复杂工作流中维持深度推理。
Hcompany 发布 Holo4 系列智能体模型,包含 27B dense 与 35B-A3B MoE 两种尺寸,可通过 GUI、代码、MCP 和 API 与软件交互,同一模型可
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音结合,为 Gemini 实时对话模型增加能看、能听、能
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,在 AlphaFold Database 中开放 2800 多种病毒的蛋白复合体预测三维结构,约 30
Google DeepMind 宣布为 Private AI Compute 平台引入私密的服务端记忆层,让 AI 在跨设备间保持长期连续性的同时维持与端侧处理同级的隐私标准。
Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色 voice
Mistral 完成 30 亿欧元 D 轮融资,投后估值超过 210 亿欧元,由 Samsung Electronics 领投,Scaleup Europe Fund(EQT 管理
Google DeepMind 与 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评估为迄今最先进、最准确的全球气象模型。
Mistral AI 发布 Agentic Search 检索层,以多步检索循环让模型在复杂文档中查找、检视并验证信息,在 FinanceBench 上将正确率从 26.7% 提升