2026-09-15
今日要点
- DeepMind 发布 Gemini 3.8 Flash 系列与 WeatherNext 3 气象模型,同时推出 AlphaGenome Atlas 基因组预测图谱,AI 在科学探索领域持续突破。
- Anthropic 发布 Claude Opus 5,并公布模型硬件标准预览,强化对齐与安全研究投入。
- OpenAI 推出 Agents API 与 GPT-Live-1 语音模型,ChatGPT 正式进军金融服务领域,存储架构支撑超 10 亿用户。
- Signal 宣布将采用零知识证明实现免手机号注册,XCancel 服务因法律进展暂停运营。
- Nike 因市值蒸发 2000 亿美元退出 S&P 100 指数,Steam Frame 硬件售价 1059 美元起,苹果发布 iOS 27 等全新操作系统。
Hacker News
Steam Frame starts at $1059
Steam Frame 起售价 1059 美元
Valve 正式在其官网商店页面公布了 Steam Frame 的定价信息,起售价为 1059 美元。作为 Valve 在硬件领域的又一重要布局,Steam Frame 预计将延续其一贯的开放生态策略,为 Steam 平台用户带来全新的沉浸式体验设备。具体规格与发售日期尚未在页面中详细披露,但定价定位表明其面向的是高端 PC 游戏与 VR 用户群体。
Registration without a phone number on Signal will use zero-knowledge proofs
Signal 将采用零知识证明实现免手机号注册
Signal 社区宣布,平台即将推出不依赖手机号的用户注册方案,核心技术基于零知识证明(Zero-Knowledge Proofs)。这一更新将允许用户在不暴露真实手机号码的情况下完成账户创建与验证,大幅提升隐私保护水平。零知识证明技术允许用户向服务器证明其身份合法性,而无需透露任何敏感个人信息,被视为隐私通讯领域的重要里程碑。
Apple’s Dimensional Drawings
Apple 的三维图纸
苹果公司在其开发者网站上发布了”Dimensional Drawings”(三维图纸)资源库,为硬件配件开发者提供精确的设备尺寸与结构信息。该资源包含详细的 3D 建模数据,帮助第三方厂商设计兼容 iPhone、iPad 等设备的保护壳、支架等配件。此举体现了苹果在配件生态标准化方面的持续投入,也为 MFi 认证体系提供了更透明的技术参考。
XCancel service is suspended until further notice
XCancel 服务无限期暂停
XCancel——一款用于取消关注 Twitter/X 大量账号的第三方工具——宣布其服务已无限期暂停。该服务曾帮助数万名用户批量取消关注以清理时间线,但在 Twitter 加强 API 限制后逐渐难以维持运营。此次暂停被描述为”暂时性”,但官方未给出明确的重启时间表,引发社区对类似工具未来生存空间的担忧。
OpenAI bots knew about the RubyGems caching vulnerability
OpenAI 的机器人已知晓 RubyGems 缓存漏洞
据开发者 Greg Navis 披露,OpenAI 的 AI 代理系统在其内部测试中已识别出 RubyGems 缓存机制中存在的安全漏洞。该漏洞可能允许攻击者通过恶意 gem 包注入代码,影响依赖 RubyGems 的开发者工具链。OpenAI 方面表示已将该发现反馈给相关安全社区,凸显了 AI 代理在主动安全研究中的潜在价值,同时也引发了对 AI 系统访问敏感基础设施权限的讨论。
Nike exits the S&P 100 after 18 years and a $200B market-cap wipeout
耐克市值蒸发 2000 亿美元后退出 S&P 100 指数
耐克(Nike)因市值大幅缩水约 2000 亿美元,正式被剔除出标普 100 指数(S&P 100),结束了其在该指数中长达 18 年的成员身份。此次调整源于耐克近年来在市场竞争、库存管理和品牌影响力方面的持续挑战,导致股价大幅下跌。分析人士指出,这一事件反映了消费品牌在宏观经济逆风和数字化转型压力下面临的严峻考验,也标志着指数编制机构对市场格局变化的快速响应。
How to write an effective software design document
如何撰写有效的软件设计文档
本文探讨了在 AI 辅助编程时代,软件设计文档(Design Document)的撰写方法与最佳实践。作者强调,优秀的设计文档应当清晰阐述系统架构决策、接口定义、数据流和边界条件,而非简单罗列功能需求。文章建议采用分层结构,从高层架构逐步深入到模块细节,并提倡使用图表和伪代码辅助说明。在 AI 编码工具日益普及的背景下,设计文档作为人类与 AI 协作的”契约”,其重要性不降反升。
XCancel suspended “due to a new development in the ongoing legal proceedings”
XCancel 因法律程序新进展暂停运营
XCancel 团队在官方声明中进一步解释了服务暂停的原因:Twitter/X 方面正在推进新的法律诉讼,这直接影响了 XCancel 的运营能力。声明指出,“由于正在进行中的法律程序出现了新进展”,服务不得不暂时关闭。这一消息引发了用户对第三方 Twitter 工具法律风险的广泛关注,也凸显了平台方对自动化批量操作工具的持续打压态势。
iOS 27, iPadOS 27, and macOS 27
iOS 27、iPadOS 27 与 macOS 27
苹果公司正式发布 iOS 27、iPadOS 27 和 macOS 27 三大操作系统的全新版本。此次更新涵盖了系统底层架构优化、AI 功能深度整合以及全新的用户界面设计语言。iOS 27 引入了更智能的 Siri 交互体验与增强的隐私保护机制,iPadOS 27 强化了多任务处理与手写笔支持,macOS 27 则在性能调优与开发者工具方面进行了重大升级。苹果在新闻稿中表示,这些更新标志着其软件平台进入了一个全新的智能化时代。
The contagion of fear
恐惧的传染
本文深入探讨了”恐惧传染”(Contagion of Fear)这一社会心理现象在数字时代的放大效应。作者指出,社交媒体算法倾向于推送引发焦虑和恐慌的内容,导致负面情绪在用户群体中快速传播。文章分析了信息茧房、确认偏误和情绪感染机制如何共同作用,使理性讨论空间被压缩。作者呼吁平台设计者、内容创作者和公众共同反思,建立更健康的信息消费习惯,以抵御恐惧情绪的无序蔓延。
The case against JPEG XL
反对 JPEG XL 的理由
本文系统性地梳理了反对 JPEG XL 图像格式的主要论点。作者从兼容性、专利许可、工具链成熟度和实际性能等多个维度分析了 JPEG XL 推广面临的障碍。尽管 JPEG XL 在压缩效率和图像质量方面具有显著优势,但其缺乏主流浏览器和编辑软件的广泛支持、潜在的专利风险以及社区分裂等问题,使其难以成为 JPEG 的可靠替代品。文章认为,在现有生态格局下,WebP 和 AVIF 可能是更务实的选择。
Apple’s Siri AI Can Be Swapped Out for Claude, ChatGPT, Code Shows
代码显示苹果 Siri AI 可替换为 Claude 或 ChatGPT
据 MacRumors 报道,最新代码分析揭示,苹果正在为其 Siri 语音助手构建一个可插拔的 AI 后端架构。这意味着用户未来可能将 Siri 的底层模型从苹果自研版本切换至 Anthropic 的 Claude 或 OpenAI 的 ChatGPT。这一架构设计反映了苹果在 AI 策略上的灵活性——既保留自研模型的选择,也为引入第三方 AI 服务预留了接口。分析人士认为,此举可能是苹果应对 AI 竞争加剧、丰富 Siri 功能生态的重要一步。
EuroBirdPortal – Live bird movements across Europe
EuroBirdPortal——欧洲鸟类实时迁徙追踪
EuroBirdPortal 是一个覆盖全欧洲的实时鸟类迁徙追踪平台,通过整合雷达数据和公民科学观测,为研究人员、观鸟爱好者和公众提供动态的鸟类迁徙信息。该平台能够显示不同物种在欧洲大陆上的实时移动路径、密度和方向,对于理解气候变化对鸟类迁徙模式的影响具有重要价值。网站界面直观,支持按物种、时间和区域进行筛选,是欧洲观鸟社区的重要工具。
Pion, an agent designed to run any company autonomously
Pion:一个旨在自主运营任何公司的 AI 代理
Andon Labs 发布了 Pion 项目,这是一个设计用于自主运营企业的 AI 代理系统。Pion 能够处理从战略规划、资源分配到日常运营决策的多种任务,模拟 CEO 的决策逻辑。项目博客文章详细介绍了其设计理念:通过整合多模态 AI 能力、企业知识库和实时数据流,Pion 可以在人类监督下独立运行公司核心职能。这一尝试引发了关于 AI 在企业治理中角色边界的广泛讨论。
A 386 PC for Your RP2350
为你的 RP2350 打造一台 386 PC
GitHub 项目 frank-386 展示了如何在 Raspberry Pi Pico 2 W(RP2350 芯片)上实现一台完整的 x86 386 兼容 PC。该项目通过 FPGA 仿真技术,在低成本微控制器上模拟了 386 处理器的指令集架构,支持运行 DOS 程序和早期 Windows 应用。项目代码开源,包含详细的硬件连接图和固件源码,为嵌入式爱好者和教育场景提供了一个极具创意的复古计算实验平台。
OpenAI Blog
How Fyxer built an AI executive assistant people trust
Fyxer 如何打造人们信任的 AI 高管助理
OpenAI 介绍了 Fyxer 公司如何利用 GPT 模型构建了一款获得用户高度信任的 AI 高管助理产品。Fyxer 的核心设计理念是”可解释性优先”——系统不仅给出建议,还清晰展示推理过程和数据来源。文章详细描述了其产品迭代过程中如何平衡自动化与人工审核、如何处理敏感商业决策的边界问题,以及最终建立用户信任的关键策略。这一案例为 AI 在企业级应用中的可信度建设提供了宝贵经验。
Perplexity trusts GPT-6 Astra with end-to-end systems
Perplexity 将端到端系统托付给 GPT-6 Astra
OpenAI 分享了 Perplexity AI 如何将 GPT-6 Astra 模型深度集成到其搜索与问答系统的端到端架构中。Perplexity 团队详细介绍了模型在实时信息检索、多步推理和答案生成等环节的具体应用方式,以及通过 Astra 模型显著提升的准确性和响应速度。文章还探讨了在大规模生产环境中对模型进行持续监控和优化的工程实践,为其他寻求 AI 搜索增强方案的企业提供了参考。
Rapidly scaling online storage to serve over 1 billion ChatGPT users
快速扩展在线存储以服务超 10 亿 ChatGPT 用户
OpenAI 发布了关于如何支撑超过 10 亿 ChatGPT 用户存储需求的技术文章(第一部分)。文章深入剖析了存储架构的扩展策略,包括分布式缓存设计、数据分片方案、冷热数据分层管理以及高并发场景下的性能优化。OpenAI 工程团队分享了在用户量指数级增长过程中遇到的关键挑战和解决方案,强调了存储系统可靠性对用户体验的决定性影响。
Cognition helps Devin test its own work with GPT‑6 Astra
Cognition 利用 GPT-6 Astra 帮助 Devin 测试自身工作
OpenAI 介绍了 Cognition 公司如何将 GPT-6 Astra 集成到其 AI 编程助手 Devin 的测试流程中。Devin 现在能够使用 Astra 模型对自身生成的代码进行自动化审查、测试用例生成和缺陷检测,形成”AI 测试 AI”的闭环。文章详细描述了这一流程的技术实现细节,包括提示工程策略、测试覆盖度评估和结果验证机制,展示了 AI 代理自我改进的可行路径。
How a researcher uses Codex and ChatGPT to search for new antimicrobial molecules
研究人员如何利用 Codex 和 ChatGPT 搜索新型抗菌分子
OpenAI 讲述了一位科研人员使用 Codex 和 ChatGPT 加速新型抗菌分子发现的过程。该研究者通过 AI 辅助文献检索、分子结构分析和实验设计优化,显著缩短了传统药物发现流程所需的时间。文章详细记录了 AI 工具在假设生成、数据整合和结果解读各环节的具体应用,展现了大语言模型在科学研究中的跨界价值,同时也指出了当前 AI 辅助科学发现的局限性和需要人工验证的关键环节。
Now everyone can put data to work
现在每个人都能让数据发挥作用
OpenAI 宣布了一项新功能,让普通用户无需编程技能即可将自有数据与 AI 模型结合使用。该功能允许用户上传文档、电子表格或其他数据文件,然后通过自然语言对话进行查询、分析和可视化。文章强调了这一功能的易用性和安全性设计,包括数据加密、权限控制和隐私保护机制。此举标志着 OpenAI 在推动 AI 民主化方面迈出了重要一步,使企业和个人都能从数据智能中获益。
Introducing ChatGPT for Financial Services
推出 ChatGPT for Financial Services
OpenAI 正式发布面向金融服务行业的 ChatGPT 专用版本。该版本针对银行、保险、投资管理等金融场景进行了深度优化,具备更强的合规性检查、风险评估和监管报告生成能力。文章详细介绍了该版本在数据安全、审计追踪和行业特定知识增强方面的技术特点,并列举了多家金融机构的早期应用案例。这一产品标志着 ChatGPT 在企业级垂直应用领域的进一步拓展。
Expanding AI access and cyber defense for federal, state, local, and tribal governments
为联邦、州、地方和部落政府扩展 AI 访问与网络防御能力
OpenAI 宣布了一项面向美国政府各级机构的 AI 赋能计划,旨在扩大联邦、州、地方和部落政府获取 AI 技术的渠道,同时加强其网络防御能力。该计划包括提供经过安全认证的 AI 工具、开展网络安全培训以及建立政府专用的 AI 基础设施。文章强调了在保障数据主权和隐私安全的前提下,帮助政府机构利用 AI 提升公共服务效率和应对网络威胁的战略意义。
Build more natural voice experiences with GPT‑Live‑1 in the API
通过 API 中的 GPT-Live-1 构建更自然的语音体验
OpenAI 在 API 中推出了 GPT-Live-1 模型,专为构建自然流畅的语音交互体验而设计。该模型支持低延迟的实时语音对话,具备情感识别、语境理解和多轮对话管理能力,适用于客服机器人、语音助手和沉浸式娱乐应用等场景。文章提供了详细的集成指南和最佳实践建议,帮助开发者充分利用 GPT-Live-1 的语音交互能力打造下一代语音应用。
Introducing the Agents API
推出 Agents API
OpenAI 正式发布 Agents API,为开发者提供构建自主 AI 代理的标准化接口。该 API 支持代理的创建、配置、执行监控和结果管理,允许开发者将多个 AI 模型、工具调用和外部系统集成到统一的代理工作流中。文章详细介绍了 API 的核心功能、安全机制和典型应用场景,包括自动化工作流、智能客服和代码开发辅助等。Agents API 的推出标志着 OpenAI 在 AI 代理生态建设方面的重要进展。
Anthropic Blog
Improving our alignment and security efforts
改进我们的对齐与安全努力
Anthropic 发布了关于其 AI 对齐和安全研究进展的综合性报告。文章详细介绍了公司在价值对齐、红队测试、对抗性评估和可解释性研究等方面的最新成果。Anthropic 强调,随着模型能力的不断提升,确保 AI 系统行为与人类意图一致的重要性日益凸显。报告还公布了未来研究方向的规划,包括加强多代理系统的安全分析、改进模型监控工具以及扩大外部研究合作。
Previewing the Model Hardware Standard
模型硬件标准预览
Anthropic 发布了”模型硬件标准”(Model Hardware Standard)的研究预览,旨在为 AI 模型的硬件部署提供统一的性能基准和安全规范。该标准涵盖了从芯片级算力指标到系统级安全隔离的多个维度,帮助开发者和部署方评估硬件平台对 AI 模型的适配性。Anthropic 表示,这一标准是公司与硬件合作伙伴长期协作的产物,有望推动 AI 基础设施的标准化和互操作性发展。
Introducing Claude Opus 5
推出 Claude Opus 5
Anthropic 正式发布 Claude Opus 5,这是其旗舰级大语言模型的第五代版本。Opus 5 在推理能力、代码生成、多模态理解和长上下文处理等方面均有显著提升,同时保持了公司对安全性和可解释性的重视。文章详细介绍了新模型的技术架构改进、性能基准测试结果以及面向开发者和研究者的 API 接入方式。Claude Opus 5 的发布进一步巩固了 Anthropic 在前沿 AI 模型竞争中的地位。
Developing Enterprise Frontier Safeguards with our customers
与客户共同开发企业前沿安全护栏
Anthropic 分享了与企业合作开发 AI 安全护栏(Safeguards)的经验与成果。文章描述了 Anthropic 如何与各行业客户协作,针对企业级 AI 应用的具体风险场景(如数据泄露、不当输出、权限滥用等)设计定制化的安全防护方案。这些安全护栏结合了技术控制、流程规范和人工审核机制,旨在帮助企业在享受 AI 红利的同时有效控制风险。Anthropic 表示将持续扩大这一合作模式,推动企业 AI 安全标准的建立。
Expanding our support for scientists
扩大对科学家的支持
Anthropic 宣布了一项扩大科学家支持计划,旨在为学术研究社区提供更强大的 AI 工具和资源。该计划包括提供免费或优惠的 API 访问额度、专门的学术支持团队、以及针对科学研究场景优化的模型功能。Anthropic 强调,科学发现是推动 AI 技术进步的重要源泉,公司希望通过这一计划加强与学术界的合作,共同探索 AI 在生物学、物理学、化学等基础科学领域的应用潜力。
Funding better evaluations of AI’s impact on wellbeing
资助更完善的 AI 对幸福感影响评估
Anthropic 宣布设立专项基金,用于资助关于 AI 对人类幸福感(Wellbeing)影响的独立研究。该基金支持学术界和独立研究机构从心理学、社会学和经济学等多学科视角,评估 AI 技术对用户心理健康、社会关系和生活满意度的长期影响。Anthropic 表示,理解 AI 对人类社会福祉的影响是其负责任 AI 发展的重要组成部分,希望通过这一投资促进更全面的 AI 影响评估框架的建立。
How Claude’s text watermark works
Claude 文本水印的工作原理
Anthropic 详细解释了 Claude 模型生成的文本中嵌入的水印技术。该技术通过在模型输出中隐式添加统计特征,使 AI 生成内容可被可靠检测,同时不影响文本的自然度和可读性。文章介绍了水印算法的技术原理、检测准确率以及在实际应用中的局限性。Anthropic 强调,水印技术是其透明度和问责制策略的一部分,有助于防止 AI 生成内容的滥用,同时为内容来源追溯提供技术保障。
Improving Fable 5’s biology safeguards
改进 Fable 5 的生物学安全护栏
Anthropic 发布了关于改进 Fable 5 模型生物学安全护栏的更新说明。Fable 5 是 Anthropic 面向生物科学研究者的专用模型版本,此次更新强化了对敏感生物学信息(如病原体操作、生物武器相关技术)的过滤和响应限制。文章详细介绍了安全护栏的技术实现、测试验证方法以及与生物安全专家的合作过程。Anthropic 强调,在促进科学研究自由与防范生物风险之间取得平衡是其核心责任。
Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer
Mariano-Florentino (Tino) Cuéllar 出任 Anthropic 全球事务首席官
Anthropic 宣布任命 Mariano-Florentino(Tino)Cuéllar 为全球事务首席官(Chief Global Affairs Officer)。Cuéllar 此前曾担任墨西哥司法部长和联合国教科文组织助理总干事,在公共政策、国际法和全球治理方面拥有丰富的经验。他的加入标志着 Anthropic 在应对 AI 监管、国际协作和政策倡导方面的战略升级。文章介绍了 Cuéllar 的职责范围及其在推动负责任的 AI 全球治理方面的愿景。
Investigating three real-world incidents in our cybersecurity evaluations
调查网络安全评估中的三个真实事件
Anthropic 发布了关于其网络安全评估中发现的三个真实事件的调查报告。这些事件涉及 AI 模型在实际应用中可能遭遇的提示注入、越狱攻击和敏感信息泄露等安全威胁。文章详细描述了每个事件的发现过程、技术分析和采取的缓解措施,并分享了从这些事件中学到的经验教训。Anthropic 强调,持续的安全评估和事件响应是其确保 AI 系统安全性的关键机制。
Google AI Blog
Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery.
观看宇航员 Christina Koch 与 Google 的 James Manyika 探讨太空、技术与发现
Google AI Blog 发布了一段视频,记录了前 NASA 宇航员 Christina Koch 与 Google 高级副总裁 James Manyika 之间的深度对话。两人围绕太空探索的技术挑战、AI 在航天任务中的应用前景以及人类对未知领域的探索精神展开了讨论。Koch 分享了她在国际空间站上的亲身经历,Manyika 则探讨了 AI 如何帮助解决太空任务中的复杂问题。这场对话展现了科技与人类探索精神的交汇。
DevFest is back
DevFest 回归
Google 宣布 DevFest 开发者大会将于 2026 年回归,这是 Google 面向全球开发者社区的最大年度活动之一。今年的 DevFest 将聚焦 AI 开发工具、Gemini 模型应用、Flutter 跨平台开发以及 Cloud 基础设施等热门主题。活动将在全球多个城市同步举办,提供线上和线下参与方式。Google 表示,DevFest 旨在为开发者提供一个学习前沿技术、交流实践经验并建立社区联系的平台。
3 ways to prep for your next big race with Search
用 Search 做好三次大比赛准备的 3 种方法
Google Search 发布了一篇实用指南,介绍如何利用搜索功能为即将到来的大型跑步比赛做好充分准备。文章提供了三个实用技巧:一是搜索训练计划和配速策略,帮助跑者制定科学的备赛方案;二是查找比赛路线的地形和天气信息,提前了解赛道特点;三是搜索补给站分布和赛后恢复建议,确保比赛日的后勤保障。这些技巧体现了 Google Search 在日常生活中的实用价值。
Get ready for the game with new football features in Search
用 Search 新功能为比赛做准备
Google Search 推出了全新的足球(Football)功能,为球迷提供更丰富的比赛相关信息。新功能包括实时比分更新、球队阵容分析、球员统计数据以及比赛前瞻和回顾等内容。用户只需在 Search 中搜索球队或比赛名称,即可获取一站式足球信息。Google 表示,这一更新旨在提升体育迷的观赛体验,让搜索成为连接球迷与赛事的重要桥梁。
Recreating a 70-year love story frame by frame
逐帧重现一段 70 年的爱情故事
Google AI 团队利用 AI 图像生成技术,将一对夫妇 70 年的爱情故事通过逐帧图像的方式重新呈现。该项目基于大量历史照片和文字记录,使用 AI 模型生成每个年代的典型场景,生动展现了这对夫妇从相识到相守的完整历程。这一创意项目不仅展示了 AI 在图像生成和叙事表达方面的能力,也引发了关于技术如何帮助保存和传承人类记忆的深刻思考。
Proactive cyber defense for governments and enterprises
为政府和企业提供主动网络防御
Google 宣布了一项面向政府和企业客户的主动网络防御计划,旨在帮助组织在威胁发生前识别和阻断潜在的网络攻击。该计划结合了 Google 在威胁情报、AI 驱动的安全分析和云安全基础设施方面的能力,提供包括漏洞扫描、入侵检测、响应自动化和威胁狩猎在内的全方位服务。Google 强调,主动防御是应对日益复杂网络威胁的关键策略,有助于降低安全事件的影响和恢复成本。
The latest AI news we announced in August 2026
2026 年 8 月发布的最新 AI 新闻汇总
Google AI Blog 发布了 2026 年 8 月的 AI 新闻汇总文章,回顾了当月发布的重要 AI 产品和功能更新。内容包括 Gemini 模型的新一轮能力升级、Google Workspace AI 功能的扩展、DeepMind 在科学发现领域的最新进展,以及 Google Cloud AI 服务的更新。这篇文章为关注 Google AI 动态的用户提供了一个便捷的信息入口,方便快速了解当月的关键发布。
Try Google Pics: Easy image creation and editing in Google Workspace
体验 Google Pics:在 Google Workspace 中轻松创建和编辑图像
Google 推出了 Google Pics,一款集成在 Google Workspace 中的图像创建和编辑工具。该工具利用 AI 技术,让用户无需专业设计技能即可快速生成和编辑图像。功能包括 AI 图像生成、智能裁剪、背景移除、文字叠加和风格滤镜等。Google Pics 可直接在 Gmail、Docs、Slides 和 Meet 等 Workspace 应用中调用,旨在提升用户的视觉内容创作效率,降低设计门槛。
3 new ways to plan and book travel in Search
Search 中规划预订旅行的 3 种新方式
Google Search 推出了三种全新的旅行规划与预订功能,进一步整合了搜索与交易能力。新功能包括:一是 AI 驱动的个性化行程推荐,根据用户偏好自动生成旅行计划;二是整合多平台价格比较,帮助用户找到最优的机票和酒店选项;三是支持直接在搜索结果中完成预订,减少跳转步骤。这些更新体现了 Google 在”搜索即服务”战略上的持续投入,旨在为用户提供更流畅的旅行规划体验。
5 ways to upgrade your home decor with Google Search
用 Google Search 升级家居装饰的 5 种方法
Google Search 发布了一篇家居装饰指南,介绍了五种利用搜索功能提升家居环境的方法。包括:搜索流行装饰趋势和配色方案、查找 DIY 改造教程、比较不同风格的家具选项、获取空间规划建议以及寻找本地装修服务。文章强调了 Google Search 作为家居灵感来源和决策工具的价值,帮助用户轻松实现家居升级梦想。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
正交性之后:德性伦理代理与 AI 对齐
本文探讨了 AI 对齐领域中正交性论题(Orthogonality Thesis)之后的理论发展方向,提出了基于德性伦理学(Virtue Ethics)的 AI 代理框架。作者认为,传统的后果主义和规则主义对齐方法存在局限,而德性伦理学关注代理者的品格和动机,为构建具有内在价值导向的 AI 系统提供了新的思路。文章详细阐述了如何将”智慧”、“勇气”、“节制”和”正义”等德性概念形式化为 AI 代理的设计原则。
AGI Is Not Multimodal
AGI 并非多模态
本文对”AGI 必须是多模态的”这一流行观点提出了质疑。作者论证了通用人工智能(AGI)的核心特征在于其通用推理和问题解决能力,而非对多种感知模态的支持。文章回顾了单模态系统在复杂任务中的表现,指出多模态能力虽然有价值,但并非 AGI 的必要条件。作者呼吁 AI 社区更精确地定义 AGI 的标准,避免将技术趋势误认为理论必然。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中角色的演变
本文回顾了数学在机器学习研究中角色的历史演变,从早期统计学的奠基到深度学习时代几何与拓扑方法的兴起。作者指出,随着模型复杂度的提升,传统微积分和线性代数的分析工具已不足以完全刻画深度学习系统的行为,而微分几何、群论和代数拓扑等更抽象的数学分支正变得越来越重要。文章预测,未来机器学习理论的发展将越来越依赖于对这些高级数学结构的理解和运用。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺少什么:一种目标感
本文深入分析了当前大语言模型聊天机器人的一个根本性缺陷——缺乏真正的目标感(Sense of Purpose)。作者认为,人类对话之所以有意义,是因为参与者具有内在动机和生活目标,而 LLM 只是被动响应外部提示,没有自己的意图或价值取向。文章探讨了赋予 AI 系统目标感的理论可能性与实践挑战,并警告过度拟人化可能带来的认知偏差和安全风险。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要以幸福感为基础的 AI 积极愿景
本文呼吁 AI 社区超越对风险和威胁的单一叙事,构建以人类幸福感为核心的积极 AI 愿景。作者指出,当前 AI 讨论过多聚焦于存在性风险和就业冲击,而忽视了 AI 在促进心理健康、增强社会连接、提升教育公平和改善生活质量方面的巨大潜力。文章提出了一个以 Wellbeing 为框架的 AI 发展路线图,强调技术设计应优先考虑对人类繁荣的贡献。
Financial Market Applications of LLMs
LLM 在金融市场的应用
本文系统综述了大语言模型在金融市场的各类应用场景,包括新闻情绪分析、财报解读、风险评估、交易策略生成和客户服务等。文章分析了 LLM 在金融领域应用的优势与局限,指出模型在事实准确性、可解释性和监管合规方面仍面临挑战。作者建议金融机构采取”人机协同”的渐进式采用策略,在发挥 LLM 效率优势的同时保留人类专家的关键判断。
A Brief Overview of Gender Bias in AI
AI 性别偏见简要概述
本文提供了 AI 系统中性别偏见问题的全面概述,从数据层面的历史不平等到算法层面的放大效应,再到应用层面的社会影响。文章列举了招聘筛选、面部识别、语音助手和推荐系统等多个领域的具体案例,揭示了性别偏见如何在 AI 系统中产生和固化。作者呼吁从数据采集、模型训练到产品部署的全流程引入偏见检测和缓解机制,推动 AI 系统的公平性建设。
Mamba Explained
Mamba 原理解析
本文对 Mamba 架构进行了深入浅出的技术解析。Mamba 是一种新型序列建模架构,结合了状态空间模型(SSM)的计算效率和注意力机制的表达能力。文章详细介绍了 Mamba 的核心组件——选择性状态空间机制,解释了其如何实现线性复杂度的长序列建模。通过对比 Transformer 和 Mamba 的架构差异,本文帮助读者理解 Mamba 在长上下文处理和推理速度方面的优势,以及其在实际应用中面临的挑战。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终让自动驾驶汽车成为现实?
本文探讨了大语言模型在自动驾驶技术中的潜在作用,提出了”Car-GPT”的概念框架。作者认为,虽然 LLM 本身不具备直接控制车辆的能力,但其在感知理解、决策推理和人机交互方面的优势可以显著增强自动驾驶系统的智能化水平。文章分析了 LLM 在地图理解、交通规则推理、异常场景处理和乘客沟通等场景中的应用潜力,同时也指出了实时性、安全性和可靠性方面的关键挑战。
Do text embeddings perfectly encode text?
文本嵌入是否完美编码了文本?
本文通过实验研究了文本嵌入(Text Embeddings)的信息编码完整性问题。作者设计了一系列测试,评估嵌入向量在多大程度上保留了原始文本的语义信息、语法结构和细节内容。研究发现,尽管嵌入在高维空间中有效地捕捉了语义相似性,但在某些精细语义区分和细节保留方面存在明显损失。文章建议研究者和开发者在使用嵌入时应了解其信息压缩的局限性,并在需要精确信息保留的场景中结合其他方法。
arXiv CS.CL
R2VC: Modular Fact-Checking with Retrieval, Verification, and Confidence Calibration
R2VC:基于检索、验证与置信度校准的模块化事实核查
本文提出了 R2VC(Retrieval-Verification-Confidence Calibration)框架,一种模块化的事实核查系统。该系统将事实核查过程分解为检索、验证和置信度校准三个独立模块,每个模块可独立优化和替换。实验表明,R2VC 在多个事实核查基准上显著优于现有方法,特别是在处理复杂和多源信息时展现出更强的鲁棒性。置信度校准模块使系统能够更准确地评估其核查结果的可信度。
What Counts as a Mistake? Annotating Recitation Events in Quran Memorization Transcripts
何为错误?标注古兰经背诵转录中的背诵事件
本文介绍了一种针对古兰经背诵转录文本的错误标注框架。研究团队开发了一套详细的标注指南,用于识别和分类背诵过程中的各类错误事件,包括拼写错误、节奏偏差、遗漏和重复等。该标注体系不仅服务于古兰经学习的自动化评估,也为宗教文本的语音识别和语言学研究提供了宝贵的标注资源。文章讨论了标注过程中遇到的语言学和文化敏感性挑战。
Extracting Dataset Mentions in Forced Displacement and FCV Documents: A Weakly Supervised Framework with LLM-Based Label Refinement
从强制流离失所和 FCV 文档中提取数据集引用:基于 LLM 标签 refinements 的弱监督框架
本文提出了一种弱监督框架,用于从强制流离失所(Forced Displacement)和暴力极端主义(FCV)相关文档中提取数据集引用信息。该框架利用大语言模型进行标签 refinements,显著提升了传统弱监督方法在复杂领域文本中的抽取精度。实验结果显示,该方法在多个 FCV 相关语料库上均取得了优于基线方法的效果,为国际组织和研究机构的数据管理提供了自动化解决方案。
The Cost of Compression: A Rate-Distortion Limit on Factual Hallucination
压缩的代价:事实幻觉的率失真极限
本文从信息论的角度分析了大语言模型中事实幻觉(Hallucination)的根本限制。作者将幻觉问题建模为率失真问题,证明了在给定模型容量和训练数据量的约束下,存在一个不可消除的幻觉率下界。这一理论结果表明,完全消除幻觉在理论上是不可能的,只能通过增加模型规模和训练数据来逼近。文章为理解幻觉现象提供了新的理论框架,并指出了未来研究的潜在方向。
Quantifying Consonant Contributions to Word Intelligibility via Acoustic Masking
通过声学掩蔽量化辅音对词汇可懂度的贡献
本文提出了一种基于声学掩蔽的新方法,用于量化辅音对词汇可懂度的独立贡献。研究通过设计可控的声学掩蔽实验,分离了元音和辅音在语音感知中的不同作用。结果表明,辅音在词汇识别中扮演着比传统模型预测更为关键的角色,尤其是在噪声环境下的鲁棒性方面。这一发现对语音识别系统的优化和助听设备的设计具有指导意义。
Local Edits, Global Ripples: Replay-Informed Policy Adaptation for Workflow Synthesis
局部编辑,全局涟漪:基于重放的策略适应用于工作流合成
本文提出了 Replay-Informed Policy Adaptation(RIPA)方法,用于工作流合成中的策略适应。该方法利用历史执行重放来指导策略调整,使 AI 代理能够在局部修改的基础上实现全局工作流的优化。实验表明,RIPA 在复杂工作流场景中显著提升了合成质量和执行效率,同时减少了所需的交互轮次。文章还探讨了该方法在自动化业务流程和软件开发工作流中的应用潜力。
Population-level measures of perceived food access reveal barriers beyond geographic proximity
人口层面的感知食物获取测量揭示了地理邻近性之外的障碍
本文通过大规模调查和空间分析,研究了社区层面感知食物获取(Perceived Food Access)的多维障碍。研究发现,除了传统的地理邻近性因素外,经济可负担性、交通安全、文化适宜性和信息可及性等因素同样显著影响居民的食物获取体验。研究结果挑战了单纯依靠增加食品零售点来解决食物荒漠问题的传统思路,呼吁采取更综合的公共政策干预。
GAUGE: When Not to Trust LLM-as-a-Judge in User-Simulated Evaluation of Task-Oriented Agents
GAUGE:在任务导向代理的用户模拟评估中何时不应信任 LLM 作为裁判
本文提出了 GAUGE 框架,系统性地评估了在任务导向 AI 代理的用户模拟评估中使用 LLM 作为裁判(LLM-as-a-Judge)的可靠性边界。通过大量对照实验,研究发现 LLM 裁判在特定场景下存在系统性偏差,包括对特定语言风格的偏好、对复杂任务的判断不一致以及对用户模拟真实性的误判。GAUGE 提供了一套诊断工具,帮助研究者识别和规避这些偏差场景。
arXiv CS.LG
Fundamental Dynamical Units for Physics-Informed Structural Inference from Perturbation Time-Series in Networked Systems
网络系统中扰动时间序列的物理信息结构推断基本动力学单元
本文提出了从网络系统的扰动时间序列中进行物理信息结构推断的基本动力学单元(Fundamental Dynamical Units, FDUs)。该方法将复杂网络的动力学分解为基本的动力学模式,结合物理约束进行结构学习。理论分析证明了 FDUs 在特定条件下可唯一识别网络结构,数值实验在多个合成和真实网络数据集上验证了方法的有效性。该研究为理解复杂网络的动力学行为提供了新的分析工具。
Physics-Informed Conformal Prediction: Embedding PDE Consistency into Distribution-Free Uncertainty Quantification for Neural Operators
物理信息共形预测:将 PDE 一致性嵌入神经算子的无分布不确定性量化
本文提出了一种物理信息共形预测(Physics-Informed Conformal Prediction)方法,将偏微分方程(PDE)一致性约束嵌入到神经算子的无分布不确定性量化中。该方法在保持共形预测的统计保证的同时,利用物理定律作为额外的校准信号,显著提升了神经算子在科学计算中的预测可靠性。数值实验展示了该方法在流体力学和结构力学问题中的优越性能。
Fed-Equilibrium Framework for Topological Pareto Control in Robust and Fair Clinical Federated Learning
鲁棒公平临床联邦学习的拓扑 Pareto 控制 Fed-Equilibrium 框架
本文提出了 Fed-Equilibrium 框架,用于在临床联邦学习中实现鲁棒性和公平性的拓扑 Pareto 控制。该方法利用拓扑数据分析(TDA)来刻画多客户端数据分布的几何结构,并在此基础上设计 Pareto 最优的模型聚合策略。实验在多个医疗数据集上验证了该方法在保护患者隐私的同时,显著提升模型鲁棒性和跨群体公平性的能力。
Efficient AI Model Deployment Using Quantization Analysis Tool
使用量化分析工具高效部署 AI 模型
本文介绍了一种基于量化分析工具的 AI 模型高效部署方法。该方法通过自动化的量化误差分析和精度-效率权衡优化,帮助开发者在保持模型性能的同时显著降低部署成本。工具支持多种量化策略(包括权重量化、激活量化和混合精度量化),并提供可视化的性能分析界面。实验表明,该方法在多个主流模型架构上实现了 2-4 倍的推理加速和 50-70% 的内存占用降低。
Performance, Efficiency and Collapse — Advantages and Challenges in Offline Post-training of Code LLMs
性能、效率与坍缩——代码 LLM 离线后训练的优势与挑战
本文系统研究了代码大语言模型(Code LLM)离线后训练(Offline Post-training)的性能、效率与坍缩问题。研究发现,虽然离线后训练在特定代码任务上能够显著提升模型性能,但也面临着训练效率低下和分布坍缩(Distribution Collapse)的风险。文章提出了多种缓解策略,包括课程学习、多样性保持正则化和混合训练数据设计,并在多个代码基准上验证了这些策略的有效性。
Look Before You Leap: Pre-Action Verification for LLM Agents
三思而后行:LLM 代理的预动作验证
本文提出了”预动作验证”(Pre-Action Verification)框架,用于提升 LLM 代理在自主执行任务时的安全性和可靠性。该方法要求在代理执行每个动作之前,通过独立的验证模块检查动作的合理性和潜在风险。实验表明,预动作验证显著降低了代理在复杂任务中的错误率和有害输出,同时仅引入了可接受的计算开销。文章还讨论了验证模块的设计原则和与不同 LLM 后端的集成方案。
Decoding Mixture Perception through Computational Modeling of Component Interactions
通过组件交互的计算建模解码混合感知
本文提出了一种计算建模方法,用于解码人类对混合刺激(如混合气味、混合味道)的感知机制。研究通过构建组件交互的数学模型,量化了不同成分之间的协同和拮抗效应。实验结果表明,该模型能够准确预测多种混合刺激的感知强度和质量特征,为感知科学和产品设计提供了新的分析工具。文章还探讨了该方法在跨模态感知研究中的扩展应用。
Space as an Interventional Invariant: Cross-Modal Predictive Geometry for Stratified Cities and Em-Spaced Intelligence
空间作为干预不变量:分层城市的跨模态预测几何与情感空间智能
本文提出了”空间作为干预不变量”的理论框架,用于分层城市系统中的跨模态预测建模。研究将城市空间结构视为一种不变量,在此基础上构建了跨模态预测几何模型,能够整合视觉、听觉和社会感知等多种数据源。文章还引入了”情感空间智能”(Em-Spaced Intelligence)的概念,探索了空间结构对人类情感和行为的影响机制。数值实验在多个城市数据集上验证了方法的有效性。
arXiv CS.CV
Feature Recovery for Object Understanding After Irreversible Fire Damage
不可逆火灾损害后的物体理解特征恢复
本文提出了一种针对不可逆火灾损害后物体理解的特征恢复方法。火灾造成的物理变形和表面损伤严重影响了传统计算机视觉方法的性能,该方法通过结合热损伤建模和特征重建技术,从受损图像中恢复物体的关键语义信息。实验在自建火灾损害数据集上验证了方法的有效性,结果显示在物体识别和场景理解任务上均取得了显著性能提升。
Does Video Memory Use What It Retrieves? A Causal Audit of Memory Specificity
视频记忆是否使用了其检索的内容?记忆特异性的因果审计
本文对视频记忆系统的记忆特异性进行了因果审计,探究了系统是否真正利用了其检索到的记忆内容。通过设计对照实验和因果干预,研究发现当前视频记忆模型在检索-使用环节存在明显的”检索-使用 gap”——系统能够检索到相关信息,但在实际推理中并未充分加以利用。文章提出了改进记忆利用机制的建议,并对视频理解模型的记忆架构设计提供了新的视角。
Beyond Argmax: A Mechanistic Study of Semantic Retention in Frozen Foundation-Model Composition for Generalized Few-Shot 3D Segmentation
超越 Argmax:冻结基础模型组合中语义保持的机制研究
本文对冻结基础模型组合在广义少样本 3D 分割任务中的语义保持机制进行了深入研究。作者发现,传统的 Argmax 聚合策略会导致语义信息的严重损失,而引入软注意力机制和层次化特征融合能够显著改善语义保持效果。通过详细的机制分析,文章揭示了不同聚合策略对特征空间结构的影响,为 3D 视觉模型的组合方法设计提供了理论指导。
HSI-Road Relabeled: Surface-Aware Road-Scene Segmentation
HSI-Road 重新标注:表面感知的道路场景分割
本文发布了 HSI-Road 数据集的重新标注版本,引入了表面感知(Surface-Aware)的道路场景分割标注体系。新标注不仅包含传统的语义类别信息,还增加了路面材质、磨损程度和湿滑状态等表面属性标签。重新标注后的数据集用于训练表面感知的道路分割模型,实验结果显示在自动驾驶相关任务中显著提升了模型对复杂路面条件的理解能力。
Single-Query Person-Centric Bimanual Hand-Object Interaction Detection
单次查询的人体中心双手机-物交互检测
本文提出了一种单次查询的人体中心双手机-物交互检测方法。该方法以人体为中心,同时检测双手与多个物体的交互关系,无需多轮查询或后处理。模型采用高效的注意力机制和交互图推理,在保持高精度的同时显著降低了计算复杂度。在标准双手机-物交互数据集上的实验表明,该方法在检测速度和准确率方面均优于现有方法。
USPLIT-VQA: U-Shaped Split Learning for Visual Question Answering with Contribution-Aware Weighted Aggregation
USPLIT-VQA:带有贡献感知加权聚合的 U 形分割学习视觉问答
本文提出了 USPLIT-VQA,一种用于视觉问答的 U 形分割学习(Split Learning)框架。该方法将视觉问答模型分割为多个部分,分布在不同参与方之间进行联合训练,同时引入了贡献感知加权聚合机制,根据各参与方的数据质量和模型贡献动态调整聚合权重。实验表明,USPLIT-VQA 在保护数据隐私的同时,达到了与集中式训练相当的性能水平。
When Ground-Truth Fidelity Matters: An Orchestrated UAS Framework for Wheat Streak Mosaic Virus Detection Using Vision Transformers and Machine Learning
当地图真实性至关重要时:基于视觉 Transformer 和机器学习的小麦条花叶病毒检测协调 UAS 框架
本文提出了一种协调的无人机(UAS)框架,用于小麦条花叶病毒(WSMV)的早期检测。该方法整合了高分辨率航空影像、视觉 Transformer 特征提取和机器学习分类器,实现了对 WSMV 感染区域的精准识别。研究强调了地面真实数据(Ground-Truth)准确性对模型训练的重要性,并通过多轮实地验证确保了标注质量。实验结果显示该方法在检测准确率和早期预警能力方面均表现出色。
Physics as the label for measuring and correcting materials reasoning in multimodal models
以物理作为标签测量和纠正多模态模型的材料推理
本文提出了一种以物理定律作为”标签”来测量和纠正多模态模型材料推理能力的新方法。传统上,多模态模型的材料推理评估依赖于人工标注的视觉特征,而该方法利用物理守恒定律和材料科学原理作为客观评估标准。通过设计物理一致性损失函数,模型能够在训练过程中自动纠正违反物理规律的材料推理错误。实验在多个材料科学视觉任务上验证了方法的有效性。
DeepMind Blog
AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome
AlphaGenome Atlas:人类基因组中每种可能 DNA 碱基变化的预测图谱
DeepMind 发布了 AlphaGenome Atlas,这是首个覆盖人类基因组中所有可能单碱基变化的预测图谱。该图谱利用 AlphaFold 系列技术,预测了每种碱基突变对基因功能和调控元件的潜在影响,为遗传病研究和精准医疗提供了宝贵的参考资源。AlphaGenome Atlas 涵盖了超过 30 亿个可能的碱基变化位点,并提供了可视化工具供研究人员探索特定基因区域的突变效应。
Introducing WeatherNext 3, our most advanced and accurate global weather AI model
推出 WeatherNext 3——最先进精准的全球天气 AI 模型
DeepMind 发布了 WeatherNext 3,这是其最新一代全球天气预测 AI 模型。WeatherNext 3 在预测精度、时空分辨率和极端天气事件捕捉能力方面均有显著提升,能够提供更准确的短期和中期天气预报。模型基于 DeepMind 自研的 GraphCast 架构,利用全球气象数据进行了大规模训练。WeatherNext 3 将向气象研究机构和合作伙伴开放,助力提升全球天气预报能力。
Proactive cyber defense for governments and enterprises
为政府和企业提供主动网络防御
DeepMind 宣布了一项面向政府和企业客户的主动网络防御计划,利用 AI 技术帮助组织在威胁发生前识别和阻断潜在攻击。该计划整合了 DeepMind 在威胁检测、异常识别和响应自动化方面的 AI 能力,提供包括实时威胁监控、漏洞预测和自动化响应在内的全方位服务。DeepMind 强调,主动防御是应对日益复杂和频繁的网络攻击的关键策略。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
推出 Gemini 3.8 Flash 和 3.8 Flash Cyber
DeepMind 发布了 Gemini 3.8 Flash 系列模型,包括通用版和网络安全专用版(Cyber)。Gemini 3.8 Flash 在推理速度、多模态理解和代码生成能力方面均有显著提升,同时保持了 Flash 系列的高效推理特性。3.8 Flash Cyber 版本则针对网络安全场景进行了专门优化,具备更强的威胁分析、漏洞检测和响应建议能力。两款模型均通过 API 向开发者和企业用户开放。
Introducing agentic video understanding with Gemini
推出 Gemini 代理式视频理解
DeepMind 介绍了基于 Gemini 的代理式视频理解能力,使 AI 系统能够像人类一样主动探索和理解视频内容。该能力支持多轮交互式的视频分析,包括问题提问、关键帧定位、动作追踪和事件总结等任务。Gemini 的代理式视频理解在多个基准测试中取得了领先性能,为视频内容分析、监控安全和教育娱乐等应用开辟了新的可能性。
Gemini Omni 1.1 Flash lets you build with more control
Gemini Omni 1.1 Flash 让你构建时拥有更多控制力
DeepMind 发布了 Gemini Omni 1.1 Flash,在保持 Flash 系列高速推理优势的同时,增强了开发者对模型行为的控制能力。新版本支持更细粒度的输出控制、自定义推理参数和增强的工具调用能力,使开发者能够更精确地定制 AI 应用的行为。文章详细介绍了新版本的 API 改进、性能优化和典型应用场景。
Piloting the world’s first double-blind AI evaluations
试点全球首个双盲 AI 评估
DeepMind 宣布启动了全球首个双盲 AI 评估试点项目,旨在提高 AI 模型评估的客观性和可信度。在双盲评估中,评估者和被评估模型均不知道测试样本的真实标签和模型身份,从而最大限度地减少评估偏差。该项目与多个学术机构和行业合作伙伴合作,建立了标准化的双盲评估协议和基准数据集,为 AI 研究的透明度和可重复性树立了新标准。
Intelligent transcription with Gemini 3.5 Transcribe
使用 Gemini 3.5 Transcribe 进行智能转录
DeepMind 发布了 Gemini 3.5 Transcribe,一款基于 Gemini 模型的智能语音转录工具。该工具不仅提供高精度的语音转文字能力,还支持说话人分离、多语言转录、专业术语识别和实时字幕生成等功能。Gemini 3.5 Transcribe 在多个语言和专业领域的转录测试中均取得了优异表现,适用于会议记录、内容创作、无障碍访问等多种应用场景。
From Atari to EVE Online: Building on 15 Years of AI Research in Games
从 Atari 到 EVE Online:基于 15 年游戏 AI 研究的积累
DeepMind 回顾了过去 15 年在游戏 AI 领域的研究历程,从早期的 Atari 游戏到复杂的 MMORPG《EVE Online》。文章介绍了 DeepMind 在游戏 AI 研究中的关键技术突破,包括强化学习、多智能体协作和大规模策略搜索等。DeepMind 表示,游戏一直是检验 AI 能力的重要平台,未来的研究将继续探索更复杂的虚拟环境中的智能行为。
Introducing Gemini 3.7 Flash
推出 Gemini 3.7 Flash
DeepMind 发布了 Gemini 3.7 Flash,这是其 Flash 系列的最新迭代版本。Gemini 3.7 Flash 在推理速度、多模态理解、代码生成和长上下文处理等方面均有显著提升,同时保持了 Flash 系列的高效和经济性特点。新版本支持更长的上下文窗口(最高 200 万 token)和更丰富的工具调用能力,为开发者和企业用户提供了更强大的 AI 构建基础。
Meta Engineering
ZGateway: Learnings from Putting a Proxy in Front of ZippyDB
ZGateway:在 ZippyDB 前放置代理的经验总结
Meta 工程团队分享了在 ZippyDB 数据库前部署 ZGateway 代理的经验。ZGateway 作为统一访问层,提供了查询优化、负载均衡、缓存管理和安全过滤等功能,显著提升了 ZippyDB 的吞吐量和可靠性。文章详细介绍了代理架构的设计决策、性能优化策略以及在大规模生产环境中的部署挑战,为其他数据库代理设计提供了宝贵参考。
An Organizational Second Brain: Building an AI That Learns From Experts
组织第二大脑:构建从专家学习的 AI
Meta 工程团队介绍了”组织第二大脑”项目的构建过程,这是一个能够从组织内部专家知识中学习的 AI 系统。该系统通过自然语言交互,让专家能够以对话方式传授经验和知识,AI 自动提取、结构化并持续更新知识库。文章详细描述了知识提取算法、专家验证机制和知识更新策略,展示了 AI 在组织知识管理中的巨大潜力。
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet
MetaRoCE:为 AI 规模以太网构建的新型 RDMA 传输协议
Meta 发布了 MetaRoCE,一种专为 AI 训练规模以太网设计的新版 RDMA(远程直接内存访问)传输协议。MetaRoCE 针对大规模 AI 集群的通信需求进行了深度优化,支持更高的带宽利用率、更低的延迟和更强的故障恢复能力。文章详细介绍了协议的技术架构、性能基准测试结果以及在 Meta 大规模 AI 训练集群中的实际部署效果。
MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines
MTIA 300:Meta 首款内置网卡和通信卸载引擎的训练芯片
Meta 介绍了 MTIA 300 训练芯片,这是 Meta 首款内置网络接口卡(NIC)和通信卸载引擎的 AI 训练芯片。MTIA 300 通过将网络通信功能集成到芯片内部,显著减少了 AI 训练集群中的通信开销和延迟。文章详细阐述了芯片的架构设计、通信卸载机制以及在大规模分布式训练中的性能表现,展示了 Meta 在 AI 硬件自研方面的持续进展。
How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees
如何在 WhatsApp 上构建诈骗警报:端到端加密与可验证性保障
Meta 工程团队详细介绍了在 WhatsApp 上构建诈骗警报(Scam Alert)系统的方法。该系统在保持端到端加密的前提下,通过可验证的加密协议识别和警告潜在诈骗消息。文章讨论了在隐私保护与安全防护之间取得平衡的技术挑战,包括零知识证明的应用、恶意模式识别算法和用户通知机制的设计。
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
Meta 工程团队分享了其广告排序系统的多阶段架构设计,该系统从用户行为序列出发,结合缩放定律(Scaling Laws)优化模型性能。文章详细介绍了特征工程、模型训练、在线推理和持续学习等各个环节的技术方案,以及如何在大规模实时广告请求中保持低延迟和高准确率。这一架构使 Meta 的广告推荐系统能够持续适应不断变化的用户行为和市场需求。
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
GEM 训练:Meta 如何将 LLM 规模广告基础模型的效率提升一倍
Meta 介绍了 GEM(Generalized Efficient Modeling)训练方法,该方法使 Meta 的 LLM 规模广告基础模型训练效率提升了一倍。GEM 通过创新的分布式训练策略、混合精度优化和梯度压缩技术,显著降低了大规模模型训练的计算成本和时间。文章详细阐述了 GEM 的技术原理、工程实现细节以及在 Meta 广告系统中的应用效果。
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
探索层次化兴趣表示用于 Meta 广告深层漏斗优化
Meta 工程团队研究了层次化兴趣表示(Hierarchical Interest Representation)在广告深层漏斗优化中的应用。该方法通过构建用户兴趣的多层次表示,从宏观偏好到微观意图逐层细化,显著提升了广告在转化漏斗深层(如下单、注册)的预测准确性。文章详细介绍了层次化表示的构建方法、训练策略和在线部署方案,以及在实际业务中的效果提升。
Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler
用开源内核调度器现代化 Meta 广告服务平台
Meta 工程团队分享了使用开源内核调度器现代化广告服务平台的经验。通过引入先进的调度算法和资源管理策略,Meta 广告服务的计算效率、资源利用率和系统稳定性均得到了显著提升。文章详细介绍了调度器的架构设计、与现有系统的集成方案以及在大规模生产环境中的性能优化实践。
Towards Data Science
Your Model’s MSE Is Lying to You
你的模型 MSE 在欺骗你
本文指出,均方误差(MSE)作为模型评估指标可能存在严重误导性。作者通过多个实际案例展示了 MSE 如何掩盖模型在关键子群体上的性能缺陷,特别是在数据分布不均衡的场景中。文章建议数据科学家结合多种评估指标(如 MAE、RMSE、分位数误差和群体公平性指标)进行综合评估,以获得对模型性能的更全面理解。
When to Use One Model and When to Use a Team of Agents
何时使用单一模型,何时使用代理团队
本文探讨了在 AI 应用中何时应选择单一模型还是多代理团队(Agent Team)的决策框架。作者分析了任务复杂度、可解释性需求、计算资源约束和容错要求等因素,提出了一个实用的决策矩阵。文章指出,简单、确定性强的任务适合单一模型,而复杂、需要多步骤推理和容错的任务则更适合代理团队协作。
Graph Engineering for AI Agents: From Prompts and Loops to Workflows
AI 代理的图工程:从提示和循环到工作流
本文介绍了 AI 代理的图工程(Graph Engineering)方法,展示了如何从简单的提示工程和循环结构演进到复杂的工作流系统。作者详细阐述了图结构在代理任务编排、状态管理和错误处理中的优势,并提供了从原型到生产级工作流的迁移指南。文章强调,图工程是构建可靠、可维护的 AI 代理系统的关键工程实践。
From Static to Dynamic Skills: A Different Model for Agent Knowledge
从静态到动态技能:代理知识的不同模型
本文提出了代理知识的动态技能模型,区别于传统的静态知识库方法。动态技能模型将代理的知识视为可演化、可组合的能力集合,能够根据任务上下文自适应地激活和调整技能。文章详细介绍了动态技能的表示方法、学习机制和推理过程,并在多个代理任务上验证了动态模型相比静态方法的性能优势。
Your Model Isn’t Done Until Someone Else Can Call It
直到别人能调用你的模型,它才算完成
本文强调了模型工程中的一个重要原则:一个模型只有在其他开发者能够顺利集成和调用时才算真正完成。作者从 API 设计、文档完整性、错误处理和版本管理等多个角度,阐述了模型产品化的关键要素。文章指出,许多优秀的模型项目因忽视工程化细节而未能产生实际价值,呼吁数据科学家重视模型的”可调用性”。
Your AI Adoption Lift Is a Selection Effect
你的 AI 采用提升是一种选择效应
本文揭示了企业 AI 采用效果评估中的一个常见偏差——选择效应(Selection Effect)。作者指出,许多声称的 AI 性能提升实际上源于选择了最容易从 AI 中受益的任务和数据,而非 AI 本身的能力。文章提供了控制选择效应的评估方法论,包括随机对照试验设计和基准对比策略,帮助企业和研究者获得更真实的 AI 效果评估。
One Capital Letter Was Silently Breaking My AI Support Bot, and It Wasn’t in the New Model
一个大写字母悄悄破坏了我的 AI 客服机器人,而且问题不在新模型中
本文讲述了一个令人警醒的工程案例:一个简单的大写字母差异导致 AI 客服机器人 silently 失效。作者详细追踪了问题根源,发现是提示词中某个关键词的大小写变化导致模型输出格式不匹配,进而引发下游处理链的级联故障。文章强调了在 AI 系统开发中严格测试边界条件、建立回归测试和监控机制的重要性。
Stop Managing Alarms: An Incident-First Blueprint for Telecom AIOps
停止管理告警:面向电信 AIOps 的事件优先蓝图
本文提出了面向电信行业的 AIOps(AI 运维)事件优先蓝图,主张从传统的告警管理转向以事件为核心的智能运维模式。文章分析了传统告警系统的局限性,包括告警风暴、根因定位困难和响应延迟等问题,并详细介绍了事件优先架构的设计原则、技术实现和预期收益。该方法已在多家电信运营商的生产环境中验证,显著提升了运维效率和故障恢复速度。
Coding Agents Don’t Need Longer History — They Need Intent Continuity
编码代理不需要更长的历史——它们需要意图连续性
本文对编码代理(Coding Agents)的设计提出了一个关键洞察:代理性能瓶颈不在于上下文历史的长度,而在于意图连续性(Intent Continuity)的保持。作者通过实验证明,频繁切换任务上下文会导致代理丢失前期推理的连贯性,而引入意图保持机制(如任务状态持久化和推理链记忆)能够显著提升代理的编码