2026-09-19
今日要点
- Gemini 3.8 系列发布:DeepMind 推出 Gemini 3.8 Live、3.8 Flash 及 Cyber 版本,并公布 AlphaGenome Atlas 基因组预测图谱与 WeatherNext 3 气象模型。
- OpenAI 发布 Astra for Law:面向法律行业的 AI 产品正式上线,同时 OpenAI 公布模型不对齐报告框架及支撑 10 亿用户存储扩展方案。
- Anthropic 强化安全与对齐:推出生命科学研究验证计划、企业前沿安全护栏,并公布 Claude 文本水印技术。
- AI 安全与隐私问题持续发酵:ZCode 被曝静默上传用户 Git 历史;美国军方因 AI 幻觉情报报告险些误判;OpenAI 内部仓库遭漏洞利用。
- AI 应用与工程实践:Meta 发布 MTIA 300 训练芯片与 ZGateway 代理架构;Google 发布 Gemini 3.8 Live 及 DevFest 2026;多篇文章探讨编码 Agent 的可靠性与职业前景。
Hacker News
Microsoft exec called AI scraping ‘the largest theft of labor in human history’
微软高管称 AI 数据抓取是”人类历史上最大的劳动窃取”
据最新未编辑的法庭文件披露,微软一位高管在内部讨论中将 AI 公司大规模抓取互联网内容用于模型训练的行为形容为”人类历史上最大的劳动窃取”。这一言论引发了关于 AI 训练数据版权与创作者权益的激烈争论。随着多起针对 OpenAI、Google 等科技巨头的集体诉讼持续推进,科技行业对数据抓取合法性的讨论日益升温。该高管的表态被视为大型科技公司内部对 AI 数据伦理问题态度的重要信号。
I don’t like passkeys
我不喜欢 Passkeys
一篇来自开发者博客的文章表达了对 Passkey(无密码认证)技术的保留态度。作者从用户体验、跨平台兼容性和技术依赖等角度分析了 Passkey 推广过程中存在的问题,认为尽管 Passkey 在安全性上有其优势,但在实际部署中仍面临诸多障碍,包括设备锁定风险、备份恢复复杂以及对厂商生态的过度依赖。文章引发了社区关于身份认证未来方向的讨论。
OpenJev
OpenJev
OpenJev 是一个开源项目,旨在提供 Java 虚拟机相关的开放实现或工具链。该项目在 Hacker News 上引发关注,反映了开发者社区对 Java 生态中开源替代方案持续的兴趣。
Cloudflare Quick Tunnels
Cloudflare Quick Tunnels
Cloudflare 推出的 Quick Tunnels 服务允许用户快速创建安全的临时隧道,将本地服务暴露到互联网。这一工具在开发者中颇受欢迎,尤其适用于演示、测试和远程访问场景。文章介绍了其使用方法和实际应用场景。
A heap overflow and SSO misconfiguration to compromise OpenAI internal repos
堆溢出与 SSO 配置错误导致 OpenAI 内部仓库遭入侵
安全研究公司 Hacktron 发布报告,披露了一名研究人员利用堆溢出漏洞和单点登录(SSO)配置缺陷,成功入侵 OpenAI 内部代码仓库的过程。该事件凸显了大型科技公司内部安全防护中仍存在的薄弱环节,尤其是身份认证和访问控制配置不当可能带来的严重风险。OpenAI 已对此类安全问题作出回应。
Qwen 3.8 Omni Flash
Qwen 3.8 Omni Flash
阿里巴巴通义千问团队发布了 Qwen 3.8 Omni Flash 模型,这是 Qwen 系列中面向快速推理和多模态任务的最新版本。该模型在保持高推理速度的同时,提升了多语言支持和复杂任务处理能力,进一步丰富了开源大模型生态。
How to Write with an LLM
如何使用 LLM 进行写作
一篇探讨如何有效利用大语言模型辅助写作的文章。作者分享了在实际写作流程中整合 LLM 的技巧与经验,包括提示词设计、迭代修改策略以及如何保持个人写作风格等问题。文章强调 LLM 应作为创作伙伴而非替代品,为写作者提供了实用的操作指南。
Jemalloc 5.4.0
Jemalloc 5.4.0
Jemalloc 5.4.0 版本正式发布。Jemalloc 是一款广泛使用的高性能内存分配器,被 PostgreSQL、Firefox 等多个知名项目采用。新版本带来了性能优化和 bug 修复,进一步提升了在并发场景下的内存管理效率。
Bend 2 and the Vibe-Coding Trap
Bend 2 与”氛围编程”陷阱
文章探讨了 Bend 2 等 AI 编程工具带来的”氛围编程”(Vibe-Coding)现象——即开发者依赖 AI 生成代码而缺乏对底层逻辑的深入理解。作者警告称,虽然这类工具能加速开发,但过度依赖可能导致代码质量下降、调试困难和技术债务累积,呼吁开发者在享受 AI 便利的同时保持对代码的掌控力。
US Military had close call after using AI for hallucinated intelligence report
美国军方因 AI 幻觉情报报告险些酿成事故
CNN 报道,美国军方在使用 AI 生成情报分析报告时,因模型产生幻觉而生成了一份关于中国船只的错误情报,险些导致误判。该事件再次引发了对 AI 在军事和国家安全领域应用的广泛担忧,专家呼吁建立更严格的人工审核机制和 AI 输出验证流程。
Android 17 is the first since 3.x to add new APIs without releasing to the AOSP
Android 17 是自 3.x 以来首个未向 AOSP 开放的新 API 版本
GrapheneOS 指出,Android 17 是自 Android 3.x 时代以来,首个在发布时未将所有新 API 开放给 Android 开源项目(AOSP)的版本。这一变化引发了隐私和安全性社区的担忧,认为谷歌正在逐步收紧对 Android 生态的控制,可能影响第三方 ROM 和隐私友好型操作系统的开发。
Warren Buffett Steps Down as Berkshire Chairman, Names Son to Replace Him
沃伦·巴菲特辞去伯克希尔主席职务,任命儿子接任
《纽约时报》报道,95 岁的投资传奇沃伦·巴菲特正式辞去伯克希尔·哈撒韦公司主席职务,由其子霍华德·巴菲特(Howard Buffett)接任。这一重大人事变动标志着伯克希尔进入后巴菲特时代,市场广泛关注公司未来的投资战略和管理方向。
The scourge of x86 emulation
x86 模拟的困境
一篇深入分析 x86 架构模拟技术所面临挑战的文章。作者探讨了在 ARM 等新兴架构上运行 x86 软件的兼容性难题,包括性能损耗、指令集转换复杂性和长期维护成本等问题。文章认为,尽管模拟技术不断进步,但 x86 的遗产仍在制约着计算平台的演进。
ZCode, the GLM coding agent, silently uploads your Git history
ZCode:GLM 编程代理静默上传你的 Git 历史
安全研究指出,智谱 AI 推出的 ZCode 编程代理存在隐私风险——该工具在用户不知情的情况下,会将本地 Git 仓库历史记录静默上传至云端服务器。这一发现引发了对 AI 编程工具数据收集行为的广泛关注,专家建议开发者在使用此类工具前仔细审查其隐私政策和数据流向。
Inside ZCode: Silently uploading your Git history to the cloud
深入 ZCode:静默将你的 Git 历史上传至云端
另一篇关于 ZCode 隐私问题的深度报道,详细分析了该工具如何在后台收集并上传用户代码仓库数据。文章揭示了其数据采集机制、传输方式以及潜在的安全风险,呼吁开发者和企业用户提高警惕,审慎评估 AI 编程工具的数据处理行为。
OpenAI Blog
How Cooley is accelerating IPO work with ChatGPT
Cooley 如何利用 ChatGPT 加速 IPO 工作
OpenAI 发布案例研究,介绍知名律师事务所 Cooley 如何利用 ChatGPT 加速首次公开募股(IPO)相关文档处理和法律研究工作。文章详细描述了 Cooley 团队将 ChatGPT 整合到日常工作流中的具体实践,包括合同审查、尽职调查和文件起草等场景,展示了 AI 在法律专业服务领域的实际应用价值。
Introducing Astra for Law
推出 Astra for Law
OpenAI 正式发布面向法律行业的 Astra 产品。Astra for Law 专为法律专业人士设计,支持合同分析、法律研究、案例检索等核心工作场景,并针对法律文本的准确性和合规性进行了专门优化。该产品标志着 OpenAI 在企业垂直领域战略的又一重要布局。
Helping older adults use AI in everyday life
帮助老年人将 AI 融入日常生活
OpenAI 发布了一篇关于如何帮助老年群体使用 AI 技术的文章。内容涵盖了为老年人设计友好型 AI 交互界面的最佳实践、降低技术使用门槛的方法,以及 AI 在健康管理、社交联系和日常辅助等方面的应用场景。文章强调了技术包容性的重要性,呼吁业界关注老年用户群体的需求。
Reimagining advertising with AI
用 AI 重新定义广告
OpenAI 探讨了 AI 如何重塑广告行业。文章分析了生成式 AI 在广告创意生成、个性化内容制作、投放优化和效果评估等环节的应用潜力,同时讨论了广告主和平台在采用 AI 技术时面临的挑战与伦理考量。
How to connect AI usage to business value
如何将 AI 使用与商业价值挂钩
一篇实用的指南文章,帮助企业衡量和连接 AI 应用与商业价值之间的关系。文章提供了评估 AI 投资回报的方法论,包括关键指标设定、成本效益分析和规模化部署策略,为企业管理者推进 AI 落地提供了可操作的框架。
Our framework for reporting model misalignment
我们的模型不对齐报告框架
OpenAI 公布了一套模型不对齐(misalignment)事件的报告框架,旨在建立更透明的安全事件披露机制。该框架定义了不对齐事件的分类标准、报告流程和修复跟踪机制,体现了 OpenAI 在 AI 安全治理方面的进一步制度化努力。
How workers are unlocking new ways of working
员工如何解锁新的工作方式
OpenAI 发布文章,探讨 AI 工具如何帮助各类工作者发现和创新工作方式。文章通过多个真实案例,展示了从创意工作者到技术人员如何利用 AI 提升效率、拓展能力边界,并提出了组织层面支持员工 AI 采纳的建议。
How Fyxer built an AI executive assistant people trust
Fyxer 如何打造人们信任的 AI 高管助理
OpenAI 介绍了 Fyxer 公司如何利用 AI 技术构建高管助理产品。文章重点讲述了 Fyxer 在安全性、隐私保护和用户信任方面的设计哲学,包括端到端加密、数据最小化原则和透明化 AI 决策过程等关键实践。
Perplexity trusts GPT-6 Astra with end-to-end systems
Perplexity 信任 GPT-6 Astra 构建端到端系统
OpenAI 发布案例,介绍搜索公司 Perplexity 如何利用 GPT-6 Astra 模型构建其端到端 AI 系统。文章详细描述了 Perplexity 在提升搜索准确性、减少幻觉和优化响应质量方面的技术路径,展示了企业级 AI 系统集成的最佳实践。
Rapidly scaling online storage to serve over 1 billion ChatGPT users
快速扩展在线存储以服务超过 10 亿 ChatGPT 用户
OpenAI 技术博客发布文章,详细介绍支撑 ChatGPT 超过 10 亿用户规模的存储架构扩展方案。文章涵盖了分布式存储设计、数据一致性保障、成本优化和性能调优等关键技术挑战,为大规模 AI 服务的基础设施架构提供了宝贵的工程经验。
Anthropic Blog
Improving our alignment and security efforts
改进我们的对齐与安全努力
Anthropic 发布文章,概述了公司在 AI 对齐(alignment)和安全研究方面的最新进展。内容涵盖了红队测试、对抗性评估、内部安全审查流程的改进,以及对齐研究方法论的更新。Anthropic 强调将持续投入资源确保 Claude 模型的安全性和可靠性。
Partnering with Accenture on embedded evaluation
与埃森哲合作开展嵌入式评估
Anthropic 宣布与埃森哲(Accenture)建立合作伙伴关系,将 AI 模型评估嵌入到企业客户的工作流程中。这一合作旨在帮助企业更系统地衡量 AI 工具在其特定业务场景中的表现,同时为 Anthropic 提供来自真实企业环境的反馈数据。
Introducing the Life Sciences Verification Program
推出生命科学研究验证计划
Anthropic 发布了生命科学研究验证计划(Life Sciences Verification Program),旨在与生物医学研究机构和科学家合作,确保 Claude 在生命科学领域的应用符合安全和伦理标准。该计划包括严格的访问审核、使用监控和研究合作机制。
Developing Enterprise Frontier Safeguards with our customers
与客户共同开发企业前沿安全护栏
Anthropic 介绍了与企业客户合作开发前沿 AI 模型安全护栏的进展。文章详细说明了 Anthropic 如何与客户共同制定使用政策、部署监控工具和建立应急响应机制,以确保企业级 AI 应用在享受强大能力的同时不超出安全边界。
Previewing the Model Hardware Standard
预览模型硬件标准
Anthropic 发布了模型硬件标准(Model Hardware Standard)的研究预览版,旨在建立一套评估和认证 AI 模型运行硬件安全性的框架。该标准涵盖了硬件级安全特性、可信执行环境和供应链安全等方面,为 AI 基础设施的安全保障提供了新的参考基准。
Expanding our support for scientists
扩大对科学家的支持
Anthropic 宣布扩大对科学研究社区的支持计划,包括提供更多 API 额度、建立科学家咨询委员会和资助高风险高回报的研究项目。Anthropic 希望借助科学家的专业知识,推动 AI 在医疗、气候、材料科学等领域的应用。
Funding better evaluations of AI’s impact on wellbeing
资助评估 AI 对幸福感影响的更好方法
Anthropic 宣布设立研究资助计划,支持评估 AI 技术对人类幸福感和心理健康影响的学术研究。该计划旨在填补当前 AI 影响评估中的空白,推动建立更全面的社会效益评估框架。
How Claude’s text watermark works
Claude 文本水印的工作原理
Anthropic 详细解释了 Claude 模型生成的文本中嵌入的水印技术。该技术通过在模型输出中隐藏不可见的标记,帮助识别内容是否由 AI 生成。文章介绍了水印的算法原理、嵌入方式和检测机制,以及 Anthropic 在应对水印规避攻击方面的持续努力。
Improving Fable 5’s biology safeguards
改进 Fable 5 的生物学安全护栏
Anthropic 发布了关于改进 Fable 5 模型生物学安全护栏的更新。Fable 是 Anthropic 用于研究 AI 模型在生物学领域行为的实验性模型,此次更新增强了对高风险生物学内容的识别和过滤能力,体现了 Anthropic 在 AI 生物安全方面的持续投入。
Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer
Mariano-Florentino (Tino) Cuéllar 出任 Anthropic 全球事务首席官
Anthropic 宣布前美国司法部民权助理部长、南加州大学法学教授 Mariano-Florentino Cuéllar(Tino Cuéllar)将加入公司,担任全球事务首席官(Chief Global Affairs Officer)。Cuéllar 将在 AI 政策、监管和国际合作方面发挥关键作用。
Google AI Blog
New experts join Google’s AI & Economy team
新专家加入谷歌 AI 与经济团队
Google 宣布多位新专家加入其 AI 与经济研究团队,将进一步拓展 AI 对经济影响的研究深度与广度。新成员来自经济学、计算机科学和政策研究等多个领域,将为谷歌的 AI 经济研究注入新的视角和方法论。
Co-creating the future of fashion with Google
与谷歌共创时尚未来
Google 发布文章介绍其与时尚行业的合作创新项目。在 Google Flow 时装周期间,谷歌展示了 AI 如何赋能时尚设计、个性化推荐和可持续生产,探讨了技术如何重塑这一传统行业的未来。
Making global data easier to explore
让全球数据更易探索
Google 介绍了其与联合国数据commons平台(UN Data Commons Platform)的合作,旨在让全球发展数据更易于访问和探索。该平台整合了来自多个国际组织的统计数据,为研究人员、政策制定者和公众提供了更便捷的数据分析工具。
AI for Societal Impact
AI 的社会影响
Google 发布文章综述 AI 技术在社会影响领域的广泛应用,涵盖教育公平、医疗可及性、环境保护和灾害响应等多个方向。文章强调了谷歌致力于通过 AI 技术解决重大社会挑战的承诺,并介绍了相关项目的最新进展。
Building AI to accelerate science and improve lives
构建 AI 以加速科学研究和改善生活
Google 高级副总裁 James Manyika 撰文,阐述谷歌在 AI 推动科学研究和改善人类生活方面的战略方向。文章涵盖了从基础科学研究到实际应用的全链条布局,强调了 AI 在加速科学发现、促进跨学科合作和提升生活质量方面的巨大潜力。
AI for everyone in every language
让每个人、每种语言都能使用 AI
James Manyika 发表文章,探讨谷歌如何实现 AI 的普惠化——让全球所有语言的使用者都能受益于 AI 技术。文章介绍了谷歌在多语言模型、低资源语言支持和无障碍访问方面的技术突破与未来规划。
New insights from Google’s AI & Economy ATLAS
Google AI 与经济 ATLAS 的新洞察
Google 发布了 AI 与经济 ATLAS 平台的最新研究洞察。ATLAS 是一个综合分析 AI 对经济影响的研究工具,新版本提供了更细粒度的行业分析、劳动力市场影响评估和生产力增长预测,为政策制定者和企业决策者提供了重要参考。
Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery
观看宇航员 Christina Koch 与谷歌 James Manyika 探讨太空、技术与发现
Google 发布了一段对话视频,邀请 NASA 宇航员 Christina Koch 与高级副总裁 James Manyika 探讨太空探索、技术进步和科学发现之间的关系。两人就 AI 在太空任务中的应用、技术如何拓展人类认知边界等话题进行了深入交流。
DevFest is back
DevFest 回来了
Google 宣布 DevFest 2026 开发者大会即将举行。DevFest 是 Google 面向全球开发者社区的年度盛会,涵盖 Android、Cloud、AI 和 Web 开发等多个主题,预计将吸引数千名开发者参与线上线下活动。
3 ways to prep for your next big race with Search
用 Search 做好三次大比赛准备的 3 种方式
Google Search 发布实用指南,介绍如何利用 Search 功能为即将到来的大型跑步比赛做好充分准备。文章涵盖了训练计划制定、装备选购、路线规划和营养建议等方面的搜索技巧,帮助跑者更高效地获取所需信息。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
正交性之后:德性伦理学与 AI 对齐
Peli Grietzer 发表文章,探讨在超越”正交性论题”(orthogonality thesis)之后,如何将德性伦理学(virtue ethics)引入 AI 对齐研究。文章提出,除了关注 AI 系统的目标和能力,还应考虑 AI 代理的”品格”和道德发展路径,为 AI 对齐理论提供了新的哲学视角。
AGI Is Not Multimodal
AGI 并非多模态
Benjamin A. Spiegel 撰文论证 AGI(通用人工智能)的实现并不必然依赖多模态能力。文章回顾了当前多模态 AI 的发展现状,指出单模态系统同样可能达到通用智能水平,并批评了将多模态视为 AGI 必要条件的流行观点。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中的角色变迁
Henry Kvinge 探讨了数学在机器学习研究中日益重要的角色转变。文章分析了群论、微分几何和拓扑学等数学分支如何深刻影响深度学习架构设计,并预测未来数学结构将在理解和发展 AI 模型中发挥更核心的作用。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺少什么:一种目标感
Kenneth Li 提出,当前 LLM 聊天机器人最缺失的是”目标感”(sense of purpose)。文章深入分析了人类对话中的意图驱动机制,指出当前 AI 系统缺乏内在目标和价值导向,并探讨了赋予 AI 系统目标感的可能路径及其伦理 implications。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要以幸福感为基础的 AI 积极愿景
Joel Lehman 呼吁 AI 社区构建以人类幸福感和福祉为核心的积极愿景。文章批评了当前 AI 发展过于关注能力和效率的倾向,主张将主观幸福感、社会关系和心理健康纳入 AI 评估框架,推动 AI 向更人性化的方向发展。
Financial Market Applications of LLMs
LLM 在金融市场的应用
Richard Dewey 分析了大语言模型在金融市场的多种应用场景,包括市场分析、风险评估、交易策略生成和监管合规等。文章同时指出了 LLM 在金融领域应用的独特挑战,如数据敏感性、监管要求和模型可解释性等。
A Brief Overview of Gender Bias in AI
AI 性别偏见简要概述
Yennie Jun 撰写了关于 AI 系统中性别偏见的综述文章。文章系统梳理了性别偏见在训练数据、模型设计和应用部署各阶段的产生机制,介绍了当前的检测和缓解方法,并呼吁业界采取更全面的措施应对 AI 中的性别不平等问题。
Mamba Explained
Mamba 原理解析
Kola Ayonrinde 发布了 Mamba 架构的详细解释文章。Mamba 是一种基于状态空间模型(SSM)的高效序列建模架构,以其线性计算复杂度和出色的长序列处理能力受到关注。文章从数学原理到工程实现,全面解析了 Mamba 的核心设计思想。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终让自动驾驶汽车成为现实?
Jérémy Cohen 探讨了 LLM 在自动驾驶领域的潜在应用。文章分析了 LLM 在车辆决策、场景理解和人机交互等方面的能力,同时客观评估了当前技术局限性和安全挑战,提出了”Car-GPT”概念的可能实现路径。
Do text embeddings perfectly encode text?
文本嵌入是否完美编码了文本?
Jack Morris 研究了文本嵌入(text embeddings)的信息编码能力。通过嵌入反演实验,文章探讨了嵌入向量在多大程度上能够完整保留原始文本的语义信息,揭示了当前嵌入模型在信息压缩与保留之间的权衡。
arXiv CS.AI
Regularized Emphatic Temporal-Difference Learning: Stability under Constant Stepsizes
正则化显著时序差分学习:恒定步长下的稳定性
本文研究了正则化显著时序差分(TD)学习算法在恒定步长下的稳定性问题。作者提出了新的正则化方案,证明了在恒定学习率下算法的收敛性,为强化学习中的时序差分方法提供了更坚实的理论基础。
BioPhys-Bridge: A Benchmark for Interdisciplinary Scientific Reasoning in Physics-Grounded Biological Research
BioPhys-Bridge:物理基础生物学研究的跨学科推理基准
本文提出了 BioPhys-Bridge 基准测试,用于评估 AI 模型在物理原理约束下的生物学研究推理能力。该基准涵盖了分子动力学、蛋白质折叠和生物物理模拟等多个交叉领域任务,为衡量 AI 在科学发现中的能力提供了新工具。
What Do We Expect from LLMs? Mapping the Design of LLM Benchmarks
我们对 LLM 有何期望?LLM 基准测试设计图谱
本文系统梳理了当前 LLM 基准测试的设计方法论,分析了不同基准在能力评估维度、任务设计和评估标准方面的差异。作者提出了一个统一的基准设计框架,帮助研究者更清晰地理解各基准的适用场景和局限性。
Position: It is Time to Virtualize Foundation Models with a Self-evolving Operating System Layer
立场:是时候用自进化操作系统层来虚拟化基础模型了
本文提出了一种全新的基础模型虚拟化架构——自进化操作系统层(Self-evolving OS Layer)。该架构允许基础模型像操作系统一样动态管理计算资源、适应不同任务需求并持续自我优化,为 AI 系统的部署和扩展提供了新的范式。
What Do Current Systematic Generalization Tasks Miss? A Reasoning-Centered Analysis
当前的系统泛化任务遗漏了什么?以推理为中心的分析
本文从推理角度分析了当前系统泛化(systematic generalization)评估任务的不足。作者指出,现有基准过于关注表面模式匹配,而忽视了对深层推理能力的评估,提出了改进方向和新评估维度。
Characterizing Web Search by Conversational LLM Agents: From Search Decisions and Strategies to Results and Responses
用对话式 LLM 代理表征网络搜索:从搜索决策与策略到结果与响应
本文系统分析了对话式 LLM 代理在执行网络搜索任务时的行为特征,包括搜索决策机制、搜索策略选择、结果处理和响应生成等各个环节。研究为理解和优化 AI 代理的搜索能力提供了实证基础。
Do AI Agents Understand Computer Architecture?
AI 代理理解计算机体系结构吗?
本文设计了一系列测试任务,评估当前 AI 代理对计算机体系结构概念的理解程度。实验结果表明,尽管 AI 代理能够处理基础的体系结构问题,但在涉及缓存层次、内存模型和并行计算等复杂概念时仍存在明显不足。
MAGS: Multi-agent Auto-formalization Guarantees Safety for Agentic Outputs
MAGS:多代理自动形式化保障代理输出的安全性
本文提出了 MAGS(Multi-agent Auto-formalization for Guarantees Safety)框架,利用多代理协作和自动形式化验证技术,确保 AI 代理输出的安全性。该方法能够在代理执行复杂任务时提供形式化安全保证,为高可靠性 AI 系统开发提供了新思路。
arXiv CS.CL
Modality Discrepancy Transformer for Ambivalence and Hesitancy Recognition
用于矛盾与犹豫识别的模态差异 Transformer
本文提出了一种模态差异 Transformer 模型,用于识别文本中的矛盾情绪和犹豫表达。该模型通过捕捉不同语义模态之间的差异特征,有效提升了在复杂情感分析任务中的表现。
Subliminal Prompting Beyond Static Geometry: Causal Depth and Multi-Token Confounds
超越静态几何的潜意识提示:因果深度与多令牌混淆
本文研究了潜意识提示(subliminal prompting)在 LLM 中的因果机制,指出当前研究过于依赖静态几何分析,忽视了因果深度和多令牌层面的混淆因素。作者提出了新的分析框架,为理解提示工程提供了更深入的视角。
Sampling Reveals Style: Unsupervised, Training-Free Discovery of Prompt-Conditional Stylistic Axes in LLM Activations
采样揭示风格:无监督、免训练的提示条件风格轴发现
本文提出了一种无需训练的方法,通过采样分析发现 LLM 激活中的提示条件风格轴。该方法能够自动识别模型内部与不同写作风格相关的激活模式,为风格控制和文本生成提供了新的技术路径。
What Users Think of Generative AI: A Cross-Platform NLP Analysis of Trust and Friction in App Store Reviews
用户对生成式 AI 的看法:应用商店评论中的信任与摩擦跨平台 NLP 分析
本文通过对多个应用商店中生成式 AI 应用的评论进行跨平台 NLP 分析,揭示了用户对 AI 产品的信任建立机制和使用摩擦点。研究发现,用户最关注的是 AI 输出的可靠性、隐私保护和透明度。
FakeSpotter: A content and strategy agnostic Viral Misinformation Detection Tool
FakeSpotter:内容与策略无关的病毒式虚假信息检测工具
本文介绍了 FakeSpotter,一种不依赖于特定内容类型或传播策略的病毒式虚假信息检测工具。该方法通过建模信息传播的网络结构和时序特征,实现了对各类虚假信息的通用检测能力。
Stop Removing Stopwords: How an Inherited Preprocessing Default Distorts Legal Text-as-Data
停止移除停用词:继承的预处理默认值如何扭曲法律文本数据
本文指出,NLP 领域中默认的停用词移除操作在法律文本分析中会产生严重偏差。法律文本中的”停用词”往往包含重要的语义和语用信息,盲目移除会导致分析结果失真。作者呼吁在法律 NLP 研究中重新审视预处理策略。
Neo-Classic: A Benchmark for Evaluating Linguistic-Aesthetic Reasoning in Classical Chinese Poetry
Neo-Classic:评估古典诗词语言美学推理的基准
本文提出了 Neo-Classic 基准测试,专门用于评估 AI 模型在古典诗词领域的语言美学推理能力。该基准涵盖了诗词理解、创作、鉴赏和批评等多个维度,填补了中文古典文学 AI 评估的空白。
Towards Proactive Detection of User-Side Implicit Conflicts in Human-LLM Dialogue
toward 人机对话中用户端隐性冲突的主动检测
本文研究了在人机对话中主动检测用户端隐性冲突的方法。作者提出了一种基于上下文感知和意图分析的冲突检测框架,能够在对话早期识别用户与系统之间的潜在分歧,提升对话质量和用户体验。
arXiv CS.LG
Generative Query Suggestion via Intent Coverage and Query-Level Credit Assignment
基于意图覆盖和查询级信用分配的生成式查询建议
本文提出了一种基于意图覆盖和查询级信用分配的生成式查询建议方法。该方法能够更准确地理解用户搜索意图,生成更具针对性和多样性的查询建议,提升了搜索引擎的交互体验。
Layer-wise Curriculum Learning for Efficient LLM Compression
用于高效 LLM 压缩的逐层课程学习
本文提出了逐层课程学习(Layer-wise Curriculum Learning)方法,用于高效压缩大型语言模型。该方法按照网络层的重要性顺序逐步进行压缩训练,在保持模型性能的同时显著减少了参数量和计算开销。
Block Parallelism For Efficient Distributed Long-Context Diffusion Language Model Training
用于高效分布式长上下文扩散语言模型训练的块并行
本文提出了块并行(Block Parallelism)策略,用于高效分布式训练长上下文扩散语言模型。该方法通过将模型计算块分布到多个设备上并行处理,显著提升了长序列训练的效率,为大规模语言模型训练提供了新的技术方案。
Randomized SVD Approximations for Spectral Co-Clustering of Word-Document Matrices
用于词-文档矩阵谱共聚类的随机 SVD 近似
本文研究了基于随机 SVD 近似的词-文档矩阵谱共聚类方法。该方法通过高效的随机矩阵分解技术,实现了大规模文本数据的联合聚类,在保持聚类质量的同时大幅降低了计算复杂度。
Radio-Frequency Convolutional Neural Networks
射频卷积神经网络
本文提出了射频卷积神经网络(RF-CNN),一种直接在射频信号域进行处理的神经网络架构。该方法避免了传统的模数转换步骤,在无线通信信号处理中实现了更高的效率和更低的延迟。
Learning-Induced Dynamical Transition in Recurrent Neural Networks
学习诱导的循环神经网络动力学转变
本文研究了循环神经网络(RNN)在学习过程中发生的动力学转变现象。作者发现,随着训练的进行,RNN 的动力学行为会从混沌态逐渐过渡到有序态,这一转变对理解深度学习优化过程具有重要意义。
Personalized Federated Hierarchical Gaussian Processes for Privacy-Preserving Modeling of Heterogeneous Distributed Systems
用于异构分布式系统隐私保护建模的个性化联邦分层高斯过程
本文提出了个性化联邦分层高斯过程(Personalized Federated Hierarchical Gaussian Processes),用于在保护隐私的前提下对异构分布式系统进行建模。该方法结合了联邦学习的隐私保护特性和高斯过程的灵活建模能力,适用于数据分布不均的分布式场景。
How to Guide Your Language Flow
如何引导你的语言流
本文从理论和实践两个层面探讨了如何引导语言模型的语言生成流。作者提出了基于注意力机制和隐状态控制的引导方法,为文本生成的一致性和连贯性提供了新的技术思路。
arXiv CS.CV
Open ultrasound foundation model for robust segmentation and clinical measurement across heterogeneous settings
面向异构场景鲁棒分割与临床测量的开放超声基础模型
本文提出了一个开放的超声影像基础模型,能够在不同设备和场景下实现鲁棒的超声图像分割和临床测量。该模型在多个公开数据集上进行了验证,展现了良好的泛化能力和临床应用潜力。
RAUL: Reference-Assisted Ureteroscopy Localization for Skill Assessment
RAUL:用于技能评估的参考辅助输尿管镜定位
本文提出了 RAUL 系统,通过参考辅助技术实现输尿管镜手术中的精确定位,用于评估外科医生的操作技能。该系统利用 AI 视觉技术实时分析手术视频,为医学培训和质量控制提供了新的工具。
Can Vision-Language Models Judge Olympic Diving? From Reasoning to Scores in Zero-Shot Action Quality Assessment
视觉语言模型能评判奥运跳水吗?从零样本动作质量评估到评分
本文探索了视觉语言模型在奥运跳水动作质量评判中的应用。研究展示了 VLM 如何在零样本设置下,从动作推理到最终评分,为体育裁判辅助系统提供了新的技术路径。
Open-vocabulary 3D object detection with promptable segmentation
基于可提示分割的开放词汇 3D 目标检测
本文提出了一种结合可提示分割的开放词汇 3D 目标检测方法。该方法允许用户通过自然语言提示来识别和分割 3D 场景中的未知类别物体,扩展了 3D 视觉系统的灵活性和实用性。
LinePilot Digitizer: Line-Plot Recovery with Manual and Automatic Calibration
LinePilot Digitizer:手动与自动校准的线图恢复
本文介绍了 LinePilot Digitizer,一种能够从纸质图表中恢复线图的数字化工具。该方法支持手动和自动两种校准模式,能够高精度地从扫描图像中提取数据曲线,为科学研究中的数据复用提供了便利。
Riemannian—Lorentz Fusion of Vision Transformers and State-Space Models
视觉 Transformer 与状态空间模型的黎曼-洛伦兹融合
本文提出了一种黎曼-洛伦兹融合方法,将视觉 Transformer 与状态空间模型(SSM)相结合。该方法在几何空间中对两种架构的优势进行融合,在图像分类和序列建模任务上均取得了优异性能。
WZPlanner: Safe End-to-End Path Planning for Autonomous Driving in Work Zones
WZPlanner:施工区域自动驾驶的安全端到端路径规划
本文提出了 WZPlanner,一种面向施工区域的自动驾驶安全端到端路径规划系统。该方法能够实时感知施工区域的动态障碍物和临时交通标志,为自动驾驶车辆在施工区域的安全通行提供了可靠解决方案。
RGS: Reflection-aware Gaussian Splatting via Learning Geometry Continuity for Reflective Objects
RGS:通过学习几何连续性实现反射物体的反射感知高斯溅射
本文提出了 RGS(Reflection-aware Gaussian Splatting),一种专门针对反射物体的高斯溅射 3D 重建方法。该方法通过学习几何连续性约束,有效处理了反射表面的重建难题,提升了渲染质量。
DeepMind Blog
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking
DeepMind 正式发布 Gemini 3.8 Live 系列模型,包括标准版和 Extended Thinking(扩展思维)版本。Gemini 3.8 Live 在实时推理和多轮对话方面进行了显著优化,Extended Thinking 版本则专门针对复杂推理任务,能够进行更深层次的思考和分析。
AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome
AlphaGenome Atlas:人类基因组中每种可能 DNA 碱基变化的预测图谱
DeepMind 发布了 AlphaGenome Atlas,这是首个覆盖人类基因组中所有可能单碱基变化的预测图谱。该图谱利用 AlphaFold 系列技术,能够预测每种 DNA 碱基变异对基因功能和蛋白质结构的影响,为精准医学和遗传学研究提供了强大工具。
Introducing WeatherNext 3, our most advanced and accurate global weather AI model
推出 WeatherNext 3:最先进精准的全球气象 AI 模型
DeepMind 发布了 WeatherNext 3,这是目前最先进、最准确的全球气象预测 AI 模型。WeatherNext 3 在多项基准测试中超越了传统数值天气预报方法,能够提供更精确的短期和中期天气预报,对防灾减灾和农业生产具有重要价值。
Proactive cyber defense for governments and enterprises
为政府和企业提供主动网络防御
DeepMind 推出了面向政府和企业客户的主动网络防御解决方案。该方案利用 AI 技术实时监测和预测网络威胁,在攻击发生前主动识别和阻断潜在风险,为关键基础设施和企业数据资产提供更强有力的保护。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
推出 Gemini 3.8 Flash 和 3.8 Flash Cyber
DeepMind 同时发布了 Gemini 3.8 Flash 系列模型,包括标准版和 Cyber(网络安全)专用版。Flash 版本在保持高性能的同时大幅提升了推理速度,适合对延迟敏感的应用场景。Cyber 版本则专门针对网络安全任务进行了优化。
Introducing agentic video understanding with Gemini
用 Gemini 推出代理式视频理解
DeepMind 介绍了基于 Gemini 的代理式视频理解能力。该功能使 AI 能够像人类一样主动探索和分析视频内容,通过多轮交互和推理,深入理解视频中的事件、动作和因果关系,为视频分析和内容理解开辟了新的可能性。
Gemini Omni 1.1 Flash lets you build with more control
Gemini Omni 1.1 Flash 让你构建时拥有更多控制力
DeepMind 发布了 Gemini Omni 1.1 Flash,在提供强大多模态能力的同时,赋予开发者更精细的控制能力。新版本支持更细粒度的参数调节、更灵活的输出格式控制和更稳定的推理表现,适合对精度和可控性要求较高的应用场景。
Piloting the world’s first double-blind AI evaluations
试点全球首个双盲 AI 评估
DeepMind 启动了全球首个双盲 AI 评估试点项目。在该评估体系中,评估者和被评估者均不知道模型的身份信息,旨在消除品牌偏见,更客观地衡量 AI 模型的真实能力。这一创新评估方法有望推动 AI 评测标准的规范化。
Intelligent transcription with Gemini 3.5 Transcribe
用 Gemini 3.5 Transcribe 实现智能转录
DeepMind 介绍了 Gemini 3.5 Transcribe 的智能转录功能。该工具不仅能够高精度地将语音转换为文字,还能自动识别说话人、提取关键信息、生成摘要和识别专业术语,适用于会议记录、采访整理和内容创作等多种场景。
From Atari to EVE Online: Building on 15 Years of AI Research in Games
从 Atari 到 EVE Online:15 年游戏 AI 研究的积淀
DeepMind 回顾了过去 15 年在游戏 AI 领域的研究历程,从早期的 Atari 游戏到复杂的 MMORPG《EVE Online》。文章总结了游戏作为 AI 研究平台的重要价值,以及这些研究成果如何反哺通用 AI 技术的发展。
Meta Engineering
ZGateway: Learnings from Putting a Proxy in Front of ZippyDB
ZGateway:在 ZippyDB 前部署代理的经验总结
Meta 工程团队分享了在 ZippyDB 数据库前部署 ZGateway 代理的经验。文章详细介绍了代理层的设计决策、性能优化策略和在实际生产环境中遇到的问题及解决方案,为大规模数据库代理服务的设计提供了宝贵参考。
An Organizational Second Brain: Building an AI That Learns From Experts
组织第二大脑:构建向专家学习的 AI
Meta 介绍了”组织第二大脑”项目,旨在构建一个能够从内部专家知识中学习的 AI 系统。该系统通过捕捉专家的工作决策过程和知识推理路径,形成可检索、可复用的组织知识资产,帮助团队成员快速获取专家级指导。
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet
MetaRoCE:为 AI 规模以太网构建的新型 RDMA 传输协议
Meta 发布了 MetaRoCE,一种专为 AI 训练规模设计的 RDMA over Converged Ethernet 传输协议。MetaRoCE 针对大规模分布式 AI 训练的网络需求进行了优化,在带宽利用率、延迟和可扩展性方面均表现出色。
MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines
MTIA 300:Meta 首款内置网卡和通信卸载引擎的训练芯片
Meta 介绍了 MTIA 300 训练芯片,这是 Meta 首款内置网络接口卡(NIC)和通信卸载引擎的 AI 训练芯片。该设计显著减少了 AI 训练中的通信开销,提升了大规模分布式训练的整体效率。
How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees
如何在 WhatsApp 上构建诈骗警报:端到端加密与可验证性保障
Meta 详细介绍了在 WhatsApp 上构建诈骗警报系统(Scam Alert)的技术方案。该系统在端到端加密的前提下,通过可验证的加密机制识别和警告潜在诈骗消息,在保护用户隐私的同时提升了平台安全性。
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
Meta 分享了其广告排序系统的多阶段架构设计。该系统从用户行为序列出发,结合缩放定律(scaling laws)优化各阶段模型,实现了从粗筛到精排的完整广告推荐流程,显著提升了广告相关性和投放效果。
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
GEM 训练:Meta 如何将 LLM 规模广告基础模型的效率提升一倍
Meta 介绍了 GEM(Generative Engine for Meta)训练方法,成功将 LLM 规模广告基础模型的训练效率提升了一倍。该方法通过创新的分布式训练策略和梯度优化技术,在保持模型质量的同时大幅降低了训练成本。
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
探索分层兴趣表示以优化 Meta 广告深层转化漏斗
Meta 研究了分层兴趣表示方法在广告深层转化漏斗优化中的应用。该方法通过构建多层次的用户兴趣表示,更准确地捕捉用户从认知到转化的完整决策路径,提升了广告在深层转化目标上的表现。
Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler
用开源内核调度器现代化 Meta 广告服务平台
Meta 介绍了使用开源内核调度器现代化广告服务平台的进展。新的调度器显著提升了广告服务的资源利用效率和响应速度,同时通过开源方式促进了社区协作和技术创新。
Towards Data Science
Coding Agents Keep Shipping Silent Failures — Here Is How to Catch Them
编码代理持续交付静默失败——如何捕捉它们
本文探讨了 AI 编码代理(如 GitHub Copilot、Cursor 等)在生成代码时可能产生的”静默失败”问题——即代码看似正确运行,但存在隐藏的逻辑错误或安全漏洞。作者提供了一套检测和预防策略,帮助开发者识别和修复这些问题。
We Pinned Our Model Version to Stay Safe. The Provider Deprecated It Anyway.
我们锁定模型版本以求安全,但提供商最终还是弃用了它
本文讲述了一个关于模型版本管理的真实案例。作者团队为确保生产环境稳定性而锁定了特定模型版本,但 AI 服务提供商最终还是弃用了该版本,导致系统出现问题。文章引发了对 AI 服务依赖风险和版本管理策略的深入讨论。
Starting a Career in Data Science in the Age of AI
AI 时代开启数据科学职业生涯
本文探讨了在 AI 快速发展的时代,如何开启数据科学职业生涯。作者分析了 AI 工具对数据科学工作的影响,提出了新的技能需求和学习路径建议,为初入该领域的从业者提供了实用指导。
Multi-Agent Coding Isn’t Enough — Agents Need a Commitment Layer
多代理编码还不够——代理需要一个承诺层
本文提出,单纯的多代理协作编码并不足够,AI 代理系统需要一个”承诺层”(commitment layer)来确保代理间协作的一致性和可靠性。作者设计了承诺层的架构方案,并讨论了其在实际编码场景中的应用效果。
Building a Data Lakehouse with DuckDB and DuckLake
使用 DuckDB 和 DuckLake 构建数据湖仓
本文介绍了如何使用 DuckDB 和 DuckLake 构建现代化的数据湖仓架构。DuckLake 作为 DuckDB 的表格式解决方案,使得在对象存储上直接进行高性能分析成为可能,为数据架构师提供了轻量级且高效的湖仓一体方案。
How I Built a Multi-Agent System for Interrupted Time Series Analysis (ITSA)
我如何构建用于中断时间序列分析(ITSA)的多代理系统
本文分享了作者构建多代理系统用于中断时间序列分析(ITSA)的实践经历。该系统利用多个 AI 代理协作完成数据预处理、模型选择、参数估计和结果解释等分析步骤,显著提升了 ITSA 的自动化程度和分析效率。
Why You Think Like a Bayesian but Were Taught Like a Frequentist
为何你的思维方式是贝叶斯的,但学习过程却是频率派的
本文探讨了统计学教育中的一个经典矛盾:大多数人在直觉上以贝叶斯方式思考(不断更新信念),但学术教育却主要教授频率派统计方法。作者分析了这一差距的根源,并提出了改进统计学教学的建议。
When Does Graph RAG Actually Add Value? A Hands-On Experiment
Graph RAG 何时真正创造价值?一项动手实验
本文通过实际实验评估了 Graph RAG(基于知识图谱的检索增强生成)的价值。研究发现,Graph RAG 在涉及复杂关系推理和多跳查询的场景中显著优于传统 RAG,但在简单事实检索场景中优势不明显,为实际应用提供了明确的指导。
How to Make Linear Regression Survive Outliers
如何让线性回归在异常值中生存
本文介绍了多种处理线性回归中异常值的技术方法,包括稳健回归、数据变换、异常值检测和加权最小二乘法等。作者通过实际案例展示了不同方法的效果对比,帮助数据科学家在面对异常值时做出合适的选择。
Silent Broadcasting Can Ruin Your Model
静默广播会毁掉你的模型
本文揭示了”静默广播”(silent broadcasting)——即在数据处理过程中 unnoticed 的隐式广播操作——对机器学习模型性能的潜在危害。作者通过实例展示了这类问题如何导致模型训练结果偏差,并提供了检测和预防的方法。