2026-09-18
今日要点
- DeepMind 发布 Gemini 3.8 系列模型,包括 Live、Flash 和 Cyber 版本,同时推出 AlphaGenome Atlas 基因组预测图谱和 WeatherNext 3 天气模型。
- OpenAI 推出 Astra for Law 法律专用 AI 工具,并分享 GPT-6 Astra 在 Perplexity、Cognition 等公司的落地案例。
- Anthropic 发布多项安全与合规举措,包括模型硬件标准预览、生命科学验证计划及 Claude 文本水印技术。
- Meta 工程团队分享多项基础设施进展,包括 MTIA 300 训练芯片、ZGateway 代理架构及 WhatsApp 反诈骗系统。
- Google AI 发布联合国数据共享平台,并推出 Gemini 3.8 Live Extended Thinking 等新产品。
Hacker News
Hister: A private search engine for the pages you visit and the files you keep
Hister:专注于个人页面与文件的私密搜索引擎
Hister 是一个开源的私密搜索引擎项目,旨在帮助用户搜索自己访问过的网页和保存的文件。该项目托管在 GitHub 上,由 asciimoo 开发,强调隐私保护,不追踪用户行为,适合对个人数据敏感的用户群体。
How GLM built its own inference infrastructure
GLM 如何构建自己的推理基础设施
本文介绍了智谱 AI(GLM)团队如何从零开始搭建自己的大模型推理基础设施。内容涵盖推理服务架构设计、性能优化策略以及在实际生产环境中遇到的挑战和解决方案,为其他 AI 公司构建推理系统提供了有价值的参考。
One year of sponsored Servo development
赞助 Servo 开发一周年
Servo 浏览器引擎项目发布了赞助开发一周年回顾文章,总结了通过赞助模式推动 Servo 技术进展的成果与经验。文章讨论了开源浏览器引擎的可持续发展模式,以及社区和企业合作对技术演进的重要作用。
CCC invites all model citizens to 40C3
CCC 邀请所有”模范公民”参加 40C3 大会
德国计算机俱乐部(CCC)发布了 40C3 大会的邀请函,主题为”模范公民”(Model Citizens)。作为全球最大的黑客与技术盛会之一,40C3 将继续聚焦网络安全、隐私保护和数字权利等议题,吸引全球技术爱好者参与。
Neovim have a ~$800k Bitcoin donation sitting untouched since 2023
Neovim 自 2023 年以来一直有一笔约 80 万美元的比特币捐赠未被动用
Neovim 编辑器项目自 2023 年收到一笔约 80 万美元的比特币捐赠以来,这笔资金一直未被使用。这一情况引发了社区关于开源项目资金管理、加密货币捐赠处理以及长期财务规划的讨论。
Iran school bombing: grounds to believe US was behind atrocity, UN finds
联合国调查:有理由相信美国与伊朗学校爆炸事件有关
联合国调查机构发布报告,指出有合理依据认为美国与伊朗一所学校发生的爆炸袭击事件有关。该报道引发了国际社会对中东地区紧张局势的广泛关注,各方正在就事件真相和责任归属展开进一步调查。
Keys Not Included: recovering the signing keys for US driver’s license barcodes
密钥未附:恢复美国驾照条形码签名密钥
研究人员发表了一篇技术博客文章,详细描述了如何恢复美国驾照条形码中使用的签名密钥。这一发现揭示了驾照安全系统中存在的关键漏洞,可能对身份验证安全和隐私保护产生重要影响。
Canada welcomes EU proposal to become ‘associate member’
加拿大欢迎成为欧盟”关联成员”的提案
加拿大政府对欧盟提出的让其成为”关联成员”(associate member)的提案表示欢迎。这一外交动向反映了加拿大在贸易和政策层面寻求与欧盟建立更紧密关系的意愿,尤其是在当前全球贸易格局变化的背景下。
AI safety is mostly a sex cult
AI 安全领域大多是一个”性邪教”
一篇引发争议的博客文章声称,AI 安全研究领域在某种程度上类似于”性邪教”。文章对 AI 安全社区的文化、权力结构和意识形态提出了尖锐批评,在技术社区内引发了广泛讨论和不同观点的碰撞。
Australia says it could follow Canada in forging deeper ties with EU
澳大利亚表示可能效仿加拿大,与欧盟建立更紧密关系
澳大利亚政府表示,可能效仿加拿大的做法,与欧盟建立更深层次的伙伴关系。这一外交政策动向反映了亚太地区国家在当前国际格局下寻求多元化外交关系的趋势,以及对欧盟市场和技术标准的重视。
HarnessTax: How Much Does the Harness Matter for Coding Agents?
HarnessTax:Harness 对编程智能体有多重要?
HarnessTax 项目研究了一个关键问题:在编程智能体(coding agents)的开发和使用中,“Harness”(即控制和约束框架)的重要性究竟有多大。该研究为 AI 编程助手的安全性和有效性提供了新的视角。
OpenSpec – A lightweight and configurable AI spec framework
OpenSpec——轻量级可配置的 AI 规范框架
OpenSpec 是一个轻量级且可配置的 AI 规范框架,旨在帮助开发者和团队更好地定义、管理和验证 AI 系统的行为规范。该项目为 AI 应用的标准化开发提供了实用的工具和方法论支持。
Cloudflare/Security-Audit-Skill
Cloudflare 安全审计技能工具
Cloudflare 开源了一个安全审计技能工具(Security-Audit-Skill),用于帮助开发者和安全团队更系统地审计代码库的安全问题。该工具整合了多种安全检测能力,提升了安全审计的效率和覆盖范围。
I Don’t Like LLMs
我不喜欢大语言模型
Martin Fowler 发表了一篇题为《我不喜欢 LLMs》的文章,表达了他对当前大语言模型技术发展趋势的担忧和批评。文章探讨了 LLM 在技术、社会和伦理层面的局限性,引发了关于 AI 发展方向的深入思考。
Why I didn’t sign the Fields medallists’ letter
我为何没有签署菲尔兹奖得主的联名信
著名数学家 Timothy Gowers 发表文章解释了他为何没有签署菲尔兹奖得主们的联名信。文章涉及学术界、科学政策以及公共声明背后的复杂考量,展现了学者们在公共事务中的独立思考和审慎态度。
OpenAI Blog
Introducing Astra for Law
推出 Astra for Law 法律专用 AI 工具
OpenAI 正式发布了 Astra for Law,这是专为法律行业设计的 AI 工具。该工具旨在帮助律师和法律专业人士更高效地处理法律文档、案例研究和合同审查等工作,通过 AI 技术提升法律服务的效率和质量。
Helping older adults use AI in everyday life
帮助老年人将 AI 融入日常生活
OpenAI 发布了一篇关于如何帮助老年人使用 AI 技术的文章,介绍了针对老年用户群体设计的 AI 应用策略。内容涵盖界面简化、语音交互优化以及降低技术使用门槛的具体方法,体现了 AI 普惠化的重要方向。
Reimagining advertising with AI
用 AI 重新定义广告
OpenAI 探讨了 AI 技术如何重塑广告行业,从创意生成、精准投放到效果评估的全流程优化。文章分析了 AI 在广告领域的实际应用案例和未来发展趋势,展示了技术驱动营销变革的巨大潜力。
How to connect AI usage to business value
如何将 AI 使用与商业价值挂钩
OpenAI 分享了将 AI 应用与商业价值有效连接的方法论。文章提供了实用的框架和案例,帮助企业衡量 AI 投资的实际回报,确保技术投入能够转化为可量化的业务成果和竞争优势。
Our framework for reporting model misalignment
我们的模型不对齐报告框架
OpenAI 发布了一套模型不对齐(misalignment)事件的报告框架,旨在建立更透明的 AI 安全事件通报机制。该框架为研究人员、开发者和监管机构提供了标准化的报告流程,有助于提升 AI 系统的安全性和可信度。
How workers are unlocking new ways of working
员工如何解锁新的工作方式
OpenAI 探讨了 AI 技术如何帮助员工发现和采用新的工作方式。文章通过实际案例展示了 AI 助手在提升工作效率、激发创新思维和优化工作流程方面的作用,描绘了人机协作的未来图景。
How Fyxer built an AI executive assistant people trust
Fyxer 如何打造人们信任的 AI 高管助手
OpenAI 介绍了 Fyxer 公司如何利用 AI 技术构建高管助手产品。文章重点讲述了 Fyxer 在建立用户信任方面的策略,包括透明度设计、可靠性保障和隐私保护等关键要素,为 AI 助手产品的开发提供了宝贵经验。
Perplexity trusts GPT-6 Astra with end-to-end systems
Perplexity 将端到端系统托付给 GPT-6 Astra
Perplexity 宣布在其端到端系统中采用 GPT-6 Astra 模型,以提升搜索和问答的准确性。这一合作展示了 GPT-6 Astra 在复杂任务处理方面的强大能力,也反映了 AI 搜索领域对更高精度和可靠性的持续追求。
Rapidly scaling online storage to serve over 1 billion ChatGPT users
快速扩展在线存储以服务超过 10 亿 ChatGPT 用户
OpenAI 分享了如何快速扩展在线存储基础设施以支持超过 10 亿 ChatGPT 用户的技术实践。文章详细介绍了存储架构设计、性能优化策略和大规模数据管理方案,为超大规模 AI 服务的基础设施搭建提供了重要参考。
Cognition helps Devin test its own work with GPT‑6 Astra
Cognition 利用 GPT-6 Astra 帮助 Devin 测试自身工作
Cognition 公司利用 GPT-6 Astra 为其 AI 编程助手 Devin 构建自我测试系统。这一创新方法使 Devin 能够在开发过程中自主验证代码质量,显著提升了 AI 编程工具的可靠性和实用性。
Anthropic Blog
Improving our alignment and security efforts
改进我们的对齐与安全努力
Anthropic 发布了关于改进 AI 对齐和安全工作的最新进展报告。文章详细介绍了公司在价值对齐、红队测试和安全评估等方面的新举措,展示了其对负责任 AI 发展的持续承诺。
Introducing the Life Sciences Verification Program
推出生命科学验证计划
Anthropic 推出了生命科学验证计划(Life Sciences Verification Program),旨在确保其 AI 模型在生物科学研究中的应用符合安全和伦理标准。该计划为从事生命科学研究的机构提供了经过验证的 AI 工具使用指南。
Developing Enterprise Frontier Safeguards with our customers
与客户共同开发企业前沿安全保障
Anthropic 分享了与客户合作开发企业级 AI 安全保障机制的经验。文章介绍了前沿模型在企业环境中的安全部署策略,包括访问控制、内容过滤和审计追踪等关键安全措施。
Previewing the Model Hardware Standard
预览模型硬件标准
Anthropic 发布了模型硬件标准(Model Hardware Standard)的研究预览,旨在建立 AI 模型运行硬件的安全和性能基准。这一标准有助于确保不同硬件平台上 AI 模型的一致性和安全性。
Expanding our support for scientists
扩大对科学家的支持
Anthropic 宣布扩大对科学研究人员的支持计划,包括提供更多 AI 工具访问权限、研究资金和技术指导。这一举措旨在促进 AI 技术在科学研究中的负责任应用,加速科学发现进程。
Funding better evaluations of AI’s impact on wellbeing
资助更好的 AI 对幸福感影响评估
Anthropic 宣布资助关于 AI 对人类幸福感影响的研究评估项目。该计划旨在通过严谨的科学研究,深入理解 AI 技术对社会福祉的正面和负面影响,为政策制定提供实证依据。
How Claude’s text watermark works
Claude 文本水印技术详解
Anthropic 详细介绍了 Claude 模型生成的文本水印技术的工作原理。该技术通过在 AI 生成内容中嵌入不可见的标记,帮助识别内容是否由 AI 生成,对于防止滥用和促进内容溯源具有重要意义。
Improving Fable 5’s biology safeguards
改进 Fable 5 的生物学安全保障
Anthropic 发布了改进 Fable 5 模型生物学安全保障措施的最新进展。文章介绍了新增的安全过滤机制和风险评估流程,确保模型在生物科学领域的应用更加安全可靠。
Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer
Mariano-Florentino (Tino) Cuéllar 将出任 Anthropic 全球事务首席官
Anthropic 宣布任命 Mariano-Florentino (Tino) Cuéllar 为全球事务首席官(Chief Global Affairs Officer)。Cuéllar 拥有丰富的国际事务和政策制定经验,将负责推动 Anthropic 在全球范围内的政策对话和合作。
Investigating three real-world incidents in our cybersecurity evaluations
调查网络安全评估中的三个真实事件
Anthropic 分享了在网络安全评估中发现的三个真实事件案例。文章详细分析了这些事件的技术细节、潜在风险以及相应的缓解措施,为 AI 系统的安全评估提供了宝贵的实践经验。
Google AI Blog
Making global data easier to explore
让全球数据更易探索
Google 发布了联合国数据共享平台(UN Data Commons Platform),旨在让全球数据更加易于探索和访问。该平台整合了联合国系统的多源数据,为研究人员和政策制定者提供了强大的数据分析工具。
AI for Societal Impact
AI 的社会影响
Google 发布了关于 AI 社会影响的综合报告,探讨了人工智能技术在教育、医疗、环境保护等社会关键领域的应用成果和挑战。文章强调了负责任的 AI 发展对社会进步的深远意义。
Building AI to accelerate science and improve lives
构建 AI 以加速科学进步和改善生活
Google 高管 James Manyika 发表文章,阐述了 Google 如何通过 AI 技术加速科学研究并改善人类生活。文章介绍了多个 AI 驱动的科学发现案例,展示了技术向善的实践路径。
AI for everyone in every language
让每个人都能用每种语言使用 AI
Google 发布了推动 AI 多语言化的战略计划,旨在让全球所有语言的用户都能平等地享受 AI 技术带来的便利。该计划包括低资源语言的支持、翻译技术的突破以及本地化内容的建设。
New insights from Google’s AI & Economy ATLAS
Google AI 与经济 ATLAS 的新洞察
Google 发布了 AI 与经济 ATLAS 项目的最新研究成果,提供了关于 AI 对全球经济影响的深入分析。报告涵盖了生产力变化、就业市场转型和经济增长模式等多个维度的数据洞察。
Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery
观看宇航员 Christina Koch 与 Google 的 James Manyika 探讨太空、技术与发现
Google 发布了一段视频,记录了宇航员 Christina Koch 与公司高管 James Manyika 关于太空探索、技术创新和科学发现的对话。内容涵盖了 AI 在太空任务中的应用前景和人类探索宇宙的未来愿景。
DevFest is back
DevFest 回来了
Google 宣布 DevFest 开发者大会回归,这是 Google 面向全球开发者的重要年度活动。DevFest 将展示最新的开发工具、技术趋势和社区创新,为开发者提供学习和交流的平台。
3 ways to prep for your next big race with Search
用 Search 为下一次重要比赛做准备的 3 种方式
Google Search 发布了一篇实用指南,介绍了如何利用 Search 功能为跑步比赛等体育赛事做好充分准备。内容涵盖训练计划制定、路线规划和赛事信息获取等方面的技巧。
Get ready for the game with new football features in Search
用 Search 新功能为比赛做好准备
Google Search 推出了新的足球功能,为用户提供更丰富的赛事信息、球员数据和战术分析。这些新功能旨在提升足球爱好者的搜索体验,让他们更便捷地获取感兴趣的足球相关内容。
Recreating a 70-year love story frame by frame
逐帧重现一段 70 年的爱情故事
Google 发布了一个创意项目,利用 AI 技术逐帧重现了一段跨越 70 年的爱情故事。该项目展示了 AI 在图像生成和视频制作领域的创新应用,体现了技术与人文情感的深度融合。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
正交性之后:德性伦理代理与 AI 对齐
本文探讨了 AI 对齐问题中的德性伦理学视角,提出在超越传统正交性论题后,应当从德性伦理的角度重新思考 AI 代理的道德属性和对齐目标。文章为 AI 安全研究提供了新的哲学框架。
AGI Is Not Multimodal
AGI 并非多模态
作者 Benjamin A. Spiegel 论证了通用人工智能(AGI)并不必然需要多模态能力。文章从认知科学和 AI 理论的角度分析了单模态系统达到 AGI 水平的可能性,挑战了当前多模态主导的研究范式。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中的角色变迁
本文回顾了数学在机器学习研究中角色的演变,特别关注几何形状、对称性和结构概念如何深刻影响模型设计和训练过程。文章强调了数学直觉在推动 ML 理论进步中的核心作用。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺少什么:一种目标感
作者 Kenneth Li 指出当前大语言模型聊天机器人缺乏的核心要素是”目标感”。文章深入分析了有目标感的智能体与无目标聊天机器人之间的本质区别,并探讨了赋予 AI 系统目标感的技术路径。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要以幸福感为基础的 AI 积极愿景
作者 Joel Lehman 呼吁 AI 社区构建以人类幸福感为核心的积极愿景。文章批评了当前 AI 发展过于关注能力增长而忽视福祉影响的倾向,提出了以 wellbeing 为导向的 AI 发展框架。
Financial Market Applications of LLMs
LLM 在金融市场的应用
本文系统综述了大语言模型在金融市场的各类应用场景,包括市场分析、风险评估、交易策略生成和合规审查等。文章评估了 LLM 在金融领域的实际效果和潜在风险。
A Brief Overview of Gender Bias in AI
AI 性别偏见简要概述
作者 Yennie Jun 提供了 AI 性别偏见的全面概述,涵盖了偏见产生的根源、在各类 AI 系统中的表现形式以及缓解策略。文章强调了消除性别偏见对于构建公平 AI 系统的重要性。
Mamba Explained
Mamba 架构详解
本文对 Mamba 序列建模架构进行了深入浅出的解释。Mamba 是一种新型的状态空间模型(SSM),在保持线性计算复杂度的同时实现了长序列建模的有效能力,被认为是 Transformer 的有力替代方案。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终让自动驾驶汽车成为现实?
作者 Jérémy Cohen 探讨了大语言模型在自动驾驶汽车领域的应用潜力。文章分析了 LLM 在车辆控制、场景理解和决策制定等方面的能力边界,评估了”Car-GPT”概念的可行性与挑战。
Do text embeddings perfectly encode text?
文本嵌入是否完美编码了文本?
作者 Jack Morris 研究了文本嵌入(text embeddings)对文本信息的编码完整性问题。通过嵌入反演实验,文章揭示了当前嵌入模型在信息保留方面的局限性和潜在的信息损失。
arXiv CS.AI
Making AI-Assisted Claims Independently Challengeable: Publication Authority and a Protocol for Falsifiable Publication Records
使 AI 辅助声明可独立质疑:出版权威与可证伪出版记录协议
本文提出了一种使 AI 辅助研究声明可被独立质疑的框架,包括出版权威机制和可证伪的出版记录协议。该方案旨在提升 AI 辅助研究的透明度和可验证性。
EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents
EvolveTrade:经验驱动的策略优化用于自进化 LLM 交易智能体
EvolveTrade 是一种面向自进化 LLM 交易智能体的经验驱动策略优化方法。该框架使交易智能体能够从历史交易经验中持续学习和改进策略,提升金融市场的自动化交易能力。
One Color Preprocessing Improves DSATUR
单色预处理改进 DSATUR 图着色算法
本文提出了一种基于单色预处理的图着色算法优化方法,改进了经典的 DSATUR 算法。实验表明该方法在多种图结构上都能获得更优的着色结果。
Physics-Constrained Digital Twins for Sensor Integrity in Urban Pedestrian Flow: Detecting Stealthy False Data Injection with Conformal Guarantees
物理约束数字孪生用于城市行人流传感器完整性:带保形保证的检测隐蔽式假数据注入
本文提出了基于物理约束的数字孪生方法,用于检测城市行人流系统中的隐蔽式假数据注入攻击。该方法利用保形预测提供统计保证,有效识别传感器数据中的异常注入。
What You Can’t See Is Still What You Learn: A Preregistered Sixty-Society Confirmation That Evidence Masking Drives Compositional Generalization
看不见的仍是所学:预注册的六十社会确认证据遮蔽驱动组合泛化
这是一项跨六十个社会的预注册研究,确认了证据遮蔽(evidence masking)机制在驱动组合泛化中的关键作用。研究结果为理解 AI 系统的泛化能力提供了重要的跨文化实证支持。
CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video
CapMem:基于描述的自中心视频情景记忆基准
CapMem 是一个针对自中心视频中基于描述的情景记忆的评估基准。该基准为衡量 AI 系统理解和记忆第一人称视角视频内容的能力提供了标准化的测试框架。
GraphEcho: Structural Redundancy and Evidence Provenance in LLM Graph Agents
GraphEcho:LLM 图智能体中的结构冗余与证据溯源
GraphEcho 研究了 LLM 图智能体中的结构冗余问题和证据溯源机制。该工作为提升图智能体的可靠性和可解释性提供了新的技术方案。
GVD: Governed Versioning and Deduplication for Document Repositories
GVD:文档仓库的治理版本控制与去重
GVD 提出了一种面向文档仓库的治理版本控制和去重方案。该方法在确保文档版本一致性的同时有效减少冗余存储,适用于大规模文档管理系统。
arXiv CS.CL
Enhancing Extubation Failure Prediction with LLM-Derived Features from Respiratory Therapy Clinical Notes
利用呼吸治疗临床笔记中的 LLM 衍生特征增强拔管失败预测
本文利用大语言模型从呼吸治疗临床笔记中提取特征,用于增强拔管失败预测的准确性。该方法展示了 LLM 在医疗文本分析中的实用价值。
Faking Good and Faking Bad in LLMs: Response Distortion Across Dark Triad Personality Traits
LLM 中的”装好”与”装坏”:黑暗三联征人格特质下的响应扭曲
本研究探讨了 LLM 在不同黑暗三联征(Dark Triad)人格特质诱导下的响应扭曲行为,分析了模型在”装好”和”装坏”两种情境下的表现差异,揭示了 LLM 在人格模拟方面的潜在风险。
DANTINOX: A Unified Framework for Multi-Paradigm Language Modeling
DANTINOX:多范式语言建模的统一框架
DANTINOX 提出了一种统一的多范式语言建模框架,整合了多种语言建模方法的优势。该框架为构建更灵活和强大的语言模型提供了新的技术路径。
Think Before You Comfort: Reflective Cognitive Alignment for Protocol-Grounded Elderly Stimulation Agents
安慰前先思考:基于协议的老年人刺激代理的反思性认知对齐
本文提出了面向老年人护理 AI 代理的反思性认知对齐方法,强调在提供情感支持前进行协议驱动的反思。该方法旨在提升 AI 在老年护理场景中的安全性和有效性。
Relation Before Entity: Deferred Commitment in Language Model Factual Recall
关系优先于实体:语言模型事实回忆中的延迟承诺
本研究提出了”关系优先于实体”的语言模型事实回忆方法,通过延迟承诺机制提升模型在复杂事实推理中的准确性。实验表明该方法能有效减少事实性错误。
From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings
从像素到配对:噪声文档环境下基于 LLM 的键值提取综合基准
本文构建了一个综合基准,评估 LLM 在噪声文档环境下的键值提取能力。研究从原始像素到配对关系的全流程测试,为文档信息提取提供了全面的性能评估。
MudawanSn: A Gold-Standard Wolof-Arabic Parallel Corpus for Machine Translation
MudawanSn:机器翻译的黄金标准沃洛夫语-阿拉伯语平行语料库
MudawanSn 是一个高质量的沃洛夫语-阿拉伯语平行语料库,为低资源语言的机器翻译研究提供了宝贵的数据资源。该语料库的建立有助于推动非洲语言 AI 技术的发展。
Register Bias in Complexity-Based Large Language Model Routing
基于复杂度的大语言模型路由中的语域偏见
本文研究了基于复杂度的 LLM 路由机制中存在的语域偏见问题。研究发现当前路由策略可能对特定语域存在系统性偏差,提出了相应的改进方案。
arXiv CS.LG
Pay Only for Disagreement: Certified No-Regression Verdicts for Model Updates with Matching Label-Complexity Bounds
只为分歧付费:带标签复杂度匹配的模型更新认证无退化判决
本文提出了模型更新中的”只为分歧付费”机制,通过标签复杂度匹配边界实现认证的无退化判决。该方法确保模型更新不会在已有数据上表现变差。
Beyond Static RAG: An Adaptive, Tri-Metric Routing Framework for Efficient Long-Context Inference on Commodity GPUs
超越静态 RAG:面向消费级 GPU 高效长上下文推理的自适应三指标路由框架
本文提出了超越静态 RAG 的自适应三指标路由框架,可在消费级 GPU 上实现高效的长上下文推理。该方法通过动态路由优化显著提升了推理效率和成本效益。
Where Grokking Happens: Distributed Utility and Fourier Recoding Without a Module Switch
Grokking 发生在哪里:无需模块切换的分布式效用与傅里叶重编码
本文研究了神经网络中 Grokking 现象的发生机制,提出了无需模块切换的分布式效用和傅里叶重编码方法。研究为理解深度学习的泛化行为提供了新的理论视角。
Disentangling Algorithmic Bias from Archival Artifacts: A Controlled Audit of Vision-Language Model Valuation in Metropolitan Museum Archives
区分算法偏见与档案 artifacts:大都会博物馆档案中视觉语言模型估值的受控审计
本文对大都会博物馆档案中视觉语言模型的估值进行了受控审计,成功区分了算法偏见与档案 artifacts 的影响。研究结果为 AI 在文化遗产领域的应用提供了重要的方法论参考。
Temperon: Full-Time SAM Quality at a Third Less Wall-Clock
Temperon:以三分之一墙钟时间实现 SAM 全时质量
Temperon 是一种新的模型训练方法,能够在仅用三分之一墙钟时间的情况下达到 SAM 模型的质量水平。该方法通过创新的训练策略显著提升了训练效率。
When the Gradient Sees Rank: Provable Necessity, Causal Recruitment, and Composition in Trained Matrix Memories
当梯度看到秩:训练矩阵记忆中的可证明必要性、因果招募与组合
本文研究了训练矩阵记忆中的梯度行为,证明了梯度看到秩的可证明必要性,并分析了因果招募和组合机制。研究为理解矩阵记忆的学习动力学提供了理论基础。
Prior-Free Competitive Ratios for Improving Bandits: Scale, Curvature and Horizon Are Free, but Not Jointly Under Noise
改进 Bandits 的先验无关竞争比:规模、曲率和视界可免费,但在噪声下不能联合免费
本文研究了 Bandit 问题中的先验无关竞争比,证明了规模、曲率和视界三个因素在理想条件下可以免费获得,但在噪声环境下无法同时免费。这一结果为 Bandit 算法设计提供了新的理论边界。
Lecture notes on Physics Informed Neural Networks, Neural Operators, and their applications
物理信息神经网络、神经算子及其应用的讲义
本文提供了物理信息神经网络(PINN)和神经算子的系统讲义,涵盖了理论基础、数值方法和实际应用。内容适合希望深入了解物理约束 AI 模型的读者。
arXiv CS.CV
Selective Prediction and Uncertainty-Aware Referral for Pap Smear Classification
子宫颈癌涂片分类的选择性预测与不确定性感知转诊
本文提出了面向子宫颈癌涂片分类的选择性预测和不确定性感知转诊方法。该方法允许模型在不确定性较高时主动转诊给专业医生,提升了医疗诊断的安全性和可靠性。
A Heisenberg Lift Descriptor for Order Sensitive Online Handwriting Recognition
用于顺序敏感在线手写识别的海森堡提升描述符
本文提出了一种基于海森堡提升的新描述符,用于顺序敏感的在线手写识别。该方法有效捕捉了手写笔迹的顺序信息,提升了识别准确率。
Adaptive Interpolatory Curve Subdivision with Learned Local Angles
带学习局部角度的自适应插值曲线细分
本文提出了带学习局部角度的自适应插值曲线细分方法,能够根据局部几何特征动态调整曲线细分策略。该方法在计算机图形学和几何建模中具有广泛应用前景。
DualCount: Structurally Consistent Density and Point Modeling for Zero-Shot Object Counting
DualCount:零样本物体计数的结构一致密度与点建模
DualCount 是一种用于零样本物体计数的新方法,通过结构一致的密度和点建模实现准确的物体计数。该方法在未见过的物体类别上也能保持良好的计数性能。
Geometry-Driven Shadow Harmonisation for Composited Faces: A Multiplicative, Albedo-Preserving Relighting Pipeline
合成面部的几何驱动阴影协调:乘性保反照率重照明管线
本文提出了一种用于合成面部的几何驱动阴影协调方法,通过乘性保反照率重照明管线实现自然的阴影效果。该方法显著提升了面部合成的视觉真实感。
How to make effective use of domain experts for image classification?
如何有效利用领域专家进行图像分类?
本文探讨了如何有效利用领域专家知识提升图像分类性能的方法。研究比较了不同专家参与策略的效果,为知识蒸馏和主动学习提供了实践指导。
Beyond Performance Metrics: Uncertainty Mapping of Label Ambiguity in Fazekas Score Prediction
超越性能指标:Fazekas 评分预测中标签歧义的不确定性映射
本文研究了 Fazekas 评分预测中标签歧义的不确定性映射问题,提出了超越传统性能指标的评估方法。该方法能够更准确地反映模型在模糊标签情况下的可靠性。
Not All Patches Are Equally Forgettable: Spatially Localized Domain Unlearning in Vision-Language Models
并非所有补丁都同样可遗忘:视觉语言模型中的空间局部化领域遗忘
本文研究了视觉语言模型中的空间局部化领域遗忘问题,发现不同图像区域的可遗忘性存在显著差异。该研究为精确的模型遗忘和隐私保护提供了新的技术思路。
DeepMind Blog
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking
DeepMind 发布了 Gemini 3.8 Live 系列模型,包括标准版和 Extended Thinking 版本。Extended Thinking 模式允许模型进行更深入的推理和思考,适用于需要复杂逻辑分析的复杂任务场景。
AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome
AlphaGenome Atlas:人类基因组中每种可能 DNA 碱基变化的预测图谱
DeepMind 发布了 AlphaGenome Atlas,这是人类基因组中每种可能 DNA 碱基变化的预测图谱。该图谱利用 AlphaFold 技术预测基因变异的功能影响,为精准医学和遗传学研究提供了革命性工具。
Introducing WeatherNext 3, our most advanced and accurate global weather AI model
推出 WeatherNext 3,最先进精准的全球天气 AI 模型
DeepMind 发布了 WeatherNext 3,这是其最先进和精准的全球天气 AI 模型。该模型在天气预报精度和计算效率方面实现了重大突破,为气象预测和气候研究提供了强大工具。
Proactive cyber defense for governments and enterprises
为政府和企业提供主动网络防御
DeepMind 推出了面向政府和企业客户的主动网络防御解决方案。该方案利用 AI 技术实现威胁的主动检测和响应,显著提升组织应对网络攻击的能力。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
推出 Gemini 3.8 Flash 和 3.8 Flash Cyber
DeepMind 发布了 Gemini 3.8 Flash 系列模型,包括标准 Flash 版和 Cyber 安全专用版。Flash 系列在保持高性能的同时大幅提升了推理速度,适合对延迟敏感的应用场景。
Introducing agentic video understanding with Gemini
推出 Gemini 智能体视频理解能力
DeepMind 介绍了 Gemini 的智能体视频理解能力,使模型能够像智能体一样主动探索和理解视频内容。这一能力突破了传统被动视频分析的局限,实现了更深入的视觉理解。
Gemini Omni 1.1 Flash lets you build with more control
Gemini Omni 1.1 Flash 让你构建时拥有更多控制
Gemini Omni 1.1 Flash 版本提供了更强的可控性,允许开发者在构建 AI 应用时更精细地控制模型行为。该版本在速度和质量之间取得了更好的平衡。
Piloting the world’s first double-blind AI evaluations
试点全球首个双盲 AI 评估
DeepMind 启动了全球首个双盲 AI 评估试点项目,评估者和被评估者均不知道模型身份。这一创新评估方法旨在消除偏见,提供更客观的 AI 性能评估结果。
Intelligent transcription with Gemini 3.5 Transcribe
使用 Gemini 3.5 Transcribe 实现智能转录
DeepMind 发布了 Gemini 3.5 Transcribe,这是一款智能语音转录工具。该工具利用 Gemini 模型的理解能力,不仅实现高精度转录,还能进行智能摘要和内容结构化。
From Atari to EVE Online: Building on 15 Years of AI Research in Games
从 Atari 到 EVE Online:基于 15 年游戏 AI 研究的积淀
DeepMind 回顾了 15 年来在游戏 AI 领域的研究历程,从经典的 Atari 游戏到复杂的 EVE Online 多人在线游戏。文章展示了 AI 在游戏领域的技术演进和重要突破。
Meta Engineering
ZGateway: Learnings from Putting a Proxy in Front of ZippyDB
ZGateway:在 ZippyDB 前放置代理的经验总结
Meta 工程团队分享了在 ZippyDB 数据库前部署 ZGateway 代理的经验。文章详细介绍了代理架构的设计决策、性能优化策略以及在实际生产环境中遇到的挑战和解决方案。
An Organizational Second Brain: Building an AI That Learns From Experts
组织第二大脑:构建从专家学习的 AI
Meta 介绍了”组织第二大脑”项目,这是一个能够从领域专家知识中学习的 AI 系统。该系统通过捕捉专家经验和决策模式,为组织成员提供智能化的知识支持和决策辅助。
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet
MetaRoCE:为 AI 规模以太网构建的新型 RDMA 传输协议
Meta 发布了 MetaRoCE,这是一种专为 AI 规模以太网设计的新型 RDMA(远程直接内存访问)传输协议。该协议显著提升了 AI 训练集群的网络性能和可扩展性。
MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines
MTIA 300:Meta 首款内置网卡和通信卸载引擎的训练芯片
Meta 发布了 MTIA 300 训练芯片,这是其首款内置网卡(NIC)和通信卸载引擎的 AI 训练芯片。该芯片通过硬件级优化显著提升了分布式训练的效率。
How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees
如何在 WhatsApp 上构建端到端加密且可验证的诈骗警报系统
Meta 详细介绍了在 WhatsApp 上构建诈骗警报系统的方法,该系统在端到端加密环境下仍能检测诈骗行为并提供可验证的安全保证。这一技术突破平衡了隐私保护与用户安全。
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
Meta 分享了其广告排序系统的多阶段架构设计,从用户行为序列到缩放定律的应用。该架构显著提升了广告推荐的准确性和系统效率。
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
GEM 训练:Meta 如何将 LLM 规模广告基础模型的效率提升一倍
Meta 介绍了 GEM 训练方法,该方法成功将其 LLM 规模广告基础模型的训练效率提升了一倍。文章详细阐述了训练优化策略和工程实现细节。
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
探索层次化兴趣表示用于 Meta 广告深漏斗优化
Meta 研究了层次化兴趣表示方法在广告深漏斗优化中的应用。该方法通过多层次的兴趣建模显著提升了广告投放的精准度和转化效果。
Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler
使用开源内核调度器现代化 Meta 广告服务
Meta 分享了使用开源内核调度器现代化广告服务的经验。该方法通过引入先进的调度算法显著提升了广告服务的性能和资源利用率。
Towards Data Science
Building a Data Lakehouse with DuckDB and DuckLake
使用 DuckDB 和 DuckLake 构建数据湖仓
本文介绍了如何使用 DuckDB 和 DuckLake 构建数据湖仓架构。DuckDB 作为嵌入式分析数据库,结合 DuckLake 的湖仓管理能力,为数据分析提供了轻量级且高效的解决方案。
How I Built a Multi-Agent System for Interrupted Time Series Analysis (ITSA)
我如何构建用于中断时间序列分析的多智能体系统
作者分享了构建多智能体系统用于中断时间序列分析(ITSA)的实践经验。该系统利用多个 AI 智能体协作完成复杂的时间序列分析和因果推断任务。
Why You Think Like a Bayesian but Were Taught Like a Frequentist
为何你的思维方式像贝叶斯主义者,但学习的方式却像频率主义者
本文探讨了统计学教育中的一个有趣现象:大多数人在直觉上以贝叶斯方式思考,但学术教育却主要教授频率主义方法。文章分析了两种统计思维方式的差异及其对 AI 建模的启示。
[Read more →](https://towardsdatascience.com/why-you-think-like-a-bayesian-but-were-taught-like-a-frequentist/]
When Does Graph RAG Actually Add Value? A Hands-On Experiment
Graph RAG 何时真正创造价值?一项动手实验
本文通过实际实验评估了 Graph RAG(图增强检索增强生成)的价值。研究确定了 Graph RAG 在特定场景下相比传统 RAG 的增益条件,为实际应用提供了指导。
How to Make Linear Regression Survive Outliers
如何让线性回归在异常值中生存
本文介绍了多种处理线性回归中异常值的技术方法,包括稳健回归、数据变换和异常值检测等策略。这些方法帮助数据科学家在存在异常值的情况下获得更可靠的模型结果。
Silent Broadcasting Can Ruin Your Model
静默广播可能毁掉你的模型
本文警告了”静默广播”(silent broadcasting)对机器学习模型的潜在危害。当数据在不同维度间意外广播时,可能导致模型学习到错误的模式,严重影响预测性能。
The KV Cache Tax: Why Inference Servers Run Out of Memory Before Compute
KV 缓存税:为何推理服务器先于计算耗尽内存
本文深入分析了大语言模型推理中的 KV 缓存内存消耗问题。作者解释了为何推理服务器往往在计算资源耗尽之前就先遇到内存瓶颈,并提出了相应的优化策略。
The N Squared Pizza Problem
N 平方披萨问题
本文以幽默的方式探讨了机器学习中的”N 平方披萨问题”——当模型复杂度以平方级增长时,如何合理分配计算资源。文章用披萨比喻形象地说明了资源分配的困境。
[Read more →](https://towardsdatascience.com/the-n-squared-pizza-problem/]
Reparameterization Tricks: Variance Reduction by Smarter Gradients
重参数化技巧:通过更智能的梯度降低方差
本文详细介绍了重参数化技巧在深度学习中的应用,解释了如何通过重新参数化随机变量来降低梯度估计的方差,从而提升模型训练的稳定性。
How to Build Consistent Designs with Claude Code
如何使用 Claude Code 构建一致的设计
本文介绍了如何使用 Claude Code 工具构建一致的设计系统。文章提供了实用的技巧和最佳实践,帮助开发者和设计师利用 AI 提升设计的一致性和效率。