zgba 站群
AI日报 - 2026-09-22

2026-09-22

今日要点


Hacker News

What happened to the Snowden archive

斯诺登档案发生了什么

本文探讨了爱德华·斯诺登(Edward Snowden)泄露的机密档案目前的去向与保存状况。文章追溯了这些档案从公开到逐渐被遗忘的过程,分析了政府、媒体和公众对这批敏感信息的处理态度,以及档案数字化保存面临的法律与技术挑战。

Read more →

AX – Google’s Open Agentic Orchestrator

AX——谷歌的开放智能体编排器

Google推出了名为AX的开放智能体编排框架,旨在为多智能体系统提供统一的协调与调度能力。该框架允许开发者构建、管理和部署多个AI智能体协同工作,适用于复杂任务分解与自动化流程场景。

Read more →

ZuckOff Know when a camera is in the room

ZuckOff:知晓摄像头何时在房间中

ZuckOff是一款免费应用,能够在Meta智能眼镜的摄像头启动前发出提醒,帮助用户感知自己是否正被拍摄。该工具针对Meta智能眼镜的隐私风险设计,通过检测摄像头活动状态来保护用户隐私。

Read more →

Bill to Ban Private Equity from Owning Medical Practices

禁止私人股权收购医疗机构的法案

参议员伊丽莎白·沃伦(Elizabeth Warren)提出了一项新法案,旨在禁止私人股权公司收购医疗机构。该法案认为私人股权的短期利润导向可能损害医疗质量和患者利益,引发美国医疗行业对资本介入的广泛讨论。

Read more →

Disney+: New user agreement allows ads before movies in all subscriptions

Disney+:新用户协议允许所有订阅在电影前播放广告

迪士尼流媒体服务Disney+更新了用户协议,允许在所有订阅层级(包括此前无广告的高级套餐)的电影播放前插入广告。这一政策转变反映了流媒体行业普遍向广告支持模式转型的趋势。

Read more →

Attention is all you have

注意力即一切

本文对”Attention is all you need”这一Transformer架构核心思想进行了反思与延伸讨论,探讨了注意力机制在当代AI系统中的主导地位及其局限性,同时思考了注意力资源在人类认知与AI设计之间的类比关系。

Read more →

What Sun got wrong

Sun做错了什么

本文回顾并分析了Sun Microsystems在技术发展道路上的关键失误,探讨了其在Java生态、硬件战略和云计算转型等关键决策中的偏差,为科技公司的战略选择提供了历史借鉴。

Read more →

Grok 4.7

Grok 4.7

xAI公司发布了Grok 4.7大语言模型,这是其Grok系列的最新迭代版本。新版本在推理能力、代码生成和多轮对话等方面进行了优化,进一步提升了模型在复杂任务中的表现。

Read more →

Kev: Tiny Jev-like family of decision models built on top of Qwen3.5

Kev:基于Qwen3.5构建的轻量级决策模型家族

Kev是一个轻量级决策模型项目,构建在Qwen3.5基础之上,灵感来源于Jev架构。该项目旨在提供高效、低资源消耗的决策推理能力,适合在边缘设备和资源受限环境中部署使用。

Read more →

ZuckOff is a free app that sees Meta glasses before they see you

ZuckOff:一款在Meta眼镜”看到你之前”发现它的免费应用

这篇文章详细介绍了ZuckOff应用的原理与功能,该应用通过检测Meta智能眼镜的摄像头活动信号,在用户不知情的情况下发出隐私警告。文章讨论了智能穿戴设备带来的隐私挑战及用户的应对策略。

Read more →

Grim Fandango Puzzle Document (1996) [pdf]

冥界列车谜题文档(1996年)[pdf]

这是一份1996年发布的《冥界列车》(Grim Fandango)游戏谜题设计文档的PDF存档。该文档记录了这款经典冒险游戏的谜题设计思路与解决方案,对游戏设计研究者具有重要参考价值。

Read more →

Fable 5 – Median thinking declined in August

Fable 5——8月中位数思维下降

Anthropic的Fable 5模型在8月份的评估数据显示其中位数思维表现出现下降。这一发现引发了对大模型持续训练过程中性能波动问题的关注,也促使研究者重新审视模型评估方法。

Read more →

Show HN: Mini-AGI – Dynamic continual learning model trained on 8GB VRAM

展示 HN:Mini-AGI——在8GB显存上训练的动态持续学习模型

Mini-AGI是一个可在8GB显存环境下运行的动态持续学习模型项目,展示了在消费级硬件上实现类AGI能力的可能性。该项目通过创新的架构设计和训练策略,实现了在有限资源下的持续学习与适应能力。

Read more →

Jev-Leftpad

Jev-Leftpad

这是一个名为Jev-Leftpad的开源项目,将经典的leftpad工具以Jev架构风格重新实现。该项目体现了开源社区对极简主义编程和AI辅助代码生成的探索精神。

Read more →

Heretic removes restrictions from language models

Heretic解除语言模型的限制

Heretic项目致力于移除大语言模型中的各种安全限制和内容审查机制,使其能够更自由地生成各类内容。这一项目引发了关于AI安全与自由之间平衡的广泛争议与讨论。

Read more →


OpenAI Blog

Advisory Group on Mathematics and Artificial Intelligence

数学与人工智能咨询小组

OpenAI宣布成立数学与人工智能咨询小组,汇聚数学领域的顶尖学者,探索数学研究与AI发展的交叉点。该小组将致力于推动AI在数学发现、证明辅助和数学教育等方面的应用,同时促进数学方法对AI架构设计的启发。

Read more →

Higgsfield AI ships new video features in a day with GPT-6 Astra

Higgsfield AI一天内借助GPT-6 Astra推出新视频功能

Higgsfield AI利用OpenAI的GPT-6 Astra模型,在短短一天内完成了新视频功能的开发与部署。这一案例展示了高级AI模型在加速软件开发和产品迭代方面的巨大潜力,为AI辅助编程树立了新的效率标杆。

Read more →

Building standards for the next phase of AI

为AI下一阶段制定标准

OpenAI发布了面向AI下一阶段发展的标准框架,涵盖模型安全评估、能力分级、透明度报告和责任追究等关键领域。该标准旨在建立行业共识,推动AI系统向更安全、更可预测的方向发展。

Read more →

Expanding OpenAI Academy with new learning paths

OpenAI学院新增学习路径

OpenAI宣布扩展OpenAI Academy,推出多条新的学习路径,覆盖从基础提示工程到高级智能体开发的完整技能体系。新课程结合了实践项目与理论指导,旨在帮助开发者和企业更有效地掌握AI工具的应用能力。

Read more →

How V7 gives AI agents institutional memory

V7如何为AI智能体提供机构记忆

本文介绍了V7平台如何通过结构化数据管理和知识图谱技术,为AI智能体赋予持久的机构记忆能力。这种机制使智能体能够在多次交互中积累和复用知识,显著提升复杂业务场景下的决策质量。

Read more →

Introducing the Australian Youth Safety Blueprint

推出澳大利亚青少年安全蓝图

OpenAI与澳大利亚政府合作发布了青少年AI安全蓝图,为年轻用户安全使用AI工具提供全面指导。该蓝图涵盖年龄分级、内容过滤、家长控制和教育支持等多个维度,旨在平衡技术创新与青少年保护。

Read more →

How Cooley is accelerating IPO work with ChatGPT

Cooley如何利用ChatGPT加速IPO工作

法律科技公司Cooley分享了其利用ChatGPT加速首次公开募股(IPO)相关工作的实践经验。通过AI辅助文档审查、合规检查和法律研究,Cooley显著提升了IPO流程的效率,为法律行业的AI应用提供了典型案例。

Read more →

Introducing Astra for Law

推出Astra for Law

OpenAI正式发布Astra for Law,这是专为法律行业设计的AI助手版本。该工具具备法律文档分析、案例检索、合同审查等专业能力,同时内置了法律伦理和保密性保障机制,旨在提升法律工作者的工作效率。

Read more →

Helping older adults use AI in everyday life

帮助老年人日常使用AI

OpenAI发布了针对老年人群体的AI使用指南和资源,帮助他们克服技术障碍,安全有效地将AI工具融入日常生活。内容包括简化界面设计、语音交互优化和隐私保护教育等多个方面。

Read more →

Reimagining advertising with AI

用AI重新构想广告

OpenAI探讨了AI如何重塑广告行业的创意、投放和效果评估全流程。从个性化内容生成到精准受众定位,AI正在推动广告从传统的大众传播模式向高度定制化的智能营销范式转变。

Read more →


Anthropic Blog

Improving our alignment and security efforts

改进我们的对齐与安全努力

Anthropic发布了关于提升AI对齐和安全工作的最新进展报告,详细介绍了其在价值对齐、红队测试和风险评估方面的新方法和工具。公司强调将持续投入资源确保Claude模型的安全性和可靠性。

Read more →

Partnering with Accenture on embedded evaluation

与埃森哲合作开展嵌入式评估

Anthropic与埃森哲(Accenture)达成合作,将AI评估能力嵌入企业工作流程中。这一合作使企业能够在日常运营中实时评估AI系统的表现和风险,实现更持续和系统化的AI治理。

Read more →

Introducing the Life Sciences Verification Program

推出生命科学验证计划

Anthropic启动了生命科学验证计划,为使用Claude处理生物医学数据的组织提供独立的安全评估和认证服务。该计划旨在确保AI在敏感生命科学领域的应用符合最高安全标准。

Read more →

Developing Enterprise Frontier Safeguards with our customers

与客户共同开发企业前沿安全护栏

Anthropic分享了与企业客户合作开发前沿AI安全护栏的经验,包括能力限制、滥用检测和应急响应机制。这些合作成果将帮助企业在享受AI强大能力的同时有效控制潜在风险。

Read more →

Previewing the Model Hardware Standard

预览模型硬件标准

Anthropic发布了模型硬件标准的预览版本,定义了AI模型在硬件层面的安全要求和性能基准。该标准旨在确保不同硬件平台上运行的AI模型保持一致的安全水平和可靠性。

Read more →

Expanding our support for scientists

扩大对科学家的支持

Anthropic宣布扩大对科学研究人员的支持计划,提供更多Claude API额度、专用研究工具和学术合作机会。这一举措旨在加速AI在科学研究中的应用,推动各学科领域的创新突破。

Read more →

Funding better evaluations of AI’s impact on wellbeing

资助评估AI对幸福感影响的更好方法

Anthropic启动了专项基金,支持评估AI技术对人类幸福感和心理健康影响的深入研究。该基金将资助跨学科研究项目,探索AI使用与人类福祉之间的复杂关系。

Read more →

How Claude’s text watermark works

Claude文本水印的工作原理

Anthropic详细解释了Claude生成的文本中嵌入的水印技术。该技术通过微妙的统计特征标记AI生成内容,帮助识别和追踪AI输出,同时不影响文本的自然可读性。

Read more →

Improving Fable 5’s biology safeguards

改进Fable 5的生物学安全护栏

Anthropic发布了针对Fable 5模型的生物学安全护栏改进方案,增强了对生物安全风险内容的检测和过滤能力。改进后的系统能够更准确地识别潜在的生物安全敏感内容,同时减少误报。

Read more →

Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer

Mariano-Florentino(Tino)Cuéllar将出任Anthropic全球事务首席官

Anthropic宣布前美国司法部民权司司长Mariano-Florentino Cuéllar将加入公司担任全球事务首席官。Cuéllar将在AI政策、监管和国际合作方面发挥关键作用,帮助Anthropic应对日益复杂的全球治理挑战。

Read more →


Google AI Blog

New experts join Google’s AI & Economy team

新专家加入谷歌AI与经济团队

Google宣布多名经济学和AI领域的专家加入其AI与经济研究团队,将进一步深化对AI经济影响的研究。新成员将专注于AI生产力效应、劳动力市场变化和宏观经济影响等关键议题。

Read more →

Co-creating the future of fashion with Google

与谷歌共创时尚未来

Google展示了与时尚行业合作利用AI技术推动创新的案例,包括智能设计辅助、个性化推荐和可持续时尚等应用。AI正在帮助时尚品牌提升设计效率、优化供应链并减少环境影响。

Read more →

Making global data easier to explore

让全球数据更易探索

Google推出了联合国数据commons平台的新功能,使研究人员和政策制定者能够更便捷地探索和分析全球发展数据。该平台整合了来自多个国际组织的统计数据,支持多维度交叉分析。

Read more →

AI for Societal Impact

面向社会影响的AI

Google发布了AI社会影响计划的最新进展,展示了AI在气候变化、公共卫生、教育公平和灾害响应等领域的应用成果。该计划致力于确保AI技术能够产生积极的社会影响。

Read more →

Building AI to accelerate science and improve lives

构建加速科学进步和改善生活的AI

Google AI负责人James Manyika撰文介绍了Google在科学AI领域的战略布局,包括AlphaFold、气候建模和药物发现等突破性进展。文章强调了AI作为科学发现加速器的巨大潜力。

Read more →

AI for everyone in every language

让每个人每种语言都能使用AI

Google宣布了推动AI多语言普及的 initiatives,包括扩展对小语种的支持、开发低资源语言的翻译模型和推动AI教育材料的本地化。这一努力旨在缩小全球AI数字鸿沟。

Read more →

New insights from Google’s AI & Economy ATLAS

Google AI与经济ATLAS的新见解

Google发布了AI与经济ATLAS平台的最新数据分析结果,揭示了AI采用对企业生产率、就业结构和行业竞争格局的深远影响。数据表明AI正在重塑全球经济的竞争格局。

Read more →

Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery

观看宇航员Christina Koch与谷歌James Manyika探讨太空、技术与发现

Google邀请宇航员Christina Koch与AI负责人James Manyika进行对话,探讨太空探索与AI技术的交汇点。两人讨论了AI如何助力太空任务、数据分析以及人类对宇宙的认知。

Read more →

DevFest is back

DevFest回归

Google宣布DevFest开发者大会将于2026年回归,届时将展示最新的AI工具、开发框架和技术趋势。该活动为全球开发者提供了一个学习和交流的平台。

Read more →

用Search为下一次大赛做准备的三种方式

Google Search团队分享了利用Search工具为跑步比赛做准备的三种实用方法,包括训练计划制定、路线规划和营养管理。这些技巧帮助跑者更科学地准备比赛。

Read more →


The Gradient

After Orthogonality: Virtue-Ethical Agency and AI Alignment

正交性之后:德性伦理代理与AI对齐

本文在批判正交性论题的基础上,提出了一种基于德性伦理的AI对齐框架。作者认为AI系统的目标设定不应仅关注能力与目标的正交性,而应培养AI的”德性”——即内在的行为倾向和道德判断能力。

Read more →

AGI Is Not Multimodal

AGI并非多模态

本文论证了通用人工智能(AGI)的核心特征并非多模态感知,而是抽象推理和通用问题解决能力。作者指出当前多模态模型虽然强大,但距离真正的AGI仍有本质差距。

Read more →

Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research

形状、对称性与结构:数学在机器学习研究中的角色变迁

本文追溯了数学在机器学习研究中的演变历程,从早期的统计方法到如今的几何拓扑和群论应用。作者认为对称性和结构意识正在成为新一代ML理论的核心工具。

Read more →

What’s Missing From LLM Chatbots: A Sense of Purpose

LLM聊天机器人缺失的东西:目标感

本文探讨了当前大语言模型聊天机器人缺乏的核心特质——目标感和意图性。作者认为真正的智能体不仅需要理解语言,更需要有内在的目标驱动和自主决策能力。

Read more →

We Need Positive Visions for AI Grounded in Wellbeing

我们需要以幸福感为基础的AI积极愿景

本文呼吁AI社区超越安全与风险叙事,构建以人类幸福感和繁荣为核心的积极AI愿景。作者认为只有将AI发展与人类福祉紧密结合,才能实现真正可持续的技术进步。

Read more →

Financial Market Applications of LLMs

LLM在金融市场的应用

本文系统综述了大语言模型在金融市场的各类应用,包括市场分析、风险评估、交易策略和合规审查。文章同时指出了金融领域应用LLM的特殊挑战和监管要求。

Read more →

A Brief Overview of Gender Bias in AI

AI中性别偏见的简要概述

本文全面概述了AI系统中的性别偏见问题,从训练数据偏差到模型输出歧视,分析了偏见的来源、影响和缓解策略。文章强调了构建公平AI系统的重要性。

Read more →

Mamba Explained

Mamba详解

本文对Mamba架构进行了深入浅出的技术解析,介绍了其状态空间模型(SSM)的核心原理、选择性机制和线性复杂度优势。Mamba作为Transformer的有力替代方案,正在引起广泛关注。

Read more →

Car-GPT: Could LLMs finally make self-driving cars happen?

Car-GPT:LLM能否最终实现自动驾驶汽车?

本文探讨了大语言模型在自动驾驶领域的应用前景,分析了LLM在感知理解、决策规划和人机交互方面的潜力与挑战。作者认为LLM可能成为自动驾驶技术突破的关键催化剂。

Read more →

Do text embeddings perfectly encode text?

文本嵌入是否完美编码了文本?

本文通过实验检验了文本嵌入对原始文本信息的编码完整性,发现尽管嵌入能够捕捉语义信息,但在某些细节层面存在信息损失。这一发现对检索增强生成等应用具有重要启示。

Read more →


arXiv CS.AI

RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models

RBS-Attention:用于长上下文大语言模型的半径有界稀疏预填充

本文提出了RBS-Attention机制,通过半径有界稀疏预填充策略显著降低长上下文模型的计算开销。该方法在保持模型性能的同时,有效解决了长序列处理中的内存和计算瓶颈问题。

Read more →

Attention-Aware Routing: Coupling Routing and Attention in MoEs

注意力感知路由:在MoE中耦合路由与注意力

本文提出了一种注意力感知路由机制,将注意力权重与MoE(混合专家)的路由决策相结合。该方法使路由过程能够感知输入的全局注意力分布,从而做出更智能的专家选择。

Read more →

CaLR: Causal Latent Revision for Robust Diffusion Reasoning

CaLR:用于鲁棒扩散推理的因果潜变量修正

本文提出了CaLR方法,通过因果潜变量修正技术提升扩散模型的推理鲁棒性。该方法能够有效识别和修正扩散过程中的因果偏差,提高生成结果的逻辑一致性。

Read more →

LoRA Enhanced Contrastive Learning with SAS Vision Transformers

基于SAS视觉Transformer的LoRA增强对比学习

本文结合LoRA低秩适配技术与SAS(稀疏注意力机制)视觉Transformer,提出了增强的对比学习框架。该方法在保持计算效率的同时显著提升了视觉表示的学习质量。

Read more →

Detecting Hallucination in LLMs: Tracing the Topological Signatures of Impaired Context Sharing

检测LLM中的幻觉:追踪受损上下文共享的拓扑特征

本文提出了一种基于拓扑分析的新方法来检测大语言模型中的幻觉现象。通过追踪上下文共享受损的拓扑特征签名,该方法能够早期识别模型输出中的不实信息。

Read more →

Decoupling Internal Representational Changes and Causal Importance in Fine-Tuned Large Language Models

解耦微调大语言模型中的内部表示变化与因果重要性

本文研究了微调过程中大语言模型内部表示变化与因果重要性之间的关系,提出了一种解耦分析方法。该方法有助于理解微调如何影响模型的知识存储和推理能力。

Read more →

TinyCeNN-LM: Quality-Gated Conversion of Pretrained Attention with CeNN-Inspired Cellular-Recurrent Layers

TinyCeNN-LM:基于CeNN启发细胞递归层的预训练注意力质量门控转换

本文提出了TinyCeNN-LM,一种受细胞神经网络(CeNN)启发的轻量级语言模型架构。该方法通过质量门控机制将预训练注意力层转换为细胞递归层,在保持性能的同时大幅降低模型规模。

Read more →

Clinician-Grounded Quality Assurance for AI-Assisted Psychiatric Intake

临床医生主导的AI辅助精神科问诊质量保证

本文提出了一套由临床医生主导的质量保证框架,用于评估AI辅助精神科问诊系统的可靠性和安全性。该框架结合了临床实践标准和AI评估指标,确保AI工具在精神健康领域的安全应用。

Read more →


arXiv CS.CL

Do small language models know what they don’t know?

小语言模型知道自己不知道什么吗?

本文研究了小语言模型对自身知识边界的感知能力,评估了它们在不确定性估计和拒绝回答方面的表现。研究发现小模型在知识边界识别方面存在系统性偏差,需要额外的校准机制。

Read more →

HERMES: Contrast-Aware Knowledge Graph Reasoning from Clinical Notes for Patient Outcome Prediction

HERMES:基于临床笔记的对比感知知识图谱推理用于患者预后预测

本文提出了HERMES框架,利用对比感知知识图谱推理技术从临床笔记中提取结构化知识,用于患者预后预测。该方法能够有效处理临床文本中的复杂关系和不确定性。

Read more →

TALON: A Temporally Aware Longitudinal Framework for Radiology Report Generation

TALON:用于放射学报告生成的时间感知纵向框架

本文介绍了TALON框架,这是一个专为放射学报告生成设计的时间感知纵向系统。TALON能够整合患者历史影像数据和时间序列信息,生成更加准确和连贯的放射学报告。

Read more →

From Discharge Notes to Patient Understanding: Persona-Grounded, Open-Ended Simulation of LLMs as Discharge Educators

从出院记录到患者理解:以人格为基础的LLM出院教育开放模拟

本文探索了利用LLM作为出院教育者的可能性,通过人格基础的开放模拟方法将专业出院记录转化为患者易于理解的健康指导。该方法显著提升了患者对出院后护理的理解和依从性。

Read more →

Beyond WER: Entity and Disfluency Recall in Accented Conversational ASR

超越WER:带口音对话语音识别中的实体与不流畅性召回

本文提出了超越传统词错误率(WER)的评估方法,专注于带口音对话语音识别中的实体召回和不流畅性处理。研究结果表明现有ASR系统在口音适应方面仍有较大提升空间。

Read more →

SAGE: Schema-Guided LLMs for Grant Review

SAGE:用于资助评审的Schema引导LLM

本文提出了SAGE系统,利用Schema引导的大语言模型自动化资助申请评审流程。SAGE能够按照预定义的评审标准和维度对申请进行结构化评估,提高评审的效率和一致性。

Read more →

Reviser: Revision-Capable Text Generation via Autoregressive Cursor Actions

Reviser:通过自回归光标动作实现可修订文本生成

本文提出了Reviser方法,通过自回归光标动作机制实现文本的可修订生成。该方法允许模型在生成过程中进行局部修改和迭代优化,显著提升了生成文本的质量。

Read more →

Recursive Language Models Generalize Out of Domain

递归语言模型具有域外泛化能力

本文研究了递归语言模型在域外数据上的泛化表现,发现递归架构相比传统自回归模型具有更强的跨域迁移能力。这一发现为设计更通用的语言模型提供了新的思路。

Read more →


arXiv CS.LG

Sparse Priors for Efficient Distribution Learning

用于高效分布学习的稀疏先验

本文提出了基于稀疏先验的高效分布学习方法,通过引入结构化稀疏约束显著降低了分布学习的计算复杂度。该方法在保持学习精度的同时,大幅提升了大规模分布估计的效率。

Read more →

BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence

BI-Agent和BI-Bench:迈向端到端商业智能自动化

本文介绍了BI-Agent系统和BI-Bench基准测试,旨在推动端到端商业智能的自动化。BI-Agent能够自主完成从数据查询到可视化报告生成的完整BI流程,代表了AI驱动商业智能的重要进展。

Read more →

Elastic Threshold Attention: Learned Contextual Sparsity for Long-Context Decoding

弹性阈值注意力:用于长上下文解码的学习型上下文稀疏性

本文提出了弹性阈值注意力机制,通过学习上下文相关的稀疏模式优化长上下文解码效率。该方法能够动态调整注意力计算范围,在长序列场景下实现显著的计算节省。

Read more →

Bio-MF: Low-Latency and High-Fidelity EEG-to-fNIRS Cross-Modal Generation for Hybrid Motor-Imagery Brain—Computer Interfaces

Bio-MF:用于混合运动想象脑机接口的低延迟高保真EEG-to-fNIRS跨模态生成

本文提出了Bio-MF模型,实现了EEG到fNIRS信号的低延迟高保真跨模态生成。该方法为混合脑机接口系统提供了高效的信号融合方案,提升了运动想象解码的准确性和实时性。

Read more →

Continuous Delayed-Memory Stochastic Gradient Descent and Continuous-Time Reinforcement Learning from History of Astrophysical Time Series Studies

连续延迟记忆随机梯度下降与基于天体物理时间序列历史的连续时间强化学习

本文提出了连续延迟记忆随机梯度下降算法,并将其应用于基于天体物理时间序列历史的连续时间强化学习。该方法有效处理了天文数据中的时间延迟和噪声问题。

Read more →

Do Quantum Models Scale Like LLMs?

量子模型能否像LLM一样扩展?

本文系统研究了量子机器学习模型的可扩展性,与经典LLM的缩放规律进行了对比分析。研究发现量子模型在特定任务上展现出不同的缩放行为,但距离达到LLM级别的扩展能力仍有差距。

Read more →

When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation

当AI评审训练AI评审者时:科学判断崩溃与缓解

本文揭示了AI评审系统训练AI评审者时可能出现的”科学判断崩溃”现象——模型逐渐丧失独立判断能力,过度依赖训练数据中的偏见。文章提出了多种缓解策略。

Read more →

Efficient Bayes-Adaptive Reinforcement Learning with Temporal Logic Specifications

带时序逻辑规范的高效贝叶斯自适应强化学习

本文提出了一种结合时序逻辑规范的贝叶斯自适应强化学习框架,使智能体能够在满足复杂时序约束的同时高效学习。该方法在安全关键型任务中展现出优越性能。

Read more →


arXiv CS.CV

TAPe+ML: A Compact Structured Representation for Multi-Task Computer Vision

TAPe+ML:用于多任务计算机视觉的紧凑结构化表示

本文提出了TAPe+ML框架,一种用于多任务计算机视觉的紧凑结构化表示方法。该方法通过统一的表示学习框架,在多个视觉任务上实现了高效的知识共享和任务协同。

Read more →

MemeTAG: Keyword-Driven Meme Classification through Tag Embedding Reconstruction

MemeTAG:通过标签嵌入重建实现关键词驱动的模因分类

本文提出了MemeTAG方法,通过标签嵌入重建技术实现关键词驱动的互联网模因分类。该方法能够有效捕捉模因的语义特征和文化语境,提升分类准确性。

Read more →

Image-Derived PM10 Estimation in Cattle Feedlot Using Machine Learning: Addressing Concentration Ranges Beyond Existing Digital Imaging Methods

基于机器学习的牛舍PM10图像估算:解决超出既有数字成像方法范围的浓度区间

本文利用机器学习方法从图像数据中估算牛舍环境中的PM10颗粒物浓度,有效覆盖了现有数字成像方法无法处理的浓度范围。该方法为畜牧业环境监测提供了新的技术手段。

Read more →

Fragment-Aware Vision Transformers for Fresco-Fragment Style Classification

用于壁画碎片风格分类的碎片感知视觉Transformer

本文提出了碎片感知视觉Transformer(Fragment-Aware ViT),专门用于壁画碎片风格分类任务。该方法能够有效处理碎片化图像的结构特征,在文化遗产数字化保护中具有应用价值。

Read more →

MAGIC: Marginal-Guided Compression with Optimal Transport for Efficient Visual Document Retrieval

MAGIC:基于最优传输的边缘引导压缩用于高效视觉文档检索

本文提出了MAGIC方法,结合边缘引导压缩与最优传输技术,实现了高效的视觉文档检索。该方法在保持检索精度的同时显著降低了存储和计算需求。

Read more →

MarsFM: Shading-Regularized Flow Matching for Martian Relief Estimation

MarsFM:用于火星地形估计的阴影正则化流匹配

本文提出了MarsFM方法,利用阴影正则化流匹配技术从图像数据中估计火星地形。该方法能够有效利用阴影信息提升地形重建的精度,为火星探测任务提供支持。

Read more →

4DGS-Fixer: Generative Sparse-View 4D Gaussian Splatting with Iterative Refinement Guided by Video Diffusion Priors

4DGS-Fixer:基于视频扩散先验迭代 refinment 的生成式稀疏视角4D高斯泼溅

本文提出了4DGS-Fixer方法,结合视频扩散先验的迭代 refinment 技术,实现了从稀疏视角数据生成高质量4D高斯泼溅场景。该方法在动态场景重建方面取得了显著进展。

Read more →

OnomatoBridge: Onomatopoeia Translation and Rendering Pipeline in Manga

OnomatoBridge:漫画拟声词的翻译与渲染管线

本文提出了OnomatoBridge系统,实现了漫画拟声词(拟音语)的自动翻译与视觉渲染。该系统能够理解拟声词的文化语境,并在保持漫画视觉风格的同时完成跨语言转换。

Read more →


DeepMind Blog

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

推出Gemini 3.8 Live和3.8 Live扩展思维

DeepMind发布了Gemini 3.8 Live系列模型,包括标准版和扩展思维版。Live版本专为实时交互场景优化,支持低延迟响应和流式输出。扩展思维版则增强了复杂推理和多步问题解决能力,适用于需要深度思考的应用场景。

Read more →

AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome

AlphaGenome Atlas:人类基因组中每种可能DNA碱基变化的预测图谱

DeepMind发布了AlphaGenome Atlas,这是首个覆盖人类基因组中所有可能单碱基变化的预测图谱。该图谱利用AlphaFold技术预测每种基因变异的功能影响,为精准医学和遗传学研究提供了前所未有的资源。

Read more →

Introducing WeatherNext 3, our most advanced and accurate global weather AI model

推出WeatherNext 3——最先进精准的全球天气AI模型

DeepMind发布了WeatherNext 3,这是其最先进的全球天气预测AI模型。该模型在预测精度和计算效率方面均实现了显著提升,能够提供更准确的短期和中期天气预报,对防灾减灾具有重要意义。

Read more →

Proactive cyber defense for governments and enterprises

为政府和企业提供主动网络防御

DeepMind推出了面向政府和企业客户的主动网络防御解决方案,利用AI技术实时检测和响应网络威胁。该系统能够预测潜在攻击路径并采取预防性措施,显著提升组织的安全防护能力。

Read more →

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

推出Gemini 3.8 Flash和3.8 Flash Cyber

DeepMind发布了Gemini 3.8 Flash系列,包括标准Flash版和专为网络安全设计的Flash Cyber版。Flash版本在保持高性能的同时大幅降低了推理延迟和计算成本,适合大规模部署场景。

Read more →

Introducing agentic video understanding with Gemini

借助Gemini推出智能体视频理解

DeepMind介绍了Gemini的智能体视频理解能力,使AI能够像人类一样主动探索和分析视频内容。该功能支持复杂视频场景的推理、问答和内容总结,为视频分析和监控应用开辟了新可能。

Read more →

Gemini Omni 1.1 Flash lets you build with more control

Gemini Omni 1.1 Flash让你构建时拥有更多控制

DeepMind发布了Gemini Omni 1.1 Flash,在保持Omni系列多模态能力的同时提供了更细粒度的控制选项。开发者可以精确调节模型的输出风格、推理深度和安全级别,满足不同应用场景的需求。

Read more →

Piloting the world’s first double-blind AI evaluations

试点全球首个双盲AI评估

DeepMind启动了全球首个双盲AI评估试点项目,评估者和被评估模型均不知道测试的具体内容。这一方法旨在消除评估偏差,提供更客观、更可靠的AI能力评估结果。

Read more →

Intelligent transcription with Gemini 3.5 Transcribe

借助Gemini 3.5 Transcribe实现智能转录

DeepMind发布了Gemini 3.5 Transcribe,利用Gemini模型实现智能化的语音转录服务。该系统不仅能够高精度转写语音内容,还能自动识别说话人、标注关键信息和生成结构化摘要。

Read more →

From Atari to EVE Online: Building on 15 Years of AI Research in Games

从Atari到EVE Online:15年游戏AI研究的积淀

DeepMind回顾了15年来在游戏AI领域的研究历程,从早期的Atari游戏到复杂的EVE Online多人在线游戏。文章展示了AI在游戏环境中取得的突破性进展,以及这些研究对通用AI发展的贡献。

Read more →


Meta Engineering

Open-Sourcing Rebalancer: A Generic, High-Performance Library for Solving Assignment Problems

开源Rebalancer:解决分配问题的通用高性能库

Meta开源了Rebalancer库,这是一个用于解决分配问题的高性能通用库。该库基于Meta内部大规模生产环境的优化经验开发,支持多种分配算法和约束条件,适用于资源调度、任务分配等场景。

Read more →

Inside Petal: Building the World’s First Petabit-Class Transoceanic Subsea Cable

Petal内幕:建造世界首条拍比特级跨洋海底光缆

本文详细介绍了Meta主导建造的Petal海底光缆项目,这是世界上第一条设计容量达到拍比特级的跨洋海底光缆。该项目采用了创新的光纤技术和信号处理方案,将全球互联网带宽推向了新的高度。

Read more →

ZGateway: Learnings from Putting a Proxy in Front of ZippyDB

ZGateway:在ZippyDB前部署代理的经验总结

Meta分享了在ZippyDB数据库前部署ZGateway代理的技术经验。ZGateway作为统一入口层,提供了负载均衡、请求路由和故障转移等功能,显著提升了ZippyDB的可用性和性能。

Read more →

An Organizational Second Brain: Building an AI That Learns From Experts

组织第二大脑:构建从专家学习的AI

Meta介绍了”组织第二大脑”项目,这是一个能够从组织内部专家知识中学习的AI系统。该系统通过知识提取、结构化存储和智能检索,将分散的专家知识转化为可复用的组织资产。

Read more →

MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet

MetaRoCE:为AI规模以太网构建的新型RDMA传输协议

Meta发布了MetaRoCE协议,这是一种专为AI规模以太网设计的新型RDMA(远程直接内存访问)传输方案。MetaRoCE在保持RDMA低延迟优势的同时,更好地适配了以太网的网络特性。

Read more →

MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines

MTIA 300:Meta首款内置网卡和通信卸载引擎的训练芯片

Meta发布了MTIA 300训练芯片,这是其首款内置网络接口卡(NIC)和通信卸载引擎的AI训练芯片。该设计显著减少了AI训练集群中的通信开销,提升了大规模分布式训练的效率。

Read more →

How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees

如何在WhatsApp上构建诈骗警报:端到端加密与可验证保障

Meta分享了在WhatsApp上构建诈骗警报系统的技术细节,该系统在保持端到端加密的同时提供了可验证的安全保障。通过隐私保护技术,系统能够在不泄露消息内容的情况下识别和警告潜在诈骗。

Read more →

From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking

从用户序列到缩放定律:Meta广告排序的多阶段架构

本文介绍了Meta广告排序系统的多阶段架构设计,从用户行为序列建模到广告排序的缩放定律研究。该系统通过分阶段优化实现了广告推荐精度和效率的显著提升。

Read more →

GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model

GEM训练:Meta如何将LLM规模广告基础模型的效率提升一倍

Meta介绍了GEM训练方法,该方法使其LLM规模的广告基础模型训练效率提升了一倍。GEM通过创新的分布式训练策略和梯度优化技术,在保持模型质量的同时大幅降低了训练成本。

Read more →


Towards Data Science

A New Kind of Model for AI Decision-Making?

AI决策的新模型类型?

本文探讨了一种新型AI决策模型的可能性,分析了传统决策框架的局限性以及新模型在不确定性处理、价值权衡和可解释性方面的潜在优势。文章引发了对AI决策范式的深入思考。

Read more →

GPT-6 Astra Just Hit OpenAI’s Highest Cybersecurity Risk Level

GPT-6 Astra刚刚触及OpenAI最高网络安全风险等级

本文报道了GPT-6 Astra在安全评估中触及OpenAI最高网络安全风险等级的消息,引发了对超大规模模型安全边界的讨论。文章分析了可能导致高风险等级的技术因素和缓解措施。

Read more →

Google Offered $10M for a Dying Airline’s Data. How Can You Value Yours?

谷歌为一家濒临破产的航空公司数据出价1000万美元。你的数据价值几何?

本文以谷歌收购濒死航空公司数据为例,探讨了企业数据估值的方法论。文章提供了数据价值评估的框架和工具,帮助企业和数据所有者理解自身数据的商业价值。

Read more →

Your AI Assistant Wrote the Code. Who Checked the Defaults?

你的AI助手写了代码。谁检查了默认值?

本文提出了一个关于AI辅助编程的重要问题:当AI生成代码时,谁在检查默认配置和安全设置?文章强调了AI生成代码的审查机制和人工验证的必要性。

Read more →

GraphRAG: A Practitioner’s Guide to 6 Advanced Architectural Patterns

GraphRAG:6种高级架构模式的实践者指南

本文提供了GraphRAG(图增强检索生成)的完整实践指南,详细介绍了六种高级架构模式。每种模式都配有实际案例和实现建议,帮助开发者构建更强大的检索增强生成系统。

Read more →

CBAM Paper Walkthrough: The Double-Attention Mechanism

CBAM论文精读:双重注意力机制

本文对CBAM(卷积块注意力模块)论文进行了详细解读,深入分析了其双重注意力机制——通道注意力和空间注意力——的设计原理和实现细节。该机制已成为计算机视觉领域的经典注意力模块。

Read more →

One Vendor, Four Spellings: How Deterministic Stages Beat Similarity Scores

同一供应商,四种拼法:确定性阶段如何战胜相似度分数

本文通过一个实际案例展示了确定性处理阶段相比单纯相似度匹配的优势。即使面对同一供应商名称的多种拼写变体,分阶段的确定性处理也能实现更准确的实体匹配。

Read more →

AI Made Me 5x Faster. It Also Made Me 5x Worse at My Job

AI让我快了5倍。也让我在工作中差了5倍

本文作者分享了一个关于AI效率悖论的个人经历:AI工具虽然将工作效率提升了5倍,但同时也导致了工作质量的显著下降。文章探讨了速度与质量之间的平衡问题。

Read more →

Coding Agents Keep Shipping Silent Failures — Here Is How to Catch Them

编码智能体持续交付静默失败——如何捕获它们

本文讨论了AI编码智能体产生的”静默失败”问题——代码看似正常工作但存在潜在缺陷。文章提供了一套检测和预防策略,帮助开发者识别和修复这些隐蔽的错误。

Read more →

We Pinned Our Model Version to Stay Safe. The Provider Deprecated It Anyway

我们固定了模型版本以确保安全。提供商最终还是弃用了它

本文讲述了一个关于AI模型版本管理的教训:即使固定了模型版本以确保生产环境的稳定性,服务提供商仍可能单方面弃用该版本。文章建议采用更灵活的版本管理策略。

Read more →

生成二维码中...
↗

请点击右上角 ···

选择 发送给朋友 或 收藏