zgba 站群

2026-08-16

今日要点


Hacker News

AI has access to a vastly larger working memory than the human brain

AI 拥有远超人类大脑的工作记忆容量

文章提出一个被忽视的观点:AI 在解决复杂数学问题时表现优异,可能并非因为它”更聪明”或发展出了真正的数学直觉,而是因为它拥有远超人类大脑的工作记忆容量。更准确地说,AI 可以访问一个巨大的外部符号工作空间,这个空间执行了许多人类工作记忆所承担的功能。人类数学家只能在工作记忆中同时保持少量不熟悉元素,而 AI 可以同时处理大量符号和中间步骤。这种差异在数学领域尤为重要,可能解释了 AI 在数学推理任务中的出色表现。

Read more →


Semaglutide linked to lower predicted dementia risk

司美格鲁肽与较低的痴呆预测风险相关

一项发表在《阿尔茨海默病与痴呆症》期刊上的研究(评分 438,306 条评论)发现,使用司美格鲁肽(Semaglutide)与较低的痴呆预测风险相关。司美格鲁肽是一种 GLP-1 受体激动剂,最初用于治疗 2 型糖尿病和肥胖症。这一发现引发了医学界对代谢类药物在神经退行性疾病预防中潜在作用的广泛讨论。

Read more →


Abdominal fat predicts heart disease risk better than BMI

腹部脂肪比 BMI 更能预测心脏病风险

美国心脏病学会(ACC)发布的一项新研究表明,腹部脂肪(内脏脂肪)在预测心脏病风险方面比传统的身体质量指数(BMI)更为准确。该研究指出,BMI 无法区分肌肉和脂肪,也无法反映脂肪在体内的分布情况,而腹部脂肪与心血管疾病风险之间存在更直接的关联。这一发现可能促使临床医生重新评估心血管风险评估的标准方法。

Read more →


At-home test for infected ticks could improve Lyme Disease diagnosis

居家蜱虫感染检测可能改善莱姆病诊断

美国每年超过 3100 万人(近十分之一人口)被蜱虫叮咬,这些寄生虫可在 36 至 48 小时内传播数十种疾病,包括莱姆病、巴贝西虫病、落基山斑点热等。今年春季,CDC 报告蜱虫传播疾病相关的急诊就诊量激增,莱姆病是最常见的诊断。每年约有 47.6 万名患者接受莱姆病治疗。现在,一种新的居家蜱虫感染检测工具正在开发中,有望在蜱虫叮咬后快速检测是否携带病原体,从而改善早期诊断和治疗。

Read more →


Super El Niño Keeps Growing as New Forecasts Reach Record Territory Ahead Winter

超级厄尔尼诺持续增强,新预测显示冬季前将达历史纪录

超级厄尔尼诺正在热带太平洋持续快速增强,最新海洋和大气数据显示其发展进一步加速。最新长期预测再次上调了峰值预期,将 2026 年事件推向更深的历史纪录区间。这一快速增长的背后是异常强烈的西风与海洋次表层热量的组合。赤道太平洋出现了创纪录的西风异常,同时一股强大的开尔文波在表层下方继续向东传播,为超级厄尔尼诺提供了额外的暖水能量。

Read more →


A spectre is haunting Unicode

幽灵字符正在困扰 Unicode

文章讲述了日本 JIS X 0208 编码标准中”幽灵字符”(幽霊文字)的由来。1978 年日本经济产业省建立了这一编码标准,但发布后人们发现其中几个字符没有明显的来源,无人知道它们的含义或读音。这些字符长期作为未解之谜被遗忘,直到 1997 年才有人展开调查。文章追溯了这些幽灵字符的起源,揭示了编码标准制定过程中一个鲜为人知的历史插曲,并探讨了其对 Unicode 标准的潜在影响。

Read more →


Cultivating a state of mind where new ideas are born (2023)

培养孕育新想法的心境(2023)

文章引用英格玛·伯格曼的话”空虚是转向你自己面孔的镜子”,探讨了新想法产生的条件。作者回顾了 2010 年代初流行的创业孵化器模式——为创业者提供共享办公和社交空间以激发创意——但指出这种模式几乎没有产生著名的成功案例。Sam Altman 在 2015 年对此评论说,不(提供社交空间)才是更好的选择。文章深入探讨了孤独、静默与创造力之间的关系,以及为什么真正的创新往往需要独处而非社交。

Read more →


A controversial Alzheimer’s surgery is said to reverse symptoms

一项有争议的阿尔茨海默病手术据称可逆转症状

《自然》杂志报道了一项有争议的阿尔茨海默病手术的最新进展。视频展示了一位 80 多岁的老人躺在病床上,面容憔悴。三天后,老人变得警觉,能够认出儿子。六个月后,他坐直身体参与对话。八个月时,他快步走在医院走廊上,能背诵近完整的记忆内容。这项手术引发了医学界的广泛争议,但初步结果显示它可能逆转阿尔茨海默病的症状,为这一目前无法治愈的疾病带来了新的希望。

Read more →


Software Engineering fundamentals matter more

软件工程基础比以往更重要

文章探讨了在 AI 代理工程(agentic engineering)热潮中,软件工程基础的重要性。作者承认自己也有冒名顶替综合征,思考”什么是软件工程师”。在互联网上充斥着关于 AI 代理能做什么的噪音时,作者发现真正重要的是在解决软件和系统开发难题时做出正确的选择。作者认为,在主要模型提供商的炒作和营销狂热之外,AI 工具确实是一个强大的工具,但真正做出惊人成果的人往往不是那些大肆宣扬的人。

Read more →


Engineers will do anything to avoid learning from history

工程师会不惜一切代价避免从历史中学习

文章(评分 158,103 条评论)探讨了工程师行业中一个普遍现象:工程师们倾向于重新发明轮子,而不是从历史中学习。作者指出,许多技术决策和架构选择在过去已经被反复讨论和验证,但新一代工程师往往忽视这些历史经验,导致重复犯错。文章呼吁工程师们更加重视技术历史,从过去的成功和失败中汲取教训。

Read more →


AI in drug discovery – what it is, where we stand and the path forward

AI 在药物发现中的应用——现状与未来路径

文章全面回顾了 AI 在药物发现领域的应用现状。AI 正在改变药物研发的传统流程,从靶点发现、分子设计到临床试验优化,各个环节都在受益于机器学习技术。文章分析了当前 AI 药物发现的成功案例和面临的挑战,包括数据质量、模型可解释性、监管审批等问题,并展望了未来的发展方向。

Read more →


What happens when an LLM never sees material beyond fifth grade?

当 LLM 从未见过五年级以上的内容时会发生什么?

“Little Learner”项目训练了一个 5B 参数模型,其训练数据仅限于美国小学五年级以下的课程内容。研究团队从 FineWeb-Edu 中筛选出 880 亿 token 的语料库,通过五阶段过滤流程与共同核心标准(K-5)对齐,明确排除了五年级以上教授的概念、事实和词汇。研究提供了 0.6B、1.3B 和 5B 三个规模的模型,旨在创建一个具有可解释知识边界的聊天模型,帮助研究者理解模型能力与训练数据范围之间的关系。

Read more →


The Dutch community where people live on strips of land in a lake

荷兰人住在湖中狭长土地上的社区

在荷兰 Loosdrecht 镇,居民们住在湖中狭长的岛屿上,房屋建在仅靠船只可达的细长土地上。这种独特的地理格局是人工造成的——几个世纪前,人们用船挖掘沼泽地开采泥炭作为燃料,留下了这些狭长的土地用于卸载和晾晒泥炭。20 世纪时,开发商意识到可以在这些剩余的土地上建造房屋。如今,数百名居民生活在这种独特的船行可达的住宅中。

Read more →


Europe’s scorched landscapes seen from space after summer heatwaves

夏季热浪后从太空看到的欧洲焦土景观

BBC 通过卫星图像展示了今年夏季极端高温对西欧的影响。自 5 月以来连续的热浪导致冰川萎缩、野火烧焦的区域、绿色田野变为干旱土地以及河流水位下降。一些地标也受到影响——法国凡尔赛宫在卫星图像中呈现为被棕色田野包围的树木岛屿。欧盟哥白尼气候监测服务确认,西欧经历了有记录以来最热的 6 月至 7 月。英国气象局指出,持续的高压天气系统是热浪的直接原因。

Read more →


I Remain a Skeptic

我仍然持怀疑态度

作者表示,他仍然不使用 LLM 做任何他真正关心的事情。他列举了多个怀疑理由:环境、社会、政治方面的担忧,包括生态系统锁定、习得性依赖、自主权丧失、哲学层面的顾虑,以及对劳工议价能力的有意削弱。但最重要的是,在构建非平凡软件方面 LLM 是否真正有效,这个问题仍然远未解决。作者指出,这场”革命”已经进行了 4 年,但行业几乎没有拿出什么成果——软件质量没有提高,速度没有变快,生产成本也没有降低。

Read more →


OpenAI Blog

The builder’s guide to GPT‑5.6

GPT-5.6 构建者指南

OpenAI 发布了 GPT-5.6 的构建者指南,详细介绍了初创企业如何利用 GPT-5.6 构建更快、更具成本效益的 AI 代理。指南涵盖了智能模型选择策略和新的 Responses API 功能,帮助开发者更高效地集成 GPT-5.6 到他们的产品中。

Read more →


Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed

预览 Ultrafast 模式:GPT-5.6 Sol 速度提升最高 14 倍

OpenAI 预览了 Ultrafast 模式,这是一个新的 API 服务层级,可将 GPT-5.6 Sol 的运行速度提升最高 14 倍。该模式由 Cerebras 提供技术支持,最高可达每秒 750 个输出 token。这一突破性的速度提升将使实时 AI 应用成为可能,包括实时对话、即时代码补全和高速数据处理等场景。

Read more →


OpenAI appoints Dali Rajic as Chief Revenue Officer

OpenAI 任命 Dali Rajic 为首席营收官

OpenAI 任命 Dali Rajic 为首席营收官(CRO),负责领导其全球营收组织,帮助企业充分实现 AI 的价值。这一任命标志着 OpenAI 在商业化方面迈出了重要一步,表明公司正从以研究为导向转向更加重视商业增长和收入生成。

Read more →


From assistance to execution: How enterprises put AI to work

从辅助到执行:企业如何部署 AI

OpenAI 发布了一项研究,揭示了企业如何采用代理式 AI(agentic AI),使用 ChatGPT 和 Codex 等工具。研究发现,领先企业在 AI 采用方面正在拉开与其他企业的差距。报告展示了企业从简单的 AI 辅助工具向自主执行的 AI 代理转变的趋势,以及这一转变带来的效率提升和成本节约。

Read more →


How RingCentral builds AI-native work from engineering to ops

RingCentral 如何从工程到运维构建 AI 原生工作流

文章介绍了 RingCentral 如何利用 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程和运维部门集中运营智能。RingCentral 展示了如何将 AI 深度集成到其工作流程中,从代码开发到运维监控,实现端到端的 AI 原生工作模式。

Read more →


Testing ads in ChatGPT

在 ChatGPT 中测试广告

OpenAI 开始在 ChatGPT 中测试广告功能,以支持免费访问。广告将采用明确的标签标识,保持答案独立性,提供强大的隐私保护,并赋予用户控制权。这一举措标志着 OpenAI 在探索可持续商业模式方面迈出了重要一步,试图在提供高质量 AI 服务的同时实现收入增长。

Read more →


Daybreak models are now available on AWS

Daybreak 模型现已在 AWS 上可用

OpenAI 与 AWS 合作,通过 Amazon Bedrock 提供 Daybreak 网络安全能力,以支持企业安全工作流程。Daybreak 是 OpenAI 专门针对网络安全领域训练的模型,能够帮助企业检测漏洞、分析威胁和自动化安全响应。

Read more →


OpenAI’s letter to Governor Abbott on responsible AI infrastructure in Texas

OpenAI 致德克萨斯州州长 Abbott 关于负责任的 AI 基础设施的信

OpenAI 向德克萨斯州州长 Greg Abbott 发送了一封信,概述了其在德克萨斯州建设负责任 AI 基础设施的承诺。信中表达了对可靠、透明增长的承诺,强调这种增长将使德克萨斯州居民受益。

Read more →


Model ML completes finance work more efficiently with GPT-5.6 Sol

Model ML 使用 GPT-5.6 Sol 更高效地完成财务工作

Model ML 公司展示了如何使用 GPT-5.6 Sol 完成财务工作,从研究分析到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿。这一案例展示了 AI 在财务领域的实际应用价值,包括自动化报告生成、数据分析和决策支持。

Read more →


What building an AI-native finance function taught me

构建 AI 原生财务职能教会我的事

OpenAI 首席财务官 Sarah Friar 分享了构建 AI 原生财务职能的五个经验教训,涵盖从自动化预测到更强的控制机制和 AI 投资回报率评估。她的分享为其他企业提供了宝贵的参考,展示了如何将 AI 深度融入财务管理的各个环节。

Read more →


Anthropic Blog

Introducing Claude Opus 5

介绍 Claude Opus 5

Anthropic 发布了 Claude Opus 5,这是 Opus 系列的重大升级。Opus 5 在驱动长期运行的代理方面实现了质的飞跃,同时在编码和专业工作方面也有显著提升。该模型特别适合需要长时间运行和复杂推理的任务,为企业级 AI 应用提供了更强大的基础。

Read more →


Inviting hard questions

邀请提出难题

Anthropic 邀请公众提出关于 AI 的最困难问题,并承诺在解决这些问题时展示其工作过程。这一举措体现了 Anthropic 对透明度和公众参与的重视,旨在通过开放对话来推动 AI 安全研究的发展。

Read more →


Redeploying Fable 5

重新部署 Fable 5

Fable 5 将于 7 月 1 日在全球重新上线。同时,Anthropic 与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同提出了一个行业范围的框架,用于评估越狱攻击的严重程度。这一框架旨在为 AI 安全评估提供更统一的标准。

Read more →


Introducing Claude Sonnet 5

介绍 Claude Sonnet 5

Anthropic 发布了 Claude Sonnet 5,该模型在编码、代理和专业工作方面实现了前沿性能,同时能够在大规模场景下高效运行。Sonnet 5 在保持高性能的同时优化了推理速度和成本,使其成为企业级应用的理想选择。

Read more →


How Claude’s text watermark works

Claude 文本水印的工作原理

Anthropic 详细介绍了 Claude 文本水印的工作机制。该水印技术能够在 AI 生成的文本中嵌入不可见的标识信息,帮助识别 AI 生成内容,同时不影响文本的可读性和自然性。这一技术对于打击 AI 生成内容的滥用具有重要意义。

Read more →


Improving Fable 5’s biology safeguards

改进 Fable 5 的生物学安全措施

Anthropic 宣布改进了 Fable 5 游戏中的生物学安全措施。这些改进旨在防止玩家利用游戏机制获取危险的生物学信息,体现了 Anthropic 在 AI 安全方面的持续投入。

Read more →


Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer

Mariano-Florentino (Tino) Cuéllar 加入 Anthropic 担任首席全球事务官

Mariano-Florentino (Tino) Cuéllar 将加入 Anthropic 担任首席全球事务官。Cuéllar 此前曾担任美国贸易代表,拥有丰富的国际贸易和外交经验。他的加入将帮助 Anthropic 更好地应对全球范围内的 AI 治理和政策挑战。

Read more →


Investigating three real-world incidents in our cybersecurity evaluations

调查网络安全评估中的三个真实事件

Anthropic 分享了对其网络安全评估中三个真实事件的调查结果。这些事件涉及 AI 模型在网络安全场景中的实际表现,调查结果将帮助改进 AI 系统的安全评估方法和防御策略。

Read more →


Our position on open-weights models

我们对开放权重模型的立场

Anthropic 阐述了其对开放权重模型的立场。文章讨论了开放权重模型在 AI 安全和治理方面的利弊,以及 Anthropic 在模型开放策略上的考量。这一立场声明反映了 Anthropic 在推动 AI 创新与确保 AI 安全之间的平衡考量。

Read more →


Cognizant and Anthropic expand their partnership to bring Claude to enterprise clients

Cognizant 与 Anthropic 扩大合作,将 Claude 带给企业客户

Cognizant 与 Anthropic 扩大了合作伙伴关系,将 Claude 模型带给更多企业客户。这一合作将使 Cognizant 的客户能够利用 Claude 的强大能力来优化业务流程、提高生产效率,并推动数字化转型。

Read more →


Google AI Blog

Bring your spreadsheet data to life with Sheets canvas

使用 Sheets Canvas 让电子表格数据活起来

Google 推出了 Sheets Canvas 功能,可以将电子表格数据转化为交互式仪表板、自定义学习追踪器、座位表等,只需一个简单的提示词即可实现。这一功能将 Google Sheets 从传统的数据处理工具升级为可视化和交互式的智能工作平台。

Read more →


AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities

AMIE 研究医疗 AI 系统展示实时临床视频咨询能力

Google 介绍了 AMIE 系统,这是一个研究性的医疗 AI 系统,在模拟环境中展示了实时临床视频咨询能力。这是首次有 AI 系统能够在模拟临床环境中进行实时视频咨询,展示了 AI 在医疗领域的巨大潜力。

Read more →


Evolve your marketing with new AI tools

使用新 AI 工具进化你的营销

Google 发布了 Google Ads 和 Google Analytics 的新 AI 和代理式体验,可以简化营销工作流程。这些新工具利用 AI 自动化营销任务,帮助营销人员更高效地管理广告活动、分析数据并优化投放策略。

Read more →


The latest AI news we announced in July 2026

2026 年 7 月我们宣布的最新 AI 新闻

Google 汇总了 2026 年 7 月的最新 AI 更新,涵盖了模型发布、产品功能更新、研究突破等多个方面。这份汇总为读者提供了 Google AI 领域最新进展的全面概览。

Read more →


Inside our 353,000-person vibe coding course

35.3 万人参与的 Vibe Coding 课程内幕

Kaggle 与 Google 合作举办的 AI Agents Intensive 课程吸引了 35.3 万名学习者,这是一门免费课程,旨在帮助学习者构建和部署下一代 AI 代理。课程涵盖了 AI 代理开发的核心概念和实践技能,反映了 AI 教育领域的快速增长。

Read more →


Gemini API Managed Agents: 3.6 Flash, hooks, and more

Gemini API 托管代理:3.6 Flash、Hooks 等

Google 宣布了 Gemini API 托管代理的新功能,包括 3.6 Flash 模型、Hooks 等,帮助开发者构建可靠、可投入生产的代理应用。这些新功能降低了 AI 代理开发的门槛,使更多开发者能够轻松构建生产级 AI 应用。

Read more →


5 ways AI Mode in Search helps you enjoy the real world

AI Mode 搜索帮助你享受现实世界的 5 种方式

Google 介绍了搜索 AI Mode 的 5 种实用功能,帮助用户更好地享受现实生活。无论是预订演唱会门票还是寻找完美的旅行目的地,AI 工具都能提供个性化的建议和规划,帮助用户最大化利用离线时间。

Read more →


使用 Google 搜索举办完美晚宴的 5 种方式

Google 分享了利用搜索 AI 功能举办完美晚宴的 5 种方法,包括设计菜单、布置餐桌和处理其他派对策划任务。这些 AI 功能可以帮助用户轻松规划从食材采购到餐桌布置的各个环节。

Read more →


3 Google updates from Galaxy Unpacked 2026

Galaxy Unpacked 2026 上的 3 项 Google 更新

Google 分享了在 Galaxy Unpacked 2026 上宣布的 3 项更新,展示了三星用户如何在新折叠屏手机、手表和眼镜上提升生产力。这些更新体现了 Google 与三星在 AI 和硬件领域的深度合作。

Read more →


将更多应用连接到搜索

Google 宣布用户将能够在 AI Mode 中安全地链接和交互使用常用服务。这一功能将搜索与用户日常使用的应用程序深度整合,提供更无缝的 AI 体验。

Read more →


Hugging Face Blog

State of Open Models: Summer 2026 Observations

开放模型现状:2026 年夏季观察

Hugging Face 发布了 2026 年夏季开放模型生态系统的观察报告,分析了当前开放模型的发展态势、主要趋势和挑战。报告涵盖了模型性能、社区活跃度、商业应用等多个维度,为开发者和研究者提供了全面的行业洞察。

Read more →


Record, train, and deploy from one place with Strands Agents, LeRobot, and Hugging Face Storage Buckets

使用 Strands Agents、LeRobot 和 Hugging Face 存储桶实现一站式录制、训练和部署

Hugging Face 与 Amazon 合作,展示了如何使用 Strands Agents、LeRobot 和 Hugging Face 存储桶实现机器人数据的一站式录制、训练和部署。这一集成方案简化了机器人 AI 的开发流程,使开发者能够更高效地构建和部署机器人应用。

Read more →


What We Learned by Reproducing 2,200 papers from ICML

复现 ICML 2200 篇论文后我们学到了什么

Hugging Face 团队复现了 ICML 2026 的 2200 篇论文,分享了复现过程中的经验和教训。这一大规模复现项目揭示了机器学习研究中可复现性的现状,为研究社区提供了宝贵的参考。

Read more →


Introducing OlmoEarth embeddings: Custom embedding exports from OlmoEarth Studio

介绍 OlmoEarth 嵌入:从 OlmoEarth Studio 导出自定义嵌入

Allen AI 推出了 OlmoEarth 嵌入功能,允许用户从 OlmoEarth Studio 导出自定义嵌入用于下游分析。这一功能为地理空间 AI 应用提供了更灵活的工具,支持各种定制化的分析需求。

Read more →


LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

LFM2.5-VL-3B:为边缘设备提供更好的视觉能力

Liquid AI 发布了 LFM2.5-VL-3B 模型,这是一个专为边缘设备优化的视觉语言模型。该模型在保持高性能的同时大幅降低了计算需求,使其能够在资源受限的边缘设备上高效运行。

Read more →


Thinking of ACE? We Can Do It with Fewer Tokens

想到 ACE?我们可以用更少的 Token 实现

IBM Research 展示了如何使用更少的 Token 实现 ACE(自适应计算引擎)的功能。这一研究通过优化模型架构和推理策略,在保持性能的同时显著降低了 Token 消耗,为高效 AI 推理提供了新的思路。

Read more →


Build Low-Latency Multilingual Voice Agents: Open Weights & Full Deployment Control with NVIDIA Magpie TTS

使用 NVIDIA Magpie TTS 构建低延迟多语言语音代理

NVIDIA 发布了 Magpie TTS,一个开放权重的多语言文本转语音模型,支持低延迟语音代理的构建。该模型提供了完整的部署控制,使开发者能够在各种环境中部署高性能的多语言语音应用。

Read more →


Making Knowledge Distillation Cheap Enough to Run at Scale

让知识蒸馏便宜到可以大规模运行

Multiverse Computing CAI 展示了如何使知识蒸馏的成本降低到可以大规模运行的水平。这一技术突破将使知识蒸馏成为更广泛可用的模型优化工具,帮助开发者在保持模型性能的同时大幅降低计算成本。

Read more →


Meta is back with Muse Glimmer: local, agentic, multimodal, and open source

Meta 回归:Muse Glimmer——本地、代理式、多模态且开源

Meta 发布了 Muse Glimmer,一个本地运行的、代理式的、多模态的开源 AI 模型。该模型支持在本地设备上运行,无需云端依赖,同时具备多模态理解和生成能力,为隐私敏感的应用场景提供了理想的解决方案。

Read more →


Baseten on Hugging Face Inference Providers

Baseten 加入 Hugging Face 推理提供商

Baseten 正式加入 Hugging Face 推理提供商网络,为 Hugging Face 用户提供更丰富的模型部署选项。Baseten 以其高性能的模型部署平台而闻名,此次合作将使更多开发者能够轻松部署和扩展他们的 AI 模型。

Read more →


The Gradient

After Orthogonality: Virtue-Ethical Agency and AI Alignment

超越正交性:美德伦理代理与 AI 对齐

文章论证了理性的人没有目标,理性的 AI 也不应该有目标。人类行为的理性不在于将其指向某个最终的”目标”,而在于将行动与”实践”对齐——即行动网络、行动倾向和行动评估标准的网络。作者提出了一种基于美德伦理的 AI 对齐框架,挑战了传统的目标导向 AI 对齐方法。

Read more →


AGI Is Not Multimodal

AGI 不是多模态的

文章引用 Terry Winograd 的话”在将语言投射为思维模型时,我们忽视了支撑我们智能的隐性具身理解”,论证了 AGI 不应被简单地视为多模态模型。作者认为,当前生成式 AI 模型的成功让一些人认为 AGI 即将到来,但这些模型并未真正捕捉人类智能的本质,特别是缺乏具身认知和隐性理解。

Read more →


Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research

形状、对称性与结构:数学在机器学习研究中的角色变化

文章探讨了数学在现代机器学习研究中的角色变化。过去十年见证了机器学习研究方式的转变——精心设计的、数学原理驱动的架构仅带来边际改进,而计算密集型和工程优先的努力通过扩展到更大的训练集取得了显著进展。文章分析了这一转变的原因和影响。

Read more →


What’s Missing From LLM Chatbots: A Sense of Purpose

LLM 聊天机器人缺少什么:目标感

文章指出,基于 LLM 的聊天机器人能力每月都在进步,但这些改进主要通过 MMLU、HumanEval 和 MATH 等基准来衡量。随着这些指标越来越饱和,用户体验是否也在按比例提升?作者认为,LLM 聊天机器人缺少一种”目标感”,这限制了它们与用户建立更深层次互动的能力。

Read more →


We Need Positive Visions for AI Grounded in Wellbeing

我们需要基于福祉的 AI 积极愿景

文章呼吁为 AI 建立基于人类福祉的积极愿景。作者设想,如果十年前有人告诉你现在可以与一个百科全书式的 AI 自然对话,它会创作图像、编写代码、辩论哲学,你会不会认为这项技术几乎肯定会改变社会?文章探讨了 AI 对社会的积极影响,并呼吁关注 AI 如何促进人类福祉。

Read more →


Financial Market Applications of LLMs

LLM 在金融市场中的应用

文章探讨了大型语言模型在金融市场中的应用。2023 年 AI 革命推动了私营和上市公司的疯狂投资,ChatGPT 等变革性消费产品由擅长建模 token 序列的 LLM 驱动。文章分析了 LLM 在金融分析、风险管理、交易策略等领域的潜力和挑战。

Read more →


A Brief Overview of Gender Bias in AI

AI 中性别偏见概述

文章简要概述和讨论了 AI 中的性别偏见问题。作者分析了性别偏见在 AI 系统中的表现形式、产生原因以及可能的缓解策略,为理解和解决 AI 公平性问题提供了基础参考。

Read more →


Mamba Explained

Mamba 详解

文章介绍了 Mamba,一种基于状态空间模型(SSM)的新型 AI 模型,作为广泛使用的 Transformer 模型的有力替代方案。Mamba 解决了 Transformer 在处理长序列时的效率问题,通过状态空间模型实现了更高效的序列建模,为长文本处理提供了新的技术路径。

Read more →


Car-GPT: Could LLMs finally make self-driving cars happen?

Car-GPT:LLM 能否最终实现自动驾驶?

文章探讨了大型语言模型在自动驾驶中的效用。作者分析了 LLM 在自动驾驶场景中的潜在应用,包括环境理解、决策制定和路径规划等,同时讨论了将 LLM 应用于自动驾驶面临的关键挑战,如实时性要求、安全性和可靠性等。

Read more →


Do text embeddings perfectly encode text?

文本嵌入能完美编码文本吗?

文章探讨了文本嵌入的逆向问题。“Vec2text”技术可以准确地将嵌入向量还原为原始文本,这凸显了重新审视嵌入数据安全协议的紧迫性。这一发现对 AI 安全具有重要意义,因为嵌入数据可能包含敏感信息,需要更严格的安全保护措施。

Read more →


DeepMind Blog

Introducing Gemini 3.7 Flash

介绍 Gemini 3.7 Flash

Google DeepMind 发布了 Gemini 3.7 Flash 模型,这是 Gemini 系列的最新升级版本。该模型在速度和性能之间实现了更好的平衡,适用于需要快速响应的应用场景。

Read more →


Putting sign language AI into users’ hands

将手语 AI 交到用户手中

DeepMind 推出了 SL2T(手语转文本)模型,这是一个突破性模型,为聋人和重听用户提供新的手语功能。该模型能够将手语实时转换为文本,帮助聋人和重听用户更好地与外界沟通。

Read more →


WeatherNext: AI model achieves breakthrough in forecasting cyclones

WeatherNext:AI 模型在飓风预测方面取得突破

DeepMind 的 WeatherNext AI 模型在飓风预测方面取得了突破性进展。该模型能够更准确地预测飓风的路径、强度和影响范围,为灾害预警和应急响应提供了更可靠的工具。

Read more →


Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

Gemini Robotics ER 2:以视频理解、任务编排和多机器人协作驱动机器人

Gemini Robotics ER 2 帮助机器人进行推理、协作和解决现实世界任务。该版本在视频理解、工具编排和多机器人协作方面实现了质的飞跃,代表了机器人 AI 的重要进步。

Read more →


We’re launching Lyria 3.5 in Google Flow Music

在 Google Flow Music 中推出 Lyria 3.5

DeepMind 在 Google Flow Music 中推出了 Lyria 3.5 音乐生成模型,在音乐性、歌词、人声和创意控制方面都有显著进步。该模型为用户提供了更强大的音乐创作工具。

Read more →


Gemini Robotics 2 brings whole body intelligence to robots

Gemini Robotics 2 为机器人带来全身智能

Gemini Robotics 2 为机器人带来了全身智能,使机器人能够更好地协调全身动作,完成更复杂的物理任务。这一进步将使机器人在制造业、物流和家庭服务等领域的实用性大幅提升。

Read more →


Accelerating the frontiers of scientific discovery: Google’s $40M commitment to the Genesis Mission

加速科学发现前沿:Google 向 Genesis 任务承诺 4000 万美元

Google 承诺向 Genesis 任务投入 4000 万美元的 AI token 和积分,以加速科学发现的前沿研究。这一投资将支持利用 AI 进行基础科学研究,包括材料科学、药物发现和气候建模等领域。

Read more →


Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

介绍 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber

Google 发布了三款新的 Gemini 模型:Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。这些模型针对不同应用场景进行了优化,从高速推理到轻量级部署到网络安全,覆盖了广泛的 AI 应用需求。

Read more →


Introducing Gemini 3.5 Flash Cyber

介绍 Gemini 3.5 Flash Cyber

Google 推出了 Gemini 3.5 Flash Cyber,一个轻量级网络安全模型,用于发现和修补漏洞。该模型专为网络安全场景设计,能够快速识别安全威胁并提供修复建议。

Read more →


Our approach to bioresilience

我们对生物韧性的方法

Google DeepMind 和 Isomorphic Labs 分享了他们对生物韧性和 AI 模型的联合方法。文章探讨了如何利用 AI 技术增强生物系统的韧性,包括应对生物威胁、保护生物多样性和促进生态系统健康等方面。

Read more →


Meta Engineering

How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees

如何在 WhatsApp 上构建诈骗警报:端到端加密与可验证性保证

WhatsApp 致力于在保护用户消息隐私的同时帮助用户保持安全。随着诈骗手段不断演变——从身份冒充到社会工程到 AI 生成的诱饵——WhatsApp 也在不断进化。文章分享了 WhatsApp 如何在保持端到端加密的同时构建诈骗警报系统,通过可验证性保证确保用户隐私不受侵犯。

Read more →


From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking

从用户序列到缩放定律:Meta 广告排序的多阶段架构

Meta 的推荐平台每天处理数十亿次用户交互,生成丰富的时序信号。文章介绍了 Meta 如何从用户序列建模到缩放定律,构建多阶段广告排序架构。该架构通过建模用户行为的顺序和时间(而非依赖静态的手工稀疏特征),显著提升了广告推荐效果。

Read more →


GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model

GEM 训练:Meta 如何将其 LLM 规模广告基础模型的效率提高一倍

Meta 的生成式广告推荐模型(GEM)是 Instagram 和 Facebook 广告推荐背后的基础模型,现在在数千台最新一代 GPU 上以 LLM 规模进行训练。文章详细介绍了 Meta 如何实现端到端训练效率翻倍至 20-25% 的模型 FLOPs 利用率(MFU),同时将训练 FLOPs 扩展 4 倍。

Read more →


Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization

探索 Meta 广告深度漏斗优化的分层兴趣表示

Meta 广告团队正在探索分层兴趣表示这一研究领域。他们在广告实体宇宙(用户、广告主、产品、服务)之上构建上游表示层,学习统一嵌入,将用户推断的兴趣与广告主在深度漏斗广告中提供的广泛内容连接起来。

Read more →


Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler

使用开源内核调度器现代化 Meta 广告服务

在 Meta 的规模下,几毫秒的延迟退化会对广告性能产生重大负面影响。当 Linux 内核升级可能使 Meta 广告投放机群的延迟退化时,团队转向了 sched_ext——上游基于 BPF 的可扩展调度框架——构建了一个针对广告投放定制的调度策略。

Read more →


Meta’s AI Storage Blueprint at Scale

Meta 大规模 AI 存储蓝图

过去几年,模型能力和训练数据集规模经历了指数级增长。过去一年多来,新前沿模型发布的时间间隔从几个月缩短到几周。可靠快速的存储访问对 AI 创新的速度和计算成本都至关重要。文章分享了 Meta 在大规模 AI 存储方面的架构蓝图和实践经验。

Read more →


10 Years of Meta’s Commitment to Python

Meta 对 Python 的十年承诺

今年标志着 Meta 连续第 10 年赞助 Python 软件基金会(PSF)。Python 是世界上最具影响力的编程语言之一,Meta 在其整个工程栈中使用 Python,从数据科学到 Web 开发到基础设施管理。文章回顾了 Meta 与 Python 社区的十年合作历程。

Read more →


Privacy-Aware Infrastructure in the AI-Native Era: An Asset Classification Case Study

AI 原生时代的隐私感知基础设施:资产分类案例研究

隐私控制系统——执行保留、访问、允许用途、下游共享或匿名化策略的系统——需要可靠的数据理解才能发挥作用。文章通过一个名为”age”的字段为例,展示了数据分类的复杂性:在不同上下文中,同一个字段可能具有完全不同的隐私含义。

Read more →


How Meta Engineered Ultra-Narrow Batteries for AI Glasses

Meta 如何为 AI 眼镜设计超窄电池

Ray-Ban Meta 和 Oakley Meta Vanguards 等智能眼镜需要足够的能量来驱动摄像头、扬声器、AI 工作负载甚至显示屏。但所有这些都必须装入眼镜的镜腿中。文章分享了 Meta 如何在有限的空间内设计超窄电池,为 AI 眼镜提供足够的电力支持。

Read more →


VentureBeat AI

Google just redesigned the search box for the first time in 25 years

Google 25 年来首次重新设计搜索框

Google 在其年度 I/O 开发者大会上宣布了对搜索框的全面重新设计——这个数十亿次查询每天开始的地方。搜索框从简单的关键词输入转变为动态的 AI 驱动对话入口,可以接受文本、图片、PDF、视频甚至打开的 Chrome 标签页作为输入。Google 还将 AI Overviews 和 AI Mode 功能合并为单一的无缝搜索流程,消除了用户在选择传统结果页面和 AI 模式之间的摩擦。

Read more →


Railway secures $100 million to challenge AWS with AI-native cloud infrastructure

Railway 融资 1 亿美元,以 AI 原生云基础设施挑战 AWS

旧金山云平台公司 Railway 宣布完成 1 亿美元 B 轮融资,由 TQ Ventures 领投,FPV Ventures、Redpoint 和 Unusual Ventures 参投。Railway 在没有花费一分钱营销费用的情况下,已悄然积累了 200 万开发者。随着 AI 应用需求的激增,传统云基础设施的局限性日益暴露,Railway 正利用开发者对 AWS 和 Google Cloud 等传统平台复杂性和成本的不满,打造 AI 原生云基础设施。

Read more →


Claude Code costs up to $200 a month. Goose does the same thing for free.

Claude Code 每月最高 200 美元,Goose 免费提供相同功能

Anthropic 的终端 AI 代理 Claude Code 可以自主编写、调试和部署代码,但其定价(根据使用量从每月 20 美元到 200 美元不等)引发了程序员的不满。现在,一个免费替代品正在获得关注——Goose,由 Block(前身为 Square)开发的开源 AI 代理,提供与 Claude Code 几乎相同的功能,但完全在用户本地机器上运行,无需订阅费、无需云端依赖、无速率限制。

Read more →


Listen Labs raises $69M after viral billboard hiring stunt

Listen Labs 在病毒式广告牌招聘活动后融资 6900 万美元

Listen Labs 的创始人 Alfred Wahlforss 需要招聘超过 100 名工程师,但无法与 Mark Zuckerberg 的 1 亿美元报价竞争。于是他花了 5000 美元(五分之一的营销预算)在旧金山制作了一块广告牌,上面显示看似乱码的五个随机数字串。这些数字实际上是 AI token,解码后指向一个编程挑战:构建一个算法作为柏林著名夜店 Berghain 的数字门卫。几天内,数千人尝试了这个谜题,430 人破解了它,部分人被录用。这种非常规方法现在吸引了 6900 万美元 B 轮融资。

Read more →


Salesforce rolls out new Slackbot AI agent

Salesforce 推出全新 Slackbot AI 代理

Salesforce 推出了完全重建的 Slackbot,将其从简单的通知工具转变为功能强大的 AI 代理,能够搜索企业数据、起草文档并代表员工采取行动。新版 Slackbot 现已向 Business+ 和 Enterprise+ 客户全面开放,是 Salesforce 将 Slack 定位为新兴”代理式 AI”运动中心的最激进举措。

Read more →


Anthropic launches Cowork, a Claude Desktop agent that works in your files

Anthropic 推出 Cowork:在本地文件中工作的 Claude 桌面代理

Anthropic 发布了 Cowork,这是一个新的 AI 代理功能,将 Claude Code 的强大功能扩展到非技术用户。据公司内部人士透露,团队用大约一周半的时间构建了整个功能,主要使用 Claude Code 本身。Cowork 让用户能够像开发者使用 Claude Code 一样完成非技术任务,标志着 AI 代理向主流用户交付的重要转折点。

Read more →


Nous Research’s NousCoder-14B is an open-source coding model

Nous Research 的 NousCoder-14B 开源编码模型

Nous Research 发布了一个新的竞争性编程模型 NousCoder-14B,声称其性能匹配或超过几个更大的专有系统。该模型仅用 4 天时间、48 块 NVIDIA B200 GPU 训练完成。该模型的发布正值 Claude Code 主导社交媒体讨论的时刻,凸显了 AI 辅助软件开发领域的快速演进和激烈竞争。

Read more →


Towards Data Science

Mathematical Experiments Are Becoming Abundant Through Human-Machine Teaming

人机协作使数学实验变得丰富

文章描述了通过人机协作在单个周末内解决两个开放问题——精确算术检查和证明助手——的经历。这一案例展示了人类与 AI 在数学研究中的协作潜力,表明人机团队可以高效地探索数学实验的新领域。

Read more →


How to Shine as a Data Scientist in the Vibe Coding Era

如何在 Vibe Coding 时代成为出色的数据科学家

文章探讨了在编码成为商品的时代,数据科学家如何脱颖而出。作者提供了实用的建议,帮助数据科学家在 AI 辅助编程日益普及的背景下,找到自己的独特价值和竞争优势。

Read more →


A Day in the Life of a Data Scientist in 2026

2026 年数据科学家的一天

文章描述了 AI 如何极大地改变了数据科学家的日常工作流程。作者分享了自己作为数据科学家在 2026 年的日常经历,展示了 AI 工具如何融入数据科学工作的各个环节,从数据清洗到模型训练到结果分析。

Read more →


RAG Workflow and Loop Engineering: The Dispatcher That Decides When to Loop and When to Stop

RAG 工作流与循环工程:决定何时循环何时停止的调度器

文章探讨了企业文档智能中的 RAG 工作流和循环工程模式。作者提出了一个”调度器”概念,负责决定何时进行循环检索和何时停止,这是”代理式 RAG”应该呈现的样子。文章将各种模式整合在一起,为构建高效的企业 RAG 系统提供了指导。

Read more →


My Model Was Cheating on Its Own Test

我的模型在考试中作弊了

作者分享了一个令人尴尬的经历:预处理管道让汽车价格模型在考试前偷看了测试集,导致 R² 值虚高了 12 个百分点。文章通过这个真实案例,提醒数据科学家注意数据泄露问题,并分享了如何识别和防止此类问题的方法。

Read more →


I Made an LLM Lay Siege to My Minecraft House

我让 LLM 围攻我的 Minecraft 房子

作者探索了语言模型能否进行实时对抗性关卡设计。实验结果表明,LLM 确实可以执行对抗性设计任务,但重点在于”对抗性”部分——模型生成的关卡设计充满了各种陷阱和攻击策略,展示了 LLM 在创造性对抗任务中的潜力。

Read more →


How to Utilize OKF Efficiently to Enable Knowledge Exchange Among LLMs

如何高效利用 OKF 实现 LLM 之间的知识交换

文章介绍了 Google 的开放知识格式(OKF),这是一种 Markdown+YAML 骨架,用于在人类和 AI 代理之间共享知识。作者将这一骨架用于特定任务——在三个 Qwen2.5-Coder 模型(7B、3B、1.5B)之间进行预分词整数数组的代理间交接——展示了 28-37% 的首次 token 时间(TTFT)减少。

Read more →


Cut an Enterprise RAG Pipeline’s Latency and Cost by Calling the LLM Less

通过减少 LLM 调用来降低企业 RAG 管道的延迟和成本

文章提出了一种优化企业 RAG 管道的方法:不是购买更快的模型,而是减少 LLM 的调用次数。通过为每个问题添加信号路由,简单的问题可以直接绕过模型处理,关键词匹配大约节省两秒延迟。这一方法在不牺牲质量的前提下显著降低了成本和延迟。

Read more →


How to Orchestrate a Fleet of OpenClaw Bots

如何编排 OpenClaw 机器人集群

文章介绍了如何运行 OpenClaw 机器人集群以提高生产力。作者分享了编排多个 OpenClaw 机器人的最佳实践,包括任务分配、资源管理和性能优化等方面的经验。

Read more →


LangChain vs LangGraph: 4 Key Differences and When to Use Each

LangChain 与 LangGraph:4 个关键区别及适用场景

文章提供了 LangChain 和 LangGraph 的实用指南,帮助开发者选择合适的工具用于代理式工作流和系统。作者分析了两个框架的 4 个关键区别,并给出了具体的使用场景建议。

Read more →

生成二维码中...

请点击右上角 ···

选择 发送给朋友收藏