zgba 站群

2026-08-17

今日要点


Hacker News

Claude: System Prompts

Claude:系统提示词

Anthropic 公开了 Claude 网页版(claude.ai)和移动应用所使用的系统提示词。该提示词在每次对话开始时向 Claude 提供当前日期等最新信息,并鼓励特定行为,例如始终以 Markdown 格式提供代码片段。系统提示词会定期更新以改善 Claude 的响应质量,但这些更新不适用于 Claude API。从 Claude 4.6 系列开始,每个模型 ID 对应一个固定的快照版本。

Read more →


Firefox for iOS now has a native adblocker

Firefox for iOS 现已内置原生广告拦截器

Mozilla 为 Firefox for iOS 浏览器推出了原生广告拦截功能,用户无需安装第三方扩展即可直接拦截网页广告。这一功能在 Hacker News 上获得了 595 分的高评分和 246 条评论,引发了广泛讨论。作为 iOS 平台上少数支持原生广告拦截的主流浏览器之一,此举进一步提升了 Firefox 在移动端的竞争力。

Read more →


A third world engineer responds to “RISC-V: They should have known better”

一位第三世界工程师回应”RISC-V:他们本应更清楚”

Dmitry Grinberg 发表了一篇长文批评 RISC-V 架构,文章登上 Hacker News 首页并在 Lobsters 社区引发热烈讨论。这是 RISC-V 架构近年来遭遇的最实质性的批评。本文作者 Narishma 是一位已将整个技术栈从 STM32 和 ARM 迁移到 RISC-V 的工程师,他认为 Grinberg 的批评存在偏见,并撰文进行反驳,指出许多批评观点并不公允。

Read more →


Research papers using “kidney disappointment” instead of “kidney failure”

用”肾脏失望”代替”肾衰竭”的学术论文

一篇有趣的发现:在 Google Scholar 上搜索”kidney disappointment”(肾脏失望),可以找到一些学术论文错误地使用了这一表述,而非正确的”kidney failure”(肾衰竭)。这被认为是 AI 生成或辅助撰写学术论文时出现的术语错误,引发了社区对 AI 在学术写作中可靠性的讨论。该话题获得 379 分和 132 条评论。

Read more →


Tell HN: Cloudflare silently injects its analytics when you switch nameservers

告诉 HN:Cloudflare 在切换域名服务器时静默注入分析代码

一位用户在将域名服务器切换到 Cloudflare 以启用 R2 存储桶服务后,发现 Cloudflare 在其纯 HTML 网站中静默注入了 JavaScript 分析代码片段。用户必须进入分析仪表板,将网站添加到分析中,然后才能禁用该代码片段。用户认为这种做法具有侵入性,应该采用选择加入(opt-in)而非选择退出(opt-out)的方式。

Read more →


Models Are Getting Dumber on Purpose

模型正在被”故意变笨”

文章分析了当前 AI 模型的发展趋势:推理分数不断攀升,而每 token 的计算量却在持续下降。GLM-5.2 在 AIME 2026 上得分 99.2%,每 token 仅激活约 400 亿参数;Qwen3.5 得分 91.3%,激活 170 亿参数;DeepSeek V4-Flash 仅激活 130 亿参数。相比之下,2023 年的 GPT-4 据传每 token 激活约 2800 亿参数,却几乎无法解决 AIME 问题。小模型方面,Qwen3.5 9B 量化后仅需 6GB 显存,在 10B 以下模型中得分约为次优模型的两倍。

Read more →


Stripe Clinches over $7B Deal to Buy AI Firm OpenRouter

Stripe 以超 70 亿美元收购 AI 公司 OpenRouter

据彭博社报道,Stripe 即将以超过 70 亿美元的价格收购 AI 模型聚合平台 OpenRouter。OpenRouter 提供统一的 API 接口,允许开发者调用多种不同的 AI 模型。此次收购在 Hacker News 上获得 258 分和 179 条评论,被视为 Stripe 在 AI 基础设施领域的重要布局。

Read more →


The AI Credit Resale Economy

AI 额度转售经济

文章探讨了”token 经纪人”(token brokers)的兴起——这些人从初创公司购买未使用的 AI 模型额度,然后转售获利。作者在与多位创始人交流后发现,许多公司都在收到大量来自 token 经纪人的询价邮件,以大幅折扣收购 Anthropic 等公司的未使用 token。这一灰色市场反映了 AI 算力成本高昂背景下资源再分配的新趋势。

Read more →


What happens when an LLM never sees material beyond fifth grade?

当 LLM 从未见过五年级以上的内容时会发生什么?

研究团队构建了一个 880 亿 token 的语料库,经过五阶段过滤流程,仅保留与美国小学课程(K-5 年级)相关的内容,并在此语料库上从头训练模型。该 5B 参数模型可在浏览器中直接运行。研究旨在探究:当训练分布被严格限制时,模型究竟学到了什么新技能,还是仅仅被激发了已有能力。

Read more →


Qwen 3.8 27B is excellent, but it defaults to overthinking things

Qwen 3.8 27B 非常出色,但默认倾向于过度思考

Simon Willison 评测了阿里巴巴 Qwen 研究实验室发布的 Qwen 3.8 27B 模型。该模型采用 Apache 2 许可证,拥有 270 亿参数,支持视觉能力,适合在配置合理的笔记本电脑上运行。Qwen 自报的基准测试结果显示,该模型相比前代 Qwen 3.6 27B 以及闭源模型 Qwen 3.7-Plus 均有显著提升。不过,Willison 指出该模型存在”过度思考”的倾向。

Read more →


The weekend is 100 years old

周末诞生 100 周年

《卫报》文章回顾周末制度的百年历史。1926 年,亨利·福特给予员工周六和周日两天休息,双日周末由此诞生。文章还提到,1929 年至 1940 年间,苏联曾取消周末制度,改为每七天随机分配一天休息日,以确保工厂持续运转。如今,随着”摸鱼星期五”和混合办公模式的兴起,周末的概念已发生了巨大变化。

Read more →


The federal keyword lists that canceled billions in research funding

取消数十亿研究经费的联邦关键词清单

文章揭露了联邦政府使用关键词清单来审查和取消研究经费的机制。这些关键词清单导致数十亿美元的研究资金被取消,引发了学术界对科研自由和政府干预的担忧。该话题在 Hacker News 上获得 178 分和 66 条评论。

Read more →


St Lucie Nuclear Reactor Unit 1 manually shutdown, 3 control rods drop into core

St Lucie 核电站 1 号机组手动停机,3 根控制棒落入堆芯

2026 年 8 月 13 日上午 9 点 47 分(EDT),St. Lucie 核电站 1 号机组在满功率运行(100% 功率)时,因 3 根控制棒落入反应堆堆芯而触发手动停机。美国核管理委员会(NRC)将该事件归类为非紧急事件。通知指出,停机过程顺利,所有系统均正常响应。

Read more →


Nvidia dramatically reduces amount of OpenAI infra financing it may guarantee

Nvidia 大幅缩减对 OpenAI 基础设施融资的担保规模

据路透社报道,Nvidia 大幅缩减了此前可能为 OpenAI 数据中心提供的 2500 亿美元融资担保规模。这一变化反映了 AI 基础设施投资环境的不确定性增加,以及 Nvidia 在承担大规模财务风险方面的谨慎态度。该消息在 Hacker News 上获得 173 分和 70 条评论。

Read more →


Anthropic’s ‘Watermark’ Text Adulteration in Claude Is a Perversion of Writing

Anthropic 在 Claude 中的”水印”文本篡改是对写作的亵渎

John Gruber 在 Daring Fireball 上撰文批评 Anthropic 宣布对所有 Claude 模型生成的文本进行”水印”处理以符合欧盟法规的做法。Gruber 认为,Anthropic 在公告中未提供任何关于水印技术如何工作的描述,标题”如何标记 AI 生成内容”既荒谬又具有侮辱性。他推测水印可能通过隐藏不可打印的 Unicode 字符实现,并认为这种做法是对写作的亵渎。

Read more →


OpenAI Blog

The builder’s guide to GPT‑5.6

GPT-5.6 构建者指南

OpenAI 发布了面向开发者的 GPT-5.6 构建指南,介绍初创企业如何利用 GPT-5.6 构建更快、更具成本效益的 AI 代理。指南涵盖了更智能的模型选择策略以及新的 Responses API 功能,帮助开发者在实际应用中充分发挥 GPT-5.6 的能力。

Read more →


Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed

预览 Ultrafast 模式:GPT-5.6 Sol 速度最高提升 14 倍

OpenAI 推出 Ultrafast 模式,这是一个新的 API 服务层级,由 Cerebras 提供技术支持,可将 GPT-5.6 Sol 的推理速度最高提升 14 倍,输出速度可达每秒 750 个 token。这一模式专为需要极低延迟的应用场景设计,使实时 AI 交互变得更加可行。

Read more →


OpenAI appoints Dali Rajic as Chief Revenue Officer

OpenAI 任命 Dali Rajic 为首席营收官

OpenAI 任命 Dali Rajic 为首席营收官(CRO),负责领导其全球营收组织,帮助企业充分实现 AI 的价值。这一人事任命标志着 OpenAI 在商业化进程中的重要一步,表明公司正加速推进企业级 AI 服务的市场拓展。

Read more →


From assistance to execution: How enterprises put AI to work

从辅助到执行:企业如何部署 AI

OpenAI 发布研究报告,揭示企业采用代理式 AI(agentic AI)的现状。研究发现,企业正从将 AI 作为辅助工具转向让 AI 自主执行任务,使用 ChatGPT 和 Codex 等工具。前沿企业在 AI 采用方面正拉开与其他企业的差距,展现出更强的竞争力。

Read more →


How RingCentral builds AI-native work from engineering to ops

RingCentral 如何从工程到运维构建 AI 原生工作流

RingCentral 分享了如何利用 ChatGPT Work 和 Codex 加速 AI 产品开发,并在工程和运维团队中集中运营智能的实践。该案例展示了企业如何将 AI 深度融入日常工作流程,从代码开发到运维管理实现全链路的 AI 赋能。

Read more →


Testing ads in ChatGPT

在 ChatGPT 中测试广告

OpenAI 宣布开始在 ChatGPT 中测试广告功能,以支持免费用户的访问。广告将采用明确标注、答案独立性、强隐私保护和用户控制等原则。这一举措标志着 OpenAI 在探索 AI 产品商业化模式方面迈出重要一步,同时也引发了关于 AI 助手中立性的讨论。

Read more →


Daybreak models are now available on AWS

Daybreak 模型现已在 AWS 上可用

OpenAI 与 AWS 合作,将 Daybreak 网络安全能力通过 Amazon Bedrock 平台提供给企业用户,以支持企业安全工作流程。Daybreak 是 OpenAI 专注于网络安全领域的模型系列,此次上线 AWS 将进一步扩大其企业级安全应用的覆盖范围。

Read more →


OpenAI’s letter to Governor Abbott on responsible AI infrastructure in Texas

OpenAI 致德克萨斯州州长 Abbott 关于负责任的 AI 基础设施的信

OpenAI 向德克萨斯州州长 Greg Abbott 致信,阐述其在德州建设负责任 AI 基础设施的承诺。信中表达了对可靠、透明增长的承诺,强调 AI 发展应惠及德州人民。此举反映了 OpenAI 在大型 AI 基础设施项目落地过程中与地方政府沟通的策略。

Read more →


Model ML completes finance work more efficiently with GPT-5.6 Sol

Model ML 利用 GPT-5.6 Sol 更高效地完成财务工作

Model ML 分享了使用 GPT-5.6 Sol 完成财务工作的案例。该工具能够从研究分析开始,一路生成可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿,大幅提升了财务团队的工作效率。这一案例展示了 AI 在专业财务领域从分析到交付的全流程自动化能力。

Read more →


What building an AI-native finance function taught me

构建 AI 原生财务职能的五大教训

OpenAI 首席财务官 Sarah Friar 分享了构建 AI 原生财务职能的五大经验教训,涵盖从自动化预测到加强控制以及 AI 投资回报率(ROI)的衡量。作为 OpenAI 的 CFO,Friar 的实践经验为其他企业转型 AI 原生财务团队提供了宝贵的参考。

Read more →


Anthropic Blog

Introducing Claude Opus 5

推出 Claude Opus 5

Anthropic 发布了 Claude Opus 5,这是 Opus 系列的重大升级。Opus 5 在长时代理任务方面实现了质的飞跃,同时在编码和专业工作方面也有显著提升。该模型专为需要长时间运行、复杂推理和多步骤任务执行的场景设计,代表了 Anthropic 在高端 AI 模型领域的最新成果。

Read more →


Inviting hard questions

邀请提出难题

Anthropic 向公众征集关于 AI 的最困难问题,并承诺在解决这些问题的过程中公开其工作过程。这一举措体现了 Anthropic 对透明度和公众参与的重视,旨在通过开放对话来推动 AI 安全和治理领域的发展。

Read more →


Redeploying Fable 5

重新部署 Fable 5

Anthropic 宣布 Fable 5 将于 7 月 1 日在全球重新部署。同时,Anthropic 与 Amazon、Microsoft、Google 等 Glasswing 合作伙伴共同提出了一套行业范围内的越狱严重性评分框架,旨在建立统一的 AI 安全评估标准。

Read more →


Introducing Claude Sonnet 5

推出 Claude Sonnet 5

Anthropic 发布了 Claude Sonnet 5,该模型在编码、代理和专业工作方面实现了前沿性能,同时具备大规模部署的能力。Sonnet 5 定位于平衡性能与效率,适合需要高性能但成本敏感的企业应用场景。

Read more →


How Claude’s text watermark works

Claude 文本水印的工作原理

Anthropic 详细解释了 Claude 文本水印的技术实现方式。该水印机制旨在符合欧盟法规要求,对 Claude 生成的所有文本内容进行标记。文章回应了社区对水印技术细节的关切,提供了关于水印如何嵌入文本以及如何检测的技术说明。

Read more →


Improving Fable 5’s biology safeguards

改进 Fable 5 的生物学安全保护

Anthropic 发布了关于改进 Fable 5 生物学安全保护的更新。文章介绍了在 AI 模型应用于生物学领域时,如何加强安全防护措施以防止潜在的生物安全风险,体现了 Anthropic 在 AI 安全领域的持续投入。

Read more →


Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer

Mariano-Florentino (Tino) Cuéllar 加入 Anthropic 担任首席全球事务官

Anthropic 宣布 Mariano-Florentino (Tino) Cuéllar 将加入公司担任首席全球事务官。Cuéllar 此前曾担任美国证券交易委员会(SEC)主席,拥有丰富的监管和政策经验。这一任命表明 Anthropic 正加强在全球政策、监管和公共事务方面的布局。

Read more →


Investigating three real-world incidents in our cybersecurity evaluations

调查网络安全评估中的三起真实事件

Anthropic 分享了对其网络安全评估中三起真实事件的调查结果。文章详细描述了评估过程中发现的问题、分析方法和改进措施,展示了 Anthropic 在 AI 网络安全能力方面的评估框架和实践经验。

Read more →


Our position on open-weights models

我们对开放权重模型的立场

Anthropic 发布了关于开放权重模型的官方立场声明。文章阐述了 Anthropic 对开源 AI 模型的态度,包括对开放权重模型在安全性、可控性和负责任部署方面的考量。这一声明回应了社区对 Anthropic 开源策略的长期关注。

Read more →


Cognizant and Anthropic expand their partnership to bring Claude to enterprise clients

Cognizant 与 Anthropic 扩大合作,将 Claude 带给企业客户

Cognizant 与 Anthropic 宣布扩大合作伙伴关系,将 Claude 模型带给更多企业客户。通过此次合作,Cognizant 将利用其企业咨询服务能力,帮助客户部署和集成 Claude AI 解决方案,加速企业 AI 转型。

Read more →


Google AI Blog

Bring your spreadsheet data to life with Sheets canvas

用 Sheets Canvas 让电子表格数据活起来

Google 推出了 Sheets Canvas 功能,用户只需简单提示词即可将电子表格数据转化为交互式仪表盘、自定义学习追踪器、座位表等。该功能将 Google Sheets 从传统的数据处理工具升级为可视化和交互体验平台,大幅降低了数据可视化的门槛。

Read more →


AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities

AMIE 研究医疗 AI 系统展示实时临床视频咨询能力

Google 介绍了 AMIE 研究医疗 AI 系统,该系统在模拟环境中首次展示了实时临床视频咨询能力。AMIE 能够在视频通话中实时理解和分析医疗场景,为未来的 AI 辅助医疗诊断提供了新的可能性。

Read more →


Evolve your marketing with new AI tools

用新 AI 工具革新营销

Google 发布了 Google Ads 和 Google Analytics 的新 AI 和代理式体验更新,旨在简化营销工作流程。新工具包括自动化广告优化、智能受众分析和代理式营销助手等功能,帮助营销人员更高效地管理和优化广告活动。

Read more →


The latest AI news we announced in July 2026

2026 年 7 月 Google AI 最新公告汇总

Google 汇总了 2026 年 7 月期间发布的所有 AI 相关更新,涵盖模型发布、产品功能、研究进展和合作伙伴关系等多个方面,为用户提供了一个月度 AI 动态全景图。

Read more →


Inside our 353,000-person vibe coding course

35.3 万人参与的 Vibe Coding 课程内幕

Kaggle 与 Google 联合举办的 AI Agents Intensive 课程吸引了 35.3 万名学员参与。这是一门免费课程,旨在帮助学习者构建和部署下一代 AI 代理。文章回顾了课程的设计思路、教学内容和学员反馈,展示了大规模 AI 教育的实践成果。

Read more →


Gemini API Managed Agents: 3.6 Flash, hooks, and more

Gemini API 托管代理:3.6 Flash、Hooks 等

Google 宣布在 Gemini API 的托管代理(Managed Agents)中增加更多新功能,包括 3.6 Flash 模型支持、Hooks 机制等,帮助开发者构建可靠、可投入生产的 AI 代理系统。这些更新使开发者能够更灵活地控制代理行为并集成外部系统。

Read more →


5 ways AI Mode in Search helps you enjoy the real world

AI 模式搜索帮助你享受现实世界的 5 种方式

Google 介绍了搜索 AI 模式的 5 种实用功能,帮助用户更好地享受线下生活。无论是预订演唱会门票、寻找最佳餐厅,还是规划旅行路线,AI 模式都能提供个性化的建议和实时信息,让数字工具更好地服务于现实生活。

Read more →


用 Google 搜索举办完美晚宴的 5 种方式

Google 分享了利用搜索 AI 功能策划晚宴的 5 种方法,包括设计菜单、布置餐桌、安排座位等。文章展示了 AI 搜索在日常生活场景中的实用价值,将复杂的活动策划简化为简单的对话式交互。

Read more →


3 Google updates from Galaxy Unpacked 2026

Galaxy Unpacked 2026 上的 3 项 Google 更新

在三星 Galaxy Unpacked 2026 发布会上,Google 分享了 3 项针对三星新设备的更新,包括在折叠屏手机、智能手表和智能眼镜上提升生产力的功能。这些更新展示了 Google 与硬件合作伙伴在 AI 体验方面的深度整合。

Read more →


将更多应用连接到搜索

Google 宣布用户将能够在搜索 AI 模式中安全地链接和交互使用常用服务。这一功能扩展了搜索的边界,使用户可以直接在搜索界面中与银行、旅行、购物等各类应用进行交互,无需切换应用。

Read more →


Hugging Face Blog

State of Open Models: Summer 2026 Observations

开放模型现状:2026 年夏季观察

Hugging Face 发布了 2026 年夏季开放模型生态观察报告,全面分析了当前开源 AI 模型的发展态势,包括模型性能趋势、社区活跃度、许可证变化以及企业采用情况。报告为开发者和研究者提供了开放模型领域的最新全景图。

Read more →


Record, train, and deploy from one place with Strands Agents, LeRobot, and Hugging Face Storage Buckets

用 Strands Agents、LeRobot 和 Hugging Face 存储桶实现一站式录制、训练和部署

Hugging Face 与 Amazon 合作,展示了如何使用 Strands Agents、LeRobot 和 Hugging Face 存储桶实现机器人数据从录制到训练再到部署的全流程管理。该方案为机器人开发者提供了一个统一的平台,简化了机器人 AI 的开发和部署流程。

Read more →


What We Learned by Reproducing 2,200 papers from ICML

复现 ICML 2200 篇论文的经验教训

Hugging Face 团队复现了 ICML 2026 的 2200 篇论文,并分享了复现过程中的经验教训。研究揭示了机器学习论文在可复现性方面的普遍问题,包括代码缺失、环境依赖复杂、结果不一致等,呼吁社区加强论文复现的标准和实践。

Read more →


Introducing OlmoEarth embeddings: Custom embedding exports from OlmoEarth Studio

推出 OlmoEarth 嵌入:从 OlmoEarth Studio 导出自定义嵌入

Allen AI 推出了 OlmoEarth 嵌入功能,允许用户从 OlmoEarth Studio 导出自定义嵌入向量用于下游分析。该功能为地理空间 AI 应用提供了灵活的嵌入表示,支持土地分类、环境监测等多种场景。

Read more →


LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge

LFM2.5-VL-3B:为边缘设备提供更优更快的视觉能力

Liquid AI 发布了 LFM2.5-VL-3B 模型,这是一个专为边缘设备设计的 30 亿参数视觉语言模型。该模型在保持较小体积的同时,提供了出色的视觉理解能力,适合在资源受限的边缘设备上运行实时视觉任务。

Read more →


Thinking of ACE? We Can Do It with Fewer Tokens

想用 ACE?我们可以用更少的 Token 实现

IBM Research 展示了如何通过优化方法,以更少的 token 实现 ACE(自适应计算效率)目标。该研究探索了在保持模型性能的同时减少 token 消耗的技术路径,为降低 AI 推理成本提供了新的思路。

Read more →


Build Low-Latency Multilingual Voice Agents: Open Weights & Full Deployment Control with NVIDIA Magpie TTS

用 NVIDIA Magpie TTS 构建低延迟多语言语音代理

NVIDIA 发布了 Magpie TTS 模型,这是一个开放权重的多语言文本转语音模型,支持低延迟语音代理的构建。该模型提供完整的部署控制权,开发者可以在本地或私有环境中部署,确保数据隐私和安全性。

Read more →


Making Knowledge Distillation Cheap Enough to Run at Scale

让知识蒸馏便宜到可以大规模运行

Multiverse Computing 分享了大规模知识蒸馏的优化方法,通过技术创新将知识蒸馏的计算成本降低到可以大规模运行的水平。该方案使开发者能够高效地将大模型的知识迁移到小模型中,加速模型部署和应用。

Read more →


Meta is back with Muse Glimmer: local, agentic, multimodal, and open source

Meta 回归:Muse Glimmer——本地、代理式、多模态且开源

Meta 发布了 Muse Glimmer,一个本地运行的、代理式的、多模态的开源 AI 模型。该模型支持在用户设备上本地运行,无需云端连接,保护用户隐私的同时提供多模态交互能力,体现了 Meta 对端侧 AI 和开源生态的持续投入。

Read more →


Baseten on Hugging Face Inference Providers

Baseten 加入 Hugging Face 推理提供商

Baseten 正式加入 Hugging Face 推理提供商网络,为 Hugging Face 用户提供更丰富的模型部署和推理选项。Baseten 以其高性能的模型部署平台著称,此次合作将进一步丰富 Hugging Face 生态的推理服务选择。

Read more →


The Gradient

After Orthogonality: Virtue-Ethical Agency and AI Alignment

超越正交性:美德伦理代理与 AI 对齐

Peli Grietzer 在本文中论证了理性的人没有目标,理性的 AI 也不应该有目标。人类行为的理性不在于将其指向某个最终的”目标”,而在于将行动与”实践”(practices)对齐——即行动网络、行动倾向和行动评估标准的集合。文章从美德伦理学的角度重新思考 AI 对齐问题,提出了一种不同于传统目标导向框架的对齐思路。

Read more →


AGI Is Not Multimodal

AGI 不是多模态的

Benjamin A. Spiegel 在本文中质疑了当前将多模态能力视为 AGI 必经之路的观点。引用 Terry Winograd 的话,文章指出”将语言投射为思维模型时,我们忽视了支撑我们智能的隐性具身理解”。作者认为,当前生成式 AI 模型的成功让一些人误以为 AGI 即将到来,但这些模型远未捕捉到人类智能的本质。

Read more →


Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research

形状、对称性与结构:数学在机器学习研究中的角色变迁

Henry Kvinge 探讨了数学在现代机器学习研究中的角色变化。过去十年见证了机器学习进步方式的转变:精心设计的、数学原理驱动的架构仅带来边际改进,而计算密集型和工程优先的努力通过扩展到更大的训练集取得了显著进展。文章反思了数学在 AI 研究中的地位和未来方向。

Read more →


What’s Missing From LLM Chatbots: A Sense of Purpose

LLM 聊天机器人缺少什么:目标感

Kenneth Li 指出,基于 LLM 的聊天机器人能力每月都在进步,但这些改进主要通过 MMLU、HumanEval 和 MATH 等基准测试来衡量。随着这些指标越来越饱和,用户体验是否也在同比例提升?文章探讨了 LLM 聊天机器人在”目标感”方面的缺失,以及这对未来 AI 交互体验的影响。

Read more →


We Need Positive Visions for AI Grounded in Wellbeing

我们需要基于福祉的 AI 积极愿景

Joel Lehman 呼吁 AI 社区需要建立基于人类福祉的积极 AI 愿景。文章设想,如果十年前有人告诉你十年后你可以与一个百科全书式的 AI 自然对话,它能创作图像、编写代码、辩论哲学,你会不会认为这项技术几乎肯定会改变社会?文章探讨了 AI 对社会的影响以及建立积极愿景的重要性。

Read more →


Financial Market Applications of LLMs

LLM 在金融市场中的应用

Richard Dewey 探讨了大语言模型在金融市场中的应用。文章回顾了 2023 年 AI 革命如何推动了对私营和上市公司的狂热投资,以及 ChatGPT 等变革性消费产品如何激发了公众的想象力。文章深入分析了 LLM 在金融建模、交易策略和风险管理等方面的潜力和挑战。

Read more →


A Brief Overview of Gender Bias in AI

AI 中性别偏见概述

Yennie Jun 对 AI 中的性别偏见进行了简要概述和讨论。文章涵盖了性别偏见在 AI 系统中的表现形式、产生原因以及缓解策略,为理解 AI 公平性问题提供了基础性的参考。

Read more →


Mamba Explained

Mamba 详解

Kola Ayonrinde 深入解释了 Mamba 模型。Mamba 是一种基于状态空间模型(SSM)的新型 AI 模型,作为广泛使用的 Transformer 模型的有力替代方案,解决了 Transformer 在处理长序列时的效率问题。文章详细介绍了 Mamba 的架构原理、技术优势和应用场景。

Read more →


Car-GPT: Could LLMs finally make self-driving cars happen?

Car-GPT:LLM 能否最终实现自动驾驶?

Jérémy Cohen 探讨了大语言模型在自动驾驶中的应用潜力。文章分析了 LLM 在自动驾驶系统中的可行性,讨论了关键挑战,包括安全性、实时决策、传感器融合等问题,并评估了 LLM 是否真的能让自动驾驶汽车成为现实。

Read more →


Do text embeddings perfectly encode text?

文本嵌入能完美编码文本吗?

Jack Morris 探讨了文本嵌入的逆向问题。文章介绍了”Vec2text”技术,可以将嵌入向量准确地还原为原始文本,这一发现凸显了围绕嵌入数据安全协议的紧迫需求。如果嵌入可以被逆向还原,那么嵌入数据的隐私保护和安全存储就需要重新审视。

Read more →


arXiv CS.AI

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

诱导无奖励评判标准以减少代理评估中的过度计分

该论文提出了一种从数据中自动诱导代理评判标准的方法,以减少在大规模语言模型代理评估中常见的”过度计分”问题。现有评判方法要么手写评分标准(如 G-Eval),要么微调评判模型权重,两者都倾向于将流畅但未成功的轨迹计为成功。新方法通过从数据中诱导评判标准文本,提高了评估的准确性和可靠性。

Read more →


Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking

基于幅度专家掩码的混合专家模型深度感知敏感性分析

该论文对 Qwen3.6-35B-A3B 模型(40 个 MoE 层,每层 256 个专家,top-8 路由)进行了系统的逐层敏感性分析。通过在 XLCoST 跨语言代码翻译基准上使用基于幅度的专家掩码方法,研究揭示了 MoE 架构中各层的相对重要性,为模型压缩提供了重要参考。

Read more →


Modular Cognitive Architecture Emerges in Large Language Models

大型语言模型中涌现模块化认知架构

该论文测试了大型语言模型中是否会出现类似人脑的功能模块化组织。人脑具有显著的功能专业化,不同网络支持语言、形式推理、心智推理和物理世界推理。研究通过电路分析发现,LLM 中确实涌现出了类似的模块化认知架构,尽管 LLM 是通过完全不同的优化过程创建的。

Read more →


A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

LLM 服务一年:工作负载演变、缓存与负载均衡

该论文深入研究了真实世界中的 LLM 服务工作负载。现有研究通常观察时间较短且对生产环境中用户与模型的交互方式了解有限。本文通过更大规模和更长时间范围的分析,揭示了 LLM 服务工作负载如何随时间演变,以及用户-模型交互如何塑造生产流量模式。

Read more →


Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents

Agentao:面向工具使用 LLM 代理的受治理本地优先运行时

该论文提出了 Agentao,一个面向工具使用 LLM 代理的受治理本地优先运行时系统。随着 LLM 代理越来越多地作为执行系统运行,调用工具、修改本地状态、使用持久内存并与外部协议交互,这些能力带来了过度授权操作、弱可审计性、提示注入、工具投毒和不受控副作用等风险。Agentao 通过分层架构将模型生成的操作建议与主机授权的执行分离开来。

Read more →


AI Evaluation Should Work With Humans

AI 评估应与人类协作

该立场论文认为,当前主导的 AI 评估范式(专注于超人类自主性能,隐含目标是取代人类)正在引导 AI 开发走向错误的方向。作者主张 AI 社区应转向评估人机团队的表现,认为这种协作性转变将促进 AI 系统成为人类能力的真正补充,从而带来比当前过程好得多的社会成果。

Read more →


Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors

大型语言模型中的稳定校准偏差:高置信度错误的实用视角

该论文研究了 LLM 中高置信度错误的”稳定校准偏差”现象。通常,高置信度错误被视为内部推理脆弱的证据,但作者研究了另一种可能性:即一个自信的错误答案在小扰动下保持局部稳定。研究结合了标签感知输出级审计分数和内部敏感性探针两种诊断方法,在多领域二元事实审计集上进行了分析。

Read more →


Measuring Cross-Task Behavioral Consistency in Language Model Agents

测量语言模型代理的跨任务行为一致性

该论文指出,代理评估几乎完全依赖成功率等结果指标,这些指标只能捕捉代理是否成功,而不能衡量其行为的一致性。作者引入了行为一致性指标(BCM),通过训练模型从代理执行轨迹的行为特征预测任务成功,推导出每条轨迹的特征归因向量,并测量代理系统内这些向量的平均成对相似度。

Read more →


arXiv CS.CL

Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study

语言服务器能为编码代理节省 Token 吗?一种测量方法和初步研究

该论文研究了语言服务器协议(LSP)语义检索相比词法检索(grep)在 token 效率方面的实际差异。虽然语义检索更精确且类型安全,但需要运行中的索引服务器并支付每个符号的往返成本。作者发现,“语义检索更节省 token”这一说法几乎无处不在,但几乎无人测量。本文提供了首个公开隔离 LSP 与词法检索 token 差异的测量方法。

Read more →


Think in Latent, Explain in Language: Self-Explainable Latent Reasoning

在隐空间中思考,用语言解释:自解释隐式推理

该论文提出了一种自解释隐式推理方法。隐式推理通过将冗长的推理压缩为紧凑的嵌入,在计算效率方面相比基于文本的链式思考(CoT)有显著提升。然而,将推理压缩到隐空间使其变得不透明。现有方法要么是不可解释的”黑盒”,要么依赖单独的事后解码器进行解释。本文提出了一种统一的方法,使隐式推理既高效又可解释。

Read more →


Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems

并非所有 Token 都平等:面向代理式 LLM 系统的通胀感知路由

该论文提出了”token 通胀”概念——当语言模型首次未能回答查询时,代理系统会重试,每次重试消耗额外 token,造成单次调用成本与实际工作流成本之间的差距。作者发现,像 FrugalGPT 这样的系统基于单次调用成本进行路由,在困难任务上可能低估实际成本超过 2 倍。InflationAgent 是一个四阶段路由器,通过感知 token 通胀来优化路由决策。

Read more →


BCMT: Blockwise Causal Memory Transformer

BCMT:分块因果记忆 Transformer

该论文提出了 BCMT(分块因果记忆 Transformer)架构,用于长上下文语言建模。该架构将局部 token 交互与全局上下文传播解耦:在局部块内独立应用密集因果自注意力,每个块产生一个自适应摘要,通过指数因果记忆聚合。这种设计避免了传统 Transformer 中自注意力机制随序列长度呈二次方复杂度的问题。

Read more →


Jais 2: A Family of Arabic-Centric Open Large Language Models

Jais 2:阿拉伯语为中心的开放大语言模型家族

Jais 2 是由 MBZUAI、Cerebras 和 Inception 联合开发的阿拉伯语为中心的大语言模型家族。该家族包括据信最大的从头训练的 700 亿参数开放阿拉伯语 LLM,以及一个具有竞争力的 80 亿参数变体。自定义的阿拉伯语词汇表实现了高效的训练和推理,在阿拉伯语和文化相关基准测试中表现出色。

Read more →


IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering

IterCOMP:面向多跳问答的推理感知自适应提示压缩

该论文提出了 IterCOMP,一个统一的、无需训练的提示压缩框架,将多跳推理纳入迭代压缩过程。多跳问答需要在多个证据片段之间进行复杂推理,这往往使检索增强生成系统被冗长且嘈杂的上下文淹没。现有提示压缩方法通常针对单轮查询设计,无法捕捉相互依赖的推理步骤。

Read more →


Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

通过语义感知偏差估计测量大型音频语言模型的公平性

该论文提出了一个语义感知的混合效应回归框架,用于评估大型音频语言模型(LALM)的公平性。在语音输入场景下,公平性评估面临语义变异和说话者特定特征等混淆因素的干扰。忽略这些因素可能导致对模型偏差的误导性结论。

Read more →


GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

GRPO 超越英语:非英语和多语言环境下 GRPO 的大规模研究

该论文对多语言和非英语环境下的 GRPO(Group Relative Policy Optimization)进行了大规模实证研究。当前关于 RLVR(基于可验证奖励的强化学习)的研究严重以英语为中心。研究发现,用母语进行推理训练与用英语训练之间的差距很小,表明 GRPO 在多语言环境下同样有效。

Read more →


arXiv CS.LG

L-FNO: Lorentzian Fourier Neural Operator for Stochastic Event Dynamics

L-FNO:用于随机事件动力学的洛伦兹傅里叶神经算子

该论文提出了洛伦兹傅里叶神经算子(L-FNO),一种随机神经算子,结合了 FNO 风格的协变量路径和洛伦兹谱核来处理历史依赖。现代运营系统即使在常规条件下也面临不确定性,罕见、突发和自激事件从外生协变量和内生事件动力学中涌现。标准神经算子通常作为回归式函数到函数模型训练,限制了其在稀疏事件场景中的适用性。

Read more →


Don’t Claim Benchmark-Oriented Optimization Improves General Coding Capability — Diverse Evaluation Is Required

不要声称面向基准的优化提升了通用编码能力——需要多样化评估

该论文批评了当前将少量编码基准(如 SWE-bench 和 LiveCodeBench)上的分数视为广泛编码能力证据的做法。作者认为,针对这些基准的优化导致测量的是特定任务性能,在测量分数与通用编码能力声明之间存在”意义差距”。研究通过创建一个基于 Django 的案例研究基准套件来检验这一差距。

Read more →


Robust XGBoosting for Regression

用于回归的鲁棒 XGBoosting

该论文研究了 XGBoost 的鲁棒性,发现其性能可能受到垂直异常值和高杠杆点的影响。为了解决这一问题,作者探索了基于稳健回归中 M-估计量、S-估计量和 τ-估计量的替代损失函数,以提高 XGBoost 在存在异常数据时的预测稳定性。

Read more →


Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning

通过激活引导剪枝实现跨模型规模的无训练知识迁移

该论文研究了跨规模异构模型融合中的一个未被充分探索的设置:用更强的捐赠模型改进较小的接收模型,尽管两者存在显著的架构不匹配。研究发现,将大模型截断为较小架构并以极小的混合权重注入,已经可以改进接收模型。在此基础上,作者提出了激活引导剪枝方法,无需显式的神经元级语义对齐即可实现知识迁移。

Read more →


Hard Cases, Bad Labels: Testing Error Exposure and Error Location in Uncertainty Sampling Under Bounded Label Noise

困难案例与错误标签:有界标签噪声下不确定性采样的错误暴露与错误位置测试

该论文测试了不确定性采样是否因为获取了更多被污染的标签而失败,还是因为错误集中在困难区域而特别有害。研究在三个公开二元表格数据集上,将基于边际的不确定性采样与随机采样进行了比较,测试了干净标签、随机分类噪声(RCN)和有界难度相关噪声三种情况。

Read more →


鲁棒双模型协作随机向量功能链接网络

该论文提出了 KRPRVFL 模型,将 RVFL 网络的计算效率与鲁棒性相结合。传统 RVFL 模型对噪声标签、异常值和不平衡数据敏感,限制了其在实际应用中的性能。KRPRVFL 通过集成核风险敏感均值 p 次幂方法,提高了模型在噪声环境下的鲁棒性。

Read more →


Contrastive Learning for Interpretable Anomaly Detection at Collider Experiments

用于对撞机实验可解释异常检测的对比学习

该论文提出了 ORCA(通过对比学习的组织表示用于异常检测)框架,解决了对撞机物理中事件级异常检测的两个常见问题:异常分数难以解释,且与能量尺度和物体多重性强烈相关。ORCA 首先通过监督对比学习学习嵌入空间,然后在该空间中运行标准自编码器生成事件级异常分数。

Read more →


The Query Knows What to Forget: A Second Erase Direction for Linear Attention

查询知道该忘记什么:线性注意力的第二个擦除方向

该论文提出了查询派生擦除方向(QED),为线性注意力模型增加了一个从查询派生的第二个擦除方向,与键正交。在长上下文中,许多存储项共享固定大小的状态,它们之间的干扰会损害检索。GDN-2 等 delta 规则模型从当前 token 的键派生擦除向量,但读取中的干扰是通过查询测量的,擦除步骤无法触及它。QED 解决了这一不对称性。

Read more →


arXiv CS.CV

What to Preserve, Where to Adapt: A Depth-Wise Analysis of Forgetting in Continual Gynecological Image Segmentation

保留什么,适应哪里:连续妇科图像分割中遗忘的深度分析

该论文研究了妇科图像分割中的持续学习问题。在临床实践中,数据集通常按顺序到达,要求模型持续适应不断变化的数据分布。由于成像模态、解剖结构和标注协议之间存在显著异质性,这构成了一个特别具有挑战性的持续学习场景。研究通过深度分析揭示了模型在哪些层遗忘旧知识、在哪些层适应新数据。

Read more →


Multiphase-Diff: Diffusion-Based Generative Modeling for High-Contrast Multiphase Physical Systems with Sharp Interfaces

Multiphase-Diff:用于高对比度锐界面多相物理系统的扩散生成建模

该论文提出了 Multiphase-Diff,解决了物理约束扩散在高对比度、锐界面多相场中的三个耦合困难:在系数跳跃处,展开的点态强形式 PDE 残差包含奇异梯度项;在极端对比下,低幅度相可能低于扩散噪声底限而被擦除;全局似然尺度允许高幅度相主导监督。

Read more →


PROVE: Training-Free Prompt Recovery using Verifiable Evidence

PROVE:使用可验证证据的无训练提示恢复

该论文提出了 PROVE 方法,一种无需训练的提示恢复技术,使用可验证证据从生成的图像中恢复原始文本提示。随着提示市场的发展,恢复的提示可能使版权作品的未经授权复制和再分发成为可能,也可能暴露编码艺术家创意配方的提示。PROVE 通过可验证证据提高了提示恢复的准确性和可靠性。

Read more →


MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation

MedPlex:面向临床医学分割的深度视觉-语言协同适应

该论文提出了 MedPlex(医学视觉-语言网络),一个端到端的视觉语言模型框架,使文本指导成为连续的、临床有根据的信号。现有文本引导分割方法通常仅将语言作为后期条件信号使用,限制了其对视觉表示学习的影响。MedPlex 将文本知识深度融入视觉分割过程,提高了医学图像分割的临床准确性。

Read more →


Limitations of Synthetic Data Generation in Specialized Data-Scarce Domains

合成数据生成在专业数据稀缺领域的局限性

该论文评估了基于扩散的生成模型在专业数据稀缺领域中的有效性。虽然合成图像生成在 ImageNet 等自然图像基准上显示出前景,但其在稀疏、高方差真实世界领域中的有效性尚不清楚。研究聚焦于与常见图像数据集差异显著且额外数据获取成本高昂的领域,评估了下游分类器性能的提升。

Read more →


CAST: Closed-form Analytic Semantic Transfer for Zero-Shot Classifier Extension

CAST:用于零样本分类器扩展的闭式解析语义迁移

该论文提出了 CAST(闭式解析语义迁移),一个无需训练、无需图像的框架,用于将预训练分类器扩展到先前未见过的类别。在许多领域中,目标分布的数据不可用,零样本学习(ZSL)通过依赖文本描述等辅助语义信息来实现识别。CAST 提供了一种解析方法来实现这一目标。

Read more →


ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

ChartProbe:通过感知、定位和简单推理对视觉推理的诊断研究

该论文研究了视觉语言模型(VLM)在图表问题上的不可靠性。通常将这种弱点归因于推理缺陷,并通过更多推理监督来解决。但作者提出,困难可能不在于推理本身,而在于推理所依赖的更简单技能:读取绘制元素(感知)、定位它们并将其与标签绑定(定位),以及执行排名、总计和差异等单步计算(简单推理)。

Read more →


Kolmogorov-Arnold Networks for Spatially Independent Multispectral Land Classification

用于空间独立多光谱土地分类的 Kolmogorov-Arnold 网络

该论文评估了 Kolmogorov-Arnold 网络(KAN)在 Landsat 8 影像土地分类中的表现,并与随机森林和多层感知机模型进行了比较。土地分类对土地管理、环境监测和城市规划具有重要意义。KAN 作为一种具有紧凑模型结构的新兴替代架构,在多光谱数据分类中展现了竞争力。

Read more →


DeepMind Blog

Introducing Gemini 3.7 Flash

推出 Gemini 3.7 Flash

Google DeepMind 发布了 Gemini 3.7 Flash 模型,这是 Gemini Flash 系列的最新升级版本。该模型在保持快速推理速度的同时,提升了各项任务的性能表现,适合需要高效能 AI 推理的应用场景。

Read more →


Putting sign language AI into users’ hands

将手语 AI 交到用户手中

DeepMind 推出了手语转文本(SL2T)模型,为聋人和重听用户提供了新的手语功能。这一突破性模型能够将手语实时转换为文本,使聋人用户能够更方便地与使用语音或文本的他人进行交流,体现了 AI 技术在促进无障碍沟通方面的潜力。

Read more →


WeatherNext: AI model achieves breakthrough in forecasting cyclones

WeatherNext:AI 模型在飓风预测方面取得突破

DeepMind 的 WeatherNext AI 模型在飓风预测方面取得了突破性进展。该模型能够更准确地预测飓风的路径、强度和影响范围,为灾害预警和应急响应提供了更可靠的数据支持,有望显著减少飓风造成的人员伤亡和财产损失。

Read more →


Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration

Gemini Robotics ER 2:以视频理解、任务编排和多机器人协作驱动机器人

DeepMind 发布了 Gemini Robotics ER 2,该模型在视频

生成二维码中...

请点击右上角 ···

选择 发送给朋友收藏