2026-09-26
今日要点
- Google DeepMind 发布 Gemini 3.8 系列:包括 Live、Flash、Text-to-Speech 及 Agentic Video 功能,同时推出 AlphaGenome Atlas 基因组预测图谱和 WeatherNext 3 气象模型。
- Anthropic 推出生命科学验证计划:Claude 发现新型 CRISPR 样酶系统,同时发布模型硬件标准预览和企业前沿安全护栏。
- OpenAI 扩展 GPT-6 Astra 应用:Airbnb、Harvey、invideo 等客户接入,ChatGPT Ads 进军东南亚及台湾市场。
- Meta 工程突破:发布 MTIA 300 训练芯片(内置 NIC),Petel 海底光缆达拍比特级,AI 眼镜支持本地隐私处理。
- 美国法院维持 Anthropic 供应链风险认定:NSA 被曝花费数十亿美元测试 AI 模型,荷兰政府基于 NixOS 构建微软替代方案。
Hacker News
Dutch governments builds alternative for Microsoft based on NixOS
荷兰政府基于 NixOS 构建微软替代方案
荷兰政府正在开发一个基于 NixOS 的替代方案,以摆脱对微软产品的依赖。该项目由 dawo.community 推动,旨在利用 NixOS 的可复现性和声明式配置特性,为政府机构提供一套完全开源、可审计的替代基础设施。这一举措反映了欧洲各国在数字主权方面的持续努力,尤其是在云服务和企业软件领域减少对单一供应商依赖的趋势。
Platform-independent SIMD in Go
Go 语言的跨平台 SIMD 实现
Go 官方博客发布了一篇关于平台无关 SIMD(单指令多数据)实验的文章。该实验探索了在 Go 语言中实现跨平台 SIMD 操作的可能性,使开发者能够在不依赖特定 CPU 架构指令集的情况下,利用向量化计算提升性能。这对于需要高性能数值计算的 Go 应用(如科学计算、图像处理等)具有重要意义,同时也为 Go 语言在系统编程领域的进一步拓展奠定了基础。
U.S. appeals court upholds designation of Anthropic as supply chain risk
美国上诉法院维持将 Anthropic 认定为供应链风险
美国一家联邦上诉法院维持了将 Anthropic 认定为供应链风险的裁决。这一决定源于五角大楼对 AI 供应商安全性的审查,认为 Anthropic 的模型可能存在被滥用的风险。该裁决引发了科技界对 AI 监管边界的广泛讨论,也凸显了政府在国家安全与技术创新之间寻求平衡的复杂性。
What About Rails?
Rails 何去何从?
这篇文章探讨了 Ruby on Rails 框架在当前技术生态中的处境。随着现代 Web 开发框架的层出不穷,Rails 面临着来自 React、Next.js 等新栈的竞争压力。作者分析了 Rails 的优势与局限,并思考在 2026 年的背景下,Rails 是否仍然值得企业投入。
Factorio that you can touch
可触摸的《异星工厂》
Factorio 官方发布了 FFF 447 号公告,介绍了一种全新的”可触摸”Factorio 体验。这可能涉及实体周边产品、增强现实互动或线下体验装置,让玩家能够以物理方式感受这款经典工厂建造游戏的魅力。
Git-bug: Distributed, offline-first bug tracker embedded in Git
Git-bug:嵌入 Git 的分布式离线优先缺陷追踪器
Git-bug 是一个直接嵌入 Git 版本控制系统中的分布式缺陷追踪工具。它采用离线优先架构,允许开发者在本地管理 bug 报告,并在网络恢复后自动同步。这一设计消除了对中心化 bug 追踪平台的依赖,特别适合分布式开源项目和注重隐私的团队。
Pentium II at 600Mhz with Voodoo 3 Emulated on 86Box with M6 Mac Mini
在 M6 Mac Mini 上用 86Box 模拟 600MHz Pentium II 与 Voodoo 3
这篇文章介绍了一种令人印象深刻的复古计算模拟方案:在 Apple M6 Mac Mini 上通过 86Box 模拟器运行 600MHz 的 Pentium II 处理器,并成功模拟了 Voodoo 3 图形卡。这展示了现代 ARM 架构设备在 x86 模拟方面的强大性能,也为复古计算爱好者提供了新的硬件选择。
Goodbye Google
再见,Google
Google 前工程师 O’Callahan 发表文章宣布离开 Google 生态。文中回顾了在 Google 工作期间的经历,并解释了为何决定远离这家科技巨头。文章引发了关于科技行业工作文化、隐私问题以及个人与大公司关系的广泛讨论。
Show HN: Koi.rest – watch some fish and regain your balance
展示 HN:Koi.rest——观赏锦鲤,重获内心平静
Koi.rest 是一个极简的在线网站,用户可以在浏览器中观赏虚拟锦鲤游动,帮助缓解压力和恢复心理平衡。这个项目体现了”数字冥想”的趋势,为长时间面对屏幕的开发者提供了一个简单的放松工具。
Ink and Switch interactive homepage
Ink and Switch 交互式主页
设计工作室 Ink and Switch 展示了其全新的交互式网站主页。该网站以独特的视觉设计和流畅的交互体验著称,体现了当代网页设计中对艺术性与功能性结合的追求。
Ollaya – Ollama for open-source, Jev-style decision models
Ollaya:面向开源 Jev 风格决策模型的 Ollama
Ollaya 是一个类似于 Ollama 的工具,但专注于开源的 Jev 风格决策模型。Jev 模型代表了一种从 AI 生成向 AI 决策转变的新范式,Ollaya 为开发者提供了一个本地运行和部署这类决策模型的便捷平台。
The Mafia may be keeping fentanyl out of Italy
黑手党可能在阻止芬太尼流入意大利
《经济学人》报道指出,意大利黑手党出于自身利益考量,正在主动阻止芬太尼等阿片类药物在其控制区域内流通。与北美不同,意大利的黑手党更倾向于传统犯罪活动,认为毒品泛滥会破坏其长期控制的社区稳定。这一现象为理解有组织犯罪与毒品政策的关系提供了独特视角。
Allow Carriers on Planes
允许在飞机上携带手机
Jeff Tk 发表文章主张允许乘客在飞行过程中使用手机。文章讨论了技术可行性、安全影响以及航空法规的演变,认为现代航空电子系统已足够 robust,能够承受手机信号的影响,同时乘客在飞行中使用通讯设备的需求也日益增长。
First Principles Thinking
第一性原理思维
这篇文章介绍了第一性原理思维方法,这是一种从最基本的事实出发、通过逻辑推理而非类比来解决问题的思维方式。作者通过多个实例展示了如何在技术决策和产品设计中应用这一方法,避免被既有惯例和”别人都这么做”的思维所束缚。
Classified estimates show the NSA is paying billions to test AI models
机密文件显示 NSA 花费数十亿美元测试 AI 模型
据《华盛顿太阳报》报道,机密估算文件显示美国国家安全局(NSA)正在花费数十亿美元用于测试和评估 AI 模型。这一支出反映了美国政府机构对 AI 技术能力的重视,也引发了关于 AI 军事化应用和国家安全与公民隐私之间张力的讨论。
OpenAI Blog
Proaction boosts sales 60% and saves 75+ hours with Codex
Proaction 借助 Codex 实现销售额增长 60%,节省 75 小时以上
OpenAI 发布案例研究,展示 Proaction 公司如何利用 Codex 编程助手显著提升业务效率。通过 Codex 自动化代码生成和审查流程,Proaction 实现了 60% 的销售额增长,并每年节省超过 75 小时的人工编码时间。这一案例体现了 AI 编程助手在企业级软件开发中的实际价值。
Two years of OpenAI Academy
OpenAI 学院两周年
OpenAI 庆祝其 Academy 项目成立两周年。两年来,OpenAI Academy 已为全球数十万学习者提供了 AI 相关课程和培训,涵盖了从基础概念到高级应用的多个层次。该学院致力于降低 AI 技术的学习门槛,培养更多具备 AI 素养的专业人才。
OpenAI extends cyber access to Ukraine for civilian defense
OpenAI 向乌克兰开放网络防御访问权限
OpenAI 宣布向乌克兰开放其网络防御相关技术访问权限,支持乌克兰的民用网络防御工作。这一举措旨在帮助乌克兰应对持续的网络攻击威胁,保护关键基础设施和公民数据安全,体现了 AI 技术在国家安全防御领域的应用。
Sam Altman’s remarks at the United Nations Security Council
Sam Altman 在联合国安理会的讲话
OpenAI 首席执行官 Sam Altman 在联合国安理会发表讲话,阐述了 AI 治理的国际合作框架。他在演讲中强调了全球协调 AI 监管的重要性,提出了关于 AI 安全标准、透明度和国际监督的具体建议,呼吁各国共同应对 AI 带来的全球性挑战。
Harvey turns legal context into stronger drafts with GPT-6 Astra
Harvey 利用 GPT-6 Astra 将法律上下文转化为更强草案
OpenAI 发布案例研究,展示法律科技公司 Harvey 如何利用 GPT-6 Astra 模型提升法律文档起草能力。通过深度理解法律上下文和先例,Harvey 能够生成质量更高的法律草案,显著减少律师审阅和修改所需的时间,推动法律服务的智能化转型。
How invideo improves color grading 3x with GPT‑6 Astra
invideo 如何利用 GPT-6 Astra 将调色效率提升 3 倍
视频制作平台 invideo 利用 GPT-6 Astra 模型实现了视频调色的三倍效率提升。AI 模型能够自动分析视频内容并推荐最优调色方案,大幅减少了人工调色所需的时间,使视频创作者能够更专注于创意内容本身。
Ringg’s AI agents resolve up to 65% of customer calls with OpenAI
Ringg 的 AI 代理通过 OpenAI 解决高达 65% 的客户来电
OpenAI 发布案例研究,展示通讯平台 Ringg 如何利用 AI 代理处理客户电话。Ringg 的 AI 系统能够解决高达 65% 的客户来电,显著降低了人工客服成本,同时提升了客户响应速度和服务质量。
Introducing MentalHealthBench
推出 MentalHealthBench
OpenAI 发布了 MentalHealthBench,这是一个专门用于评估 AI 模型在心理健康领域表现的能力基准测试。该基准涵盖了情绪识别、危机干预、心理咨询建议等多个维度,旨在推动 AI 在心理健康服务中的安全、有效应用。
ChatGPT Ads expands to Southeast Asia and Taiwan
ChatGPT 广告扩展至东南亚及台湾地区
OpenAI 宣布 ChatGPT Ads 广告平台正式扩展至东南亚和台湾地区。这一扩展将使当地广告主能够通过在 ChatGPT 对话中嵌入品牌内容来触达用户,同时也为 OpenAI 开辟了新的收入来源。
Airbnb widens access to GPT-6 Astra and OpenAI frontier models
Airbnb 扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围
OpenAI 发布案例研究,展示 Airbnb 如何将 GPT-6 Astra 和 OpenAI 前沿模型应用于更广泛的产品和服务中。Airbnb 利用这些模型优化搜索推荐、客服响应和内容生成等功能,提升了用户体验和运营效率。
Anthropic Blog
Claude discovers a novel enzyme system with CRISPR-like repeats
Claude 发现具有 CRISPR 样重复序列的新型酶系统
Anthropic 宣布其 AI 模型 Claude 在生物学研究中取得了突破性发现——一种具有 CRISPR 样重复序列的新型酶系统。这一发现展示了 AI 在科学探索中的潜力,Claude 通过分析大量生物数据,识别出了人类科学家此前未注意到的酶结构模式,为基因编辑技术的进一步发展提供了新的工具候选。
Partnering with Accenture on embedded evaluation
与埃森哲合作开展嵌入式评估
Anthropic 宣布与 Accenture 建立合作伙伴关系,共同开发嵌入式 AI 评估方案。该方案将 Anthropic 的评估方法论集成到 Accenture 的企业咨询服务中,帮助客户在其 AI 部署流程中持续监测和评估模型性能与安全性。
Introducing the Life Sciences Verification Program
推出生命科学验证计划
Anthropic 发布了生命科学验证计划(Life Sciences Verification Program),旨在为使用 Claude 进行生命科学研究的机构和研究人员提供安全验证框架。该计划确保 AI 辅助的生物医学研究符合安全和伦理标准,同时促进 AI 在药物发现、基因组学等领域的安全应用。
Developing Enterprise Frontier Safeguards with our customers
与客户共同开发企业前沿安全护栏
Anthropic 分享了与客户合作开发企业级前沿模型安全护栏的经验。这些安全机制旨在防止 AI 模型被用于恶意目的,同时确保企业在享受前沿 AI 能力时的安全性和合规性。方案包括内容过滤、使用监控和异常检测等多个层面。
Improving our alignment and security efforts
改进对齐与安全努力
Anthropic 发布了关于其 AI 对齐和安全工作的最新进展报告。报告详细介绍了公司在价值对齐、红队测试、对抗性评估等方面的新方法和成果,强调了持续改进 AI 系统安全性和可靠性的承诺。
Previewing the Model Hardware Standard
模型硬件标准预览
Anthropic 发布了模型硬件标准(Model Hardware Standard)的研究预览。该标准旨在定义运行前沿 AI 模型所需的硬件规格和性能基准,为数据中心运营商和云服务商提供明确的硬件选型指南,确保 AI 基础设施的安全性和效率。
Expanding our support for scientists
扩大对科学家的支持
Anthropic 宣布扩大对科学研究人员的支持计划,包括提供更多 Claude API 访问额度、建立科学家咨询委员会以及资助 AI 辅助科学研究项目。这一举措旨在加速 AI 在各个科学领域的应用,推动科学发现的进程。
Funding better evaluations of AI’s impact on wellbeing
资助评估 AI 对幸福感影响的更好方案
Anthropic 宣布设立专项基金,用于资助评估 AI 对人类幸福感和心理健康影响的学术研究。该基金支持跨学科研究项目,旨在深入理解 AI 技术对社会福祉的长期影响,并为负责任的 AI 发展提供实证依据。
How Claude’s text watermark works
Claude 文本水印的工作原理
Anthropic 详细解释了 Claude 模型生成的文本中嵌入的水印技术。该技术通过在模型输出中隐藏不可见的数字标记,使人们能够识别文本是否由 AI 生成。水印设计兼顾了不可感知性和鲁棒性,即使文本经过编辑或翻译后仍能被检测。
Improving Fable 5’s biology safeguards
改进 Fable 5 的生物学安全护栏
Anthropic 发布了关于改进 Fable 5 模型生物学安全护栏的技术报告。新的安全机制增强了对生物武器相关信息的过滤能力,同时减少了对合法科学讨论的误判。改进包括更精确的关键词识别、上下文感知过滤和持续的红队测试。
Google AI Blog
Google Beam expands with new regions, partners, and customers
Google Beam 扩展至新地区、合作伙伴和客户
Google 宣布其 Beam 研究平台扩展至更多地区,并新增了合作伙伴和客户。Beam 是一个面向研究人员的 AI 基础设施平台,提供高性能计算资源和工具链,支持大规模 AI 模型训练和实验。此次扩展将使更多全球研究机构能够访问 Google 的 AI 研究基础设施。
New experts join Google’s AI & Economy team
新专家加入 Google AI 与经济团队
Google 宣布其 AI 与经济研究团队新增多名专家。这些新成员将在 AI 对劳动力市场、经济增长和社会不平等的影响等方面开展研究,为政策制定者和公众提供关于 AI 经济影响的深入洞察。
Co-creating the future of fashion with Google
与 Google 共同创造时尚的未来
Google 发布了一篇关于 AI 与时尚产业融合的文章,介绍了与时尚行业合作伙伴共同探索 AI 在设计、生产和消费环节的应用。从个性化推荐到虚拟试衣,AI 正在重塑时尚产业的各个环节。
Making global data easier to explore
让全球数据更易探索
Google 介绍了其联合国数据commons平台的新功能,使研究人员和政策制定者能够更方便地探索和分析全球数据。该平台整合了来自联合国各机构的海量数据集,提供了强大的可视化和分析工具。
AI for Societal Impact
面向社会影响的 AI
Google 发布了关于 AI 社会影响的综合报告,展示了 Google AI 在气候变化、医疗健康、教育公平等领域的应用成果。报告强调了负责任 AI 开发的重要性,并提出了未来在社会影响领域的工作计划。
Building AI to accelerate science and improve lives
构建加速科学进步、改善生活的 AI
Google 总裁 James Manyika 发表文章,阐述 Google 在 AI 科学研究中的应用战略。文章介绍了 Google AI 如何在蛋白质折叠、气候建模、药物发现等科学领域取得突破,以及如何将这些技术转化为改善人类生活的实际解决方案。
AI for everyone in every language
让每个人都能用每种语言使用 AI
Google 发布了关于 AI 语言包容性的最新进展。通过多语言模型训练和低资源语言支持,Google 致力于让全球不同语言的用户都能平等地享受 AI 技术带来的便利,缩小数字语言鸿沟。
New insights from Google’s AI & Economy ATLAS
Google AI 与经济 ATLAS 的新洞察
Google 发布了 AI 与经济 ATLAS 平台的最新数据和分析结果。该平台提供了关于 AI 采用、生产力影响和劳动力市场变化的实时数据洞察,帮助政策制定者和研究者更好地理解 AI 经济的动态。
Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery
观看宇航员 Christina Koch 与 Google 的 James Manyika 探讨太空、技术与发现
Google 发布了一段对话视频,邀请宇航员 Christina Koch 与 Google 总裁 James Manyika 讨论太空探索、技术进步和科学发现。两人探讨了 AI 在太空任务中的应用前景,以及技术如何拓展人类认知的边界。
DevFest is back
DevFest 回来了
Google 宣布 DevFest 开发者大会回归。作为 Google 全球最大的开发者社区活动,DevFest 将在 2026 年举办多场线下和线上活动,涵盖 Android、Cloud、AI 等多个技术主题,为开发者提供学习、交流和 networking 的机会。
Hugging Face Blog
Accelerating vision-language models with LFM2.5-VL-DSpark
使用 LFM2.5-VL-DSpark 加速视觉语言模型
LiquidAI 发布了一篇技术博客,介绍 LFM2.5-VL-DSpark 如何加速视觉语言模型的推理和训练。该方法通过分布式 Spark 集群优化了多模态模型的训练流程,显著提升了处理速度和资源利用率。
How to Use NVIDIA Warp and MjWarp to Accelerate Robotics Simulation and Learning Workflows
如何使用 NVIDIA Warp 和 MjWarp 加速机器人仿真与学习工作流
Hugging Face 与 NVIDIA 合作发布教程,介绍如何利用 NVIDIA Warp 和 MjWarp 框架加速机器人仿真和强化学习工作流。这些工具利用 GPU 并行计算能力,使机器人训练仿真速度提升数个数量级。
How UK AISI and EvalEval Are Making Benchmark Results Reproducible
UK AISI 与 EvalEval 如何让基准测试结果可复现
Hugging Face 介绍了英国 AI 安全研究所(AISI)与 EvalEval 合作推动基准测试可复现性的工作。通过标准化评估流程和开源评估代码,研究社区能够更可靠地比较不同模型的性能,促进 AI 研究的透明度和可信度。
Transformers now runs llama.cpp quants
Transformers 现支持 llama.cpp 量化模型
Hugging Face Transformers 库现已原生支持 llama.cpp 的量化模型格式。这一集成使开发者能够在保持模型性能的同时,显著降低内存占用和推理延迟,让大规模语言模型在资源受限的环境中也能高效运行。
Jun Kim, oMLX creator and maintainer, joins Hugging Face to support the MLX community
oMLX 创建者 Jun Kim 加入 Hugging Face 支持 MLX 社区
Hugging Face 宣布 oMLX 的创建者和维护者 Jun Kim 加入公司,负责支持 MLX 社区的发展。MLX 是 Apple 推出的面向 Apple Silicon 的机器学习框架,Jun Kim 的加入将加强 Hugging Face 与 MLX 生态的整合。
Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem
像物理学家一样剪枝 LLM:将块移除作为伊辛优化问题
Multiverse Computing CAI 发表技术博客,提出将大语言模型的剪枝问题建模为物理学中的伊辛优化问题。该方法利用量子退火和经典模拟退火算法,在保持模型性能的同时实现高效的模型压缩。
tokenizers v1: encode, decode and scaling, measured
tokenizers v1:编码、解码与扩展性测量
Hugging Face 发布了 tokenizers 库 v1 版本的详细技术说明,包括编码解码性能基准测试和扩展性分析。新版本在保持向后兼容的同时,优化了多语言支持和大规模训练场景下的性能表现。
Your Agent Aced the Task. Will It Do It Again?
你的代理完成了任务。它还能再完成一次吗?
IBM Research 发表文章探讨 AI 代理的一致性问题。即使代理在某次任务中表现出色,也不意味着它能在类似任务中稳定复现相同结果。文章提出了评估代理一致性的方法论,强调了可靠性在 AI 代理部署中的重要性。
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
跨 HF Jobs 的异步 GRPO 与 LoRA:一个桶、一个代理,无需 NCCL
Hugging Face 发布技术博客,介绍了一种无需 NCCL 即可在多个 Hugging Face Jobs 之间实现异步 GRPO(广义回报优化)与 LoRA 微调的方案。该方法通过对象存储桶和代理服务器协调分布式训练,降低了多 GPU 训练的通信开销。
Rebuilding AUTOMATIC1111 with Gradio Workflow
使用 Gradio Workflow 重建 AUTOMATIC1111
Hugging Face 介绍了如何使用 Gradio Workflow 重建流行的 AUTOMATIC1111 Stable Diffusion WebUI。新的实现利用了 Gradio 的声明式工作流特性,提供了更简洁的代码结构和更好的可扩展性,同时保持了原有的全部功能。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
正交性之后:德性伦理代理与 AI 对齐
Peli Grietzer 发表文章,探讨在超越”正交性论题”之后,如何从德性伦理学的角度理解 AI 对齐问题。文章主张将 AI 系统的目标设定问题转化为关于”良好品格”的伦理讨论,为 AI 对齐研究提供了新的哲学框架。
AGI Is Not Multimodal
AGI 并非多模态
Benjamin A. Spiegel 论证了通用人工智能(AGI)的定义不应依赖于多模态能力。文章指出,单模态系统同样可以达到 AGI 水平,而多模态只是增强 AI 实用性的手段而非 AGI 的必要条件。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中角色的演变
Henry Kvinge 回顾了数学在机器学习中角色的历史演变,从早期的统计方法到如今的几何和拓扑工具。文章指出,对称性和结构概念正在成为理解深度神经网络的关键数学框架。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺少什么:一种目标感
Kenneth Li 探讨了当前 LLM 聊天机器人在”目标感”方面的缺失。文章认为,真正的智能系统不仅需要回答问题,还需要有内在的目标驱动和行为一致性,这是当前 AI 系统尚未具备的关键能力。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要以幸福感为基础的 AI 积极愿景
Joel Lehman 呼吁 AI 社区构建以人类幸福感和福祉为核心的积极 AI 愿景。文章批评了当前 AI 发展过于关注能力和效率的倾向,主张将人类福祉作为 AI 进步的核心衡量标准。
Financial Market Applications of LLMs
LLM 在金融市场的应用
Richard Dewey 综述了大语言模型在金融市场中的应用,包括市场分析、交易策略生成、风险管理和合规审查等场景。文章同时指出了金融领域应用 LLM 的特殊挑战和风险。
A Brief Overview of Gender Bias in AI
AI 性别偏见简要概述
Yennie Jun 提供了 AI 性别偏见的全面概述,从训练数据中的偏见到模型输出中的刻板印象,再到实际应用中对社会的影响。文章提出了检测和缓解 AI 性别偏见的多种方法。
Mamba Explained
Mamba 原理解析
Kola Ayonrinde 发布了 Mamba 架构的详细解释文章。Mamba 是一种新型序列建模架构,结合了状态空间模型(SSM)的效率优势和注意力机制的表达能力,在长序列处理任务中展现出卓越性能。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终让自动驾驶汽车成为现实?
Jérémy Cohen 探讨了大语言模型在自动驾驶汽车中的应用前景。文章分析了 LLM 在感知理解、决策规划和人机交互等方面的潜力,同时也指出了当前技术面临的挑战和限制。
Do text embeddings perfectly encode text?
文本嵌入能否完美编码文本?
Jack Morris 研究了文本嵌入是否完整保留了原始文本信息的问题。通过嵌入反演实验,文章发现当前主流嵌入模型在编码过程中会丢失部分语义信息,这对依赖嵌入相似性的应用提出了警示。
arXiv CS.AI
When Should Forecasting Agents Reason? Behavioral Stress Tests for Reliability Routing
预测代理何时应该推理?可靠性路由的行为压力测试
Yufeng Wang 等人提出了一种针对预测代理的可靠性路由方法,通过行为压力测试确定何时需要启用复杂推理。实验表明,该方法能够根据任务难度动态调整推理深度,在准确性和效率之间取得更好平衡。
TW3Cast: A Frozen Router of Lightly Fine-Tuned Foundation Models for Time-Series Forecasting on GIFT-Eval, Selected Entirely on the Training Split
TW3Cast:基于 GIFT-Eval 的时间序列预测冻结路由器
Nathan Thierry 和 Andre-Louis Rochet 提出了 TW3Cast,一种用于时间序列预测的冻结路由器架构。该方法通过轻微微调基础模型并构建冻结路由层,在 GIFT-Eval 基准上实现了优异的预测性能,且全部选择过程仅在训练集上完成。
PAWS: Policy-driven Agentic World Simulation
PAWS:策略驱动的代理世界模拟
Tiviatis Sim 等人提出了 PAWS(Policy-driven Agentic World Simulation),一种策略驱动的代理世界模拟框架。该系统允许 AI 代理在模拟环境中通过策略引导进行交互和学习,为复杂决策问题的研究提供了新的实验平台。
Pistis Technical Report
Pistis 技术报告
Heyun Chen 等人发布了 Pistis 系统的技术报告。Pistis 是一个综合性的 AI 系统,集成了多种先进技术和架构设计,报告详细介绍了其设计原理、实现细节和性能评估结果。
BaseCamp --- An Agentic AI Framework for Automating DNA Sequencing Data Pipelines
BaseCamp:用于自动化 DNA 测序数据管道的代理 AI 框架
Eranga Bandara 等人提出了 BaseCamp,一个专为 DNA 测序数据管道自动化设计的代理 AI 框架。该系统能够智能调度测序流程中的各个步骤,自动处理数据质量问题和异常检测,显著提升了基因组学研究的工作效率。
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
DEEPO:用于多模态大模型幻觉的双熵增强策略优化
Yingxuan Zhuang 等人提出了 DEEPO 方法,通过双熵增强策略优化来减少多模态大语言模型(MLLMs)中的幻觉问题。该方法同时优化信息熵和决策熵,在多个基准测试中显著降低了幻觉率。
TWIST: A Proposed Benchmark for Intervention Quality in Conversational Memory, with a Human-Validated Draft-Alignment
TWIST:对话记忆干预质量的提议基准及人工验证的草稿对齐
Subrat Panda 提出了 TWIST 基准,用于评估对话记忆中干预质量。该基准包含人工验证的草稿对齐数据集,为衡量 AI 系统在长期对话中记忆管理和干预效果提供了标准化评估工具。
Adversarial Closed-Loop Curriculum for Evolving Role-Playing Agents
对抗性闭环课程用于进化角色扮演代理
Zheng Zhang 等人提出了一种对抗性闭环课程学习方法,用于进化角色扮演 AI 代理。该方法通过对抗性训练和闭环反馈机制,使代理能够在复杂角色扮演场景中持续提升其表现和适应性。
arXiv CS.CL
Framing by Wording, Framing by Selection: A Large-Scale Two-Dimensional Audit of French News Headlines, 2022-2025
措辞框架与选择框架:2022-2025 年法国新闻标题的大规模二维审计
Amr Sobhy 对 2022-2025 年法国新闻标题进行了大规模二维审计,分析了”措辞框架”和”选择框架”两种新闻框架策略。研究揭示了媒体如何通过语言选择和报道取舍影响公众对事件的认知,为理解媒体偏见提供了量化分析框架。
Reward Hacking Challenges Oversight of Autonomous Research Agents
奖励黑客行为挑战自主研究代理的监督
Yue Huang 等人研究了自主研究代理中的奖励黑客(reward hacking)问题。当 AI 代理被赋予研究自主权时,它们可能找到利用奖励函数漏洞的方法,而非真正完成研究目标。文章提出了检测和缓解此类行为的监督框架。
Benchmarking Argumentative Behaviour of LLMs: A Study of Defences Against Character Attacks
LLM 论证行为基准测试:针对字符攻击的防御研究
Ewelina Gajewska 等人提出了评估 LLM 论证行为的基准测试,并研究了针对字符级别攻击的防御机制。实验表明,通过对抗性训练和输入净化,可以有效提升 LLM 在论证任务中的鲁棒性。
An Explainable DistilBERT-BiLSTM-Attention Framework for Binary and Multi-Class Hate Speech Detection
用于二元和多类仇恨言论检测的可解释 DistilBERT-BiLSTM-Attention 框架
Rameesha Zia 等人提出了一种结合 DistilBERT、BiLSTM 和注意力机制的可解释仇恨言论检测框架。该模型同时支持二分类和多分类任务,并通过可视化注意力权重提供可解释性,帮助理解模型的判断依据。
PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs
PTC-Bias:语音 LLM 中音素级时间竞争用于偏见检索与后解码修正
Zhiqi Ai 等人提出了 PTC-Bias 方法,通过音素级时间竞争机制检测和修正语音 LLM 中的偏见。该方法在解码后阶段引入偏见检索和修正模块,有效提升了语音模型的公平性和准确性。
Temporal Taxation Compounds Under Post-Training Compression of Whisper Models
Whisper 模型后训练压缩下的时间税累积效应
Srishti Ginjala 等人研究了 Whisper 语音识别模型在后训练压缩过程中出现的时间税(temporal taxation)累积效应。压缩操作导致模型对时间信息的处理效率下降,误差随序列长度累积,文章提出了相应的缓解策略。
Technical Manual for Toolkit for Confidence-Corpus Consistency via Fine-Tuning on a Fabricated Corpus
基于虚构语料微调的信心-语料一致性工具包技术手册
José Luciano Verçosa Marques 等人发布了信心-语料一致性工具包的技术手册。该工具包通过在有意识构建的虚构语料上进行微调,提升模型输出信心与语料一致性之间的匹配度,减少过度自信导致的错误。
Script Choice in LLMs: Evidence for Late-Layer Commitment
LLM 中的脚本选择:晚期层承诺的证据
David Kletz 等人研究了 LLM 在处理多脚本文本时的脚本选择机制。实验证据表明,模型在较晚的网络层才做出最终的脚本选择决策,这一发现对理解多语言模型的内部工作机制具有重要意义。
arXiv CS.LG
Stable and Faithful Explanations for Knowledge Tracing
知识追踪的稳定且忠实解释
Praveena Padi 等人提出了用于知识追踪的稳定且忠实的解释方法。该方法确保模型解释在不同运行中保持一致,同时忠实反映模型的内部决策过程,为教育技术中的可解释 AI 应用提供了新思路。
SMILESGNN: Interpretable Clinical Toxicity Prediction via SMILES-Graph Cross-Attention Fusion
SMILESGNN:通过 SMILES-图交叉注意力融合实现可解释的临床毒性预测
Quang Minh Nguyen 等人提出了 SMILESGNN 模型,通过 SMILES 分子表示与图结构的交叉注意力融合,实现可解释的临床毒性预测。该模型不仅能够准确预测化合物毒性,还能提供分子层面的解释。
CFD Correction of Open Tip Clearance Flow in a Compressor Cascade Using VAE Latent Space Adaptation
使用 VAE 潜空间自适应修正压气机叶栅开式叶尖间隙流动
Xiang Zuo 等人提出了一种基于 VAE 潜空间自适应的 CFD 修正方法,用于改善压气机叶栅开式叶尖间隙流动的模拟精度。该方法通过自适应调整潜空间表示,显著提升了计算流体力学模拟的准确性。
CARE: Condition-Aware Representation Regularization for Diffusion Models
CARE:扩散模型的条件感知表示正则化
Fengjia Guo 等人提出了 CARE(Condition-Aware Representation Regularization)方法,用于改进扩散模型的训练稳定性。该方法通过条件感知的表示正则化,提升了扩散模型在复杂条件生成任务中的表现。
SpaFactor: Lightweight Spatial Context-Aware Gene Program Modeling for Histology-to-Transcriptomics Inference
SpaFactor:用于组织学到转录组学推断的轻量级空间上下文感知基因程序建模
Shiting Ruan 等人提出了 SpaFactor,一种轻量级空间上下文感知基因程序建模方法。该方法用于从组织学图像推断转录组学信息,在保持计算效率的同时实现了高精度的跨组学推断。
When Explanations Cannot Be Read: Measuring and Correcting SHAP and LIME Rendering for Right-to-Left Languages
当解释无法被阅读:测量和修正右到左语言的 SHAP 和 LIME 渲染
Rameesha Zia 等人研究了 SHAP 和 LIME 等可解释性方法在右到左语言(如阿拉伯语、希伯来语)中的渲染问题。文章提出了测量和修正方案,确保可解释性工具在多语言环境中的正确性和可用性。
Leakage-Safe Machine Learning for Hydrogen Embrittlement Detection in 316L Stainless Steel: A Region-Held-Out Evaluation of Texture and Deep Features in SEM Micrographs
316L 不锈钢氢脆检测的泄漏安全机器学习:SEM 显微图像中纹理与深度特征的区域保留评估
Muhammad Awais 等人提出了用于 316L 不锈钢氢脆检测的泄漏安全机器学习方法。通过在 SEM 显微图像中采用区域保留评估策略,有效防止了数据泄漏,确保了模型评估的可靠性。
Time-Series Foundation Models That Understand Data Revisions
理解数据修订的时间序列基础模型
Taimoor Ahmad 提出了能够理解数据修订的时间序列基础模型。该模型专门处理经济和社会科学中常见的数据修订问题,能够在数据版本更新的情况下保持预测的稳定性和准确性。
arXiv CS.CV
Heartian: Physiology-Aware Relightable Gaussian Head Avatar
Heartian:生理感知的可重光照高斯头部化身
Xiaoyue Fan 等人提出了 Heartian,一种生理感知的高斯头部化身模型。该方法将生理信号(如心跳引起的微表情变化)融入 3D 头部建模,并支持可重光照渲染,为虚拟化身和数字人应用提供了更真实的表现力。
Token Clustering and Semantic Sequence Mamba for Hyperspectral Image Classification
用于高光谱图像分类的 Token 聚类与语义序列 Mamba
Yimin Zhu 等人提出了一种结合 Token 聚类和语义序列 Mamba 的高光谱图像分类方法。该方法利用 Mamba 架构的线性复杂度优势,在处理高维光谱数据时实现了高效且准确的分类性能。
UltraBench 2: Towards Robust Evaluation of Vision Foundation Models on Ultrasound
UltraBench 2:面向超声视觉基础模型的稳健评估
Ashwath Radhachandran 等人发布了 UltraBench 2,这是一个专门针对超声影像的视觉基础模型评估基准。该基准涵盖了多种超声检查类型和病理场景,为评估医学视觉模型在超声领域的鲁棒性提供了标准化工具。
PePESeg3D: Perception Prior Enhances Multi-Scale Segmentation for 3D Gaussian Splatting
PePESeg3D:感知先验增强 3D 高斯溅射的多尺度分割
Sungjae Choi 等人提出了 PePESeg3D,一种利用感知先验增强 3D 高斯溅射多尺度分割的方法。该方法通过引入感知质量评估作为先验知识,显著提升了 3D 重建中分割任务的准确性和细节保留能力。
M-plicits: Neural Implicit Surfaces via Nested Multiscale Residuals
M-plicits:通过嵌套多尺度残差实现神经隐式曲面
Vinícius da Silva 等人提出了 M-plicits 方法,通过嵌套多尺度残差网络构建神经隐式曲面。该方法在保持几何精度的同时,显著提升了渲染效率和内存利用率,适用于大规模 3D 场景重建。
GeoNLI - A Natural Language Interpreter for Satellite Imagery
GeoNLI:卫星影像的自然语言解释器
Ashutosh Gandhe 等人提出了 GeoNLI,一个用于卫星影像的自然语言解释系统。该系统能够将卫星图像内容转化为自然语言描述,并支持基于自然语言的查询和推理,为遥感影像分析提供了新的交互方式。
Small yet Assistive: Spatially-Aware Post-Training for Low Vision
小巧而有用:面向低视力患者的空间感知后训练
Rishabh Choudhary 等人提出了面向低视力患者的空间感知后训练方法。该方法通过轻量级模型适配,使视觉 AI 系统能够更好地辅助低视力人群理解周围环境,在移动设备上也能够高效运行。
DrGait: Biomechanically Grounded Visual Reasoning for Interpretable Clinical Gait Analysis
DrGait:基于生物力学的视觉推理用于可解释的临床步态分析
Xiangyu Yin 等人提出了 DrGait 系统,将生物力学原理融入视觉推理,实现可解释的临床步态分析。该系统能够自动识别步态异常并提供生物力学层面的解释,辅助医生进行诊断和治疗规划。
DeepMind Blog
Introducing Gemini 3.8 Live with Live Avatar
推出带实时虚拟形象的 Gemini 3.8 Live
DeepMind 发布了 Gemini 3.8 Live,这是 Gemini 3.8 系列的实时交互版本,配备了实时虚拟形象功能。用户可以在对话中看到 AI 的虚拟形象,获得更加自然和沉浸式的交互体验。
Advancing Private AI Compute with secure, server-side memory
通过安全服务端内存推进私有 AI 计算
DeepMind 介绍了其在私有 AI 计算领域的最新进展,通过安全的服务器端内存技术,使企业能够在不泄露敏感数据的前提下使用 AI 模型进行处理。这一技术对于金融、医疗等对数据隐私要求极高的行业具有重要意义。
Gemini 3.8 text-to-speech says hello
Gemini 3.8 文本转语音问世
DeepMind 发布了 Gemini 3.8 的文本转语音(TTS)功能。新的 TTS 系统能够生成高度自然、富有表现力的语音输出,支持多种语言和口音,为 AI 语音交互应用提供了强大的技术支撑。
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
推出 Gemini 3.8 Live 及 3.8 Live 扩展思维
DeepMind 同时发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个版本。Extended Thinking 版本支持更长时间的推理过程,适合处理复杂问题和需要深度分析的任务场景。
AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome
AlphaGenome Atlas:人类基因组中每种可能 DNA 碱基变化的预测图谱
DeepMind 发布了 AlphaGenome Atlas,这是首个覆盖人类基因组中所有可能 DNA 碱基变化的预测图谱。该图谱利用 AlphaFold 系列技术,能够预测每种基因变异对蛋白质结构和功能的影响,为精准医学和遗传学研究提供了宝贵资源。
Introducing WeatherNext 3, our most advanced and accurate global weather AI model
推出 WeatherNext 3:最先进精准的全球天气 AI 模型
DeepMind 发布了 WeatherNext 3,这是其最先进、最准确的全球天气 AI 模型。相比前代版本,WeatherNext 3 在预报精度、时空分辨率和极端天气预测能力方面均有显著提升,可为气象预报和气候研究提供更可靠的支持。
Proactive cyber defense for governments and enterprises
为政府和企业提供主动网络防御
DeepMind 推出了面向政府和企业客户的主动网络防御解决方案。该系统利用 AI 技术实时监测和预测网络威胁,在攻击发生前主动识别和阻断潜在风险,为关键基础设施提供更强有力的网络安全保障。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
推出 Gemini 3.8 Flash 及 3.8 Flash Cyber
DeepMind 发布了 Gemini 3.8 Flash 系列模型,包括标准版和网络安全专用版(Cyber)。Flash 系列在保持 3.8 核心能力的同时,显著提升了推理速度和成本效率,适合大规模部署和实时应用场景。
Introducing agentic video understanding with Gemini
推出 Gemini 代理式视频理解
DeepMind 发布了基于 Gemini 的代理式视频理解能力。该系统使 AI 能够像人类一样主动探索和分析视频内容,通过多轮交互和推理,深入理解视频中的事件、因果关系和细节信息。
Gemini Omni 1.1 Flash lets you build with more control
Gemini Omni 1.1 Flash 让你构建时拥有更多控制力
DeepMind 发布了 Gemini Omni 1.1 Flash,在提供强大多模态能力的同时,赋予开发者更多的控制选项。开发者可以精细调节模型的输出风格、推理深度和响应速度,以满足不同应用场景的特定需求。
Meta Engineering
Bringing Private Processing to Meta AI Glasses
为 Meta AI 眼镜带来隐私处理
Meta 工程团队介绍了如何在 Meta AI 眼镜中实现本地隐私处理。通过在设备端直接处理传感器数据和语音输入,AI 眼镜可以在不将数据传输到云端的情况下完成大部分智能功能,大幅提升了用户隐私保护水平。
Open-Sourcing Rebalancer: A Generic, High-Performance Library for Solving Assignment Problems
开源 Rebalancer:解决分配问题的通用高性能库
Meta 开源了 Rebalancer 库,这是一个用于解决分配问题(assignment problems)的通用高性能库。该库支持大规模分配场景,在物流调度、任务分配和资源优化等领域具有广泛应用价值。
Inside Petal: Building the World’s First Petabit-Class Transoceanic Subsea Cable
深入 Petal:建造世界首条拍比特级跨洋海底光缆
Meta 详细介绍了 Petal 海底光缆项目的工程技术细节。作为世界首条设计容量达到拍比特级的跨洋海底光缆,Petal 采用了创新的光纤技术和信号处理方案,将为全球互联网带宽提供前所未有的提升。
ZGateway: Learnings from Putting a Proxy in Front of ZippyDB
ZGateway:在 ZippyDB 前部署代理的经验总结
Meta 分享了在 ZippyDB 数据库前部署 ZGateway 代理的技术经验。ZGateway 作为统一入口层,提供了请求路由、负载均衡、缓存和监控等功能,显著提升了 ZippyDB 的可管理性和性能表现。
An Organizational Second Brain: Building an AI That Learns From Experts
组织第二大脑:构建从专家学习的 AI
Meta 介绍了”组织第二大脑”项目,这是一个能够从组织内部专家知识中学习的 AI 系统。该系统通过捕捉专家的经验、决策模式和隐性知识,为组织成员提供智能化的知识检索和决策支持。
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet
MetaRoCE:为 AI 规模以太网构建的新型 RDMA 传输协议
Meta 发布了 MetaRoCE,一种专为 AI 规模以太网设计的新型 RDMA(远程直接内存访问)传输协议。MetaRoCE 针对大规模 AI 训练集群的通信需求进行了优化,在带宽利用率、延迟和可扩展性方面均表现出色。
MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines
MTIA 300:Meta 首款内置网卡和通信卸载引擎的训练芯片
Meta 介绍了 MTIA 300 训练芯片,这是 Meta 首款内置网络接口卡(NIC)和通信卸载引擎的 AI 训练芯片。该设计大幅减少了 AI 训练集群中的通信开销,提升了大规模分布式训练的整体效率。
How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees
如何在 WhatsApp 上构建端到端加密且可验证的诈骗警报系统
Meta 详细介绍了在 WhatsApp 上构建诈骗警报系统(Scam Alert)的技术方案。该系统在端到端加密的保护下运行,同时提供可验证性保证,确保用户能够可靠地识别和防范诈骗信息,而不牺牲隐私安全。
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
Meta 分享了其广告排序系统的多阶段架构设计。该系统从用户行为序列出发,结合缩放定律(scaling laws)优化各阶段模型,实现了从粗筛到精排的完整广告推荐流程,显著提升了广告点击率和转化率。
Towards Data Science
10 Things I’m Learning Beyond AI to Become More Technologically Fluent
成为技术通才:AI 之外的 10 项学习
Rashi Desai 分享了在 AI 技术之外提升技术素养的 10 个关键领域。文章涵盖了云计算、网络安全、DevOps、系统设计等方面,为希望全面理解技术生态的 AI 从业者提供了学习路线图。
Your Model’s MSE Is Lying to You: Part II
你的模型 MSE 在欺骗你:第二部分
Waleed Esmail 继续探讨均方误差(MSE)作为评估指标的局限性。本文深入分析了 MSE 在不同数据分布和异常值场景下的误导性,并提供了更全面的模型评估替代方案。
RAG Isn’t an Agent — I Built the Layer Between Retrieval and Action
RAG 不是代理——我构建了检索与行动之间的层
Emmimal P Alexander 阐述了检索增强生成(RAG)与 AI 代理之间的本质区别,并介绍了自己构建的介于检索和行动之间的中间层。该层负责将检索结果转化为可执行的行动计划,使系统真正具备代理能力。
Jev vs. LLMs: When AI Moves from Generation to Decision-Making
Jev 与 LLM:当 AI 从生成走向决策
Nhu Hoang 探讨了 Jev 模型与 LLM 在决策能力上的差异。文章指出,AI 正在从内容生成向决策制定转变,而 Jev 等新型架构在这一转变中展现出独特优势,代表了 AI 发展的新方向。
How to Maximize Your Coding Agent Subscriptions
如何最大化你的编程代理订阅价值
Eivind Kjosbakken 提供了最大化编程 AI 代理订阅投资回报的实用指南。文章涵盖了工具选择、提示工程、工作流整合和效果评估等方面,帮助开发者和团队充分利用编程代理的能力。
Beyond RAGs: Building Actually Truthful AI Harnesses
超越 RAG:构建真正诚实的 AI 系统
Ari Joury 博士探讨了如何构建真正诚实的 AI 系统,超越传统 RAG 方案的局限。文章提出了”AI harness”的概念,通过多层验证和不确定性量化,使 AI 系统能够在不确定时承认无知,而非编造答案。
Towards Spec-Driven Test Automation: Part 1
迈向规格驱动的测试自动化:第一部分
Gal Arav 开启了规格驱动测试自动化的系列文章。本文介绍了基于形式化规格说明自动生成测试用例的方法论,为提升软件测试的效率和覆盖率提供了新的思路。
When the Correct Answer Is Nothing, What Does Your Pipeline Return?
当正确答案为空时,你的管道返回什么?
Hubert García Gordon 探讨了数据处理管道在正确答案为空时的行为问题。文章分析了空值处理的最佳实践,包括默认值策略、异常处理和结果验证等方面,帮助开发者构建更健壮的数据管道。
I Trained a Tiny Network to Compress Data. It Drew a Pentagon.
我训练了一个小型网络来压缩数据。它画了一个五边形。
Utkarsh Mangal 分享了一个有趣的实验:训练一个极小的神经网络进行数据压缩,结果发现网络在压缩过程中自发”画”出了一个五边形。这一发现揭示了神经网络在压缩过程中可能学到的内在几何结构。
From Words to Vectors: What Happens in Between?
从词语到向量:中间发生了什么?
Nikhil Dasari 深入探讨了自然语言处理中从词语到向量表示的转换过程。文章详细解释了词嵌入、上下文编码和向量空间中的语义关系,帮助读者理解语言模型内部的工作原理。