2026-09-27
今日要点
- Google DeepMind 发布 Gemini 3.8 系列模型,包括支持实时虚拟形象、文本转语音、Flash 版本及网络安全专用版本,同时推出 AlphaGenome Atlas 基因组预测图谱和 WeatherNext 3 天气模型。
- Anthropic 宣布 Claude 发现新型酶系统,并推出生命科学验证计划,同时发布 Claude 文本水印技术,强化 AI 安全与科学应用。
- Meta 工程团队披露多项重大进展,包括全球首条拍比特级跨洋海底光缆 Petal、首款内置 NIC 的 MTIA 300 训练芯片,以及 Meta AI 眼镜的本地隐私处理技术。
- OpenAI 扩展 GPT-6 Astra 应用,Airbnb、Harvey 法律科技和 invideo 等平台接入前沿模型,ChatGPT 广告业务扩展至东南亚及台湾。
- Facebook 剑桥分析案陪审团裁定其欺骗用户责任成立,同时银行与信用合作社联合对抗 Apple Pay 费用,Automattic 董事会经历动荡后重组。
Hacker News
Breaking Up with Google Play: Why Conversations Is Now Free
与 Google Play 分手:为什么 Conversations 现在免费了
本文作者详细阐述了其应用 Conversations 从 Google Play 商店独立出来的原因。Google Play 的付费政策和分成机制对开发者构成了越来越大的负担,尤其是在开源和隐私优先的应用领域。作者认为,摆脱 Google Play 的束缚后,应用可以完全免费提供给用户,同时保留开源和隐私保护的核心价值。这一决定反映了越来越多开发者对大型应用商店生态的反思,以及对直接分发模式的重新评估。
Jury finds Facebook liable for deceiving users in Cambridge Analytica case
陪审团裁定 Facebook 在剑桥分析案中欺骗用户负有责任
美国陪审团在剑桥分析(Cambridge Analytica)数据丑闻相关诉讼中裁定,Facebook 存在欺骗用户的行为,需承担相应法律责任。该案源于 2018 年曝光的剑桥分析公司通过不正当手段获取数千万 Facebook 用户数据的丑闻。陪审团的裁定意味着 Facebook 在用户数据保护和透明度方面存在系统性过失,可能面临巨额赔偿。此案被视为科技巨头数据隐私问题的标志性判例,对社交媒体平台的数据实践将产生深远影响。
I’m the mom in that viral Giants clip. Let me tell you about my husband
我是那段巨人队病毒视频中的妈妈,让我讲讲我丈夫的故事
一位母亲在社交媒体上因一段纽约巨人队比赛的视频而走红,视频中她激动地庆祝丈夫的成就。这篇文章深入讲述了她丈夫的故事——一位在职业体育背后默默支持的普通人。作者通过个人叙事探讨了体育文化中的家庭支持角色,以及社交媒体时代普通人如何意外成为公众关注的焦点。文章温暖而真实,展现了体育精神与家庭情感的交织。
We’re gonna need a lot more mathematicians
我们需要更多的数学家
著名数学家陶哲轩(Terence Tao)发表文章,呼吁社会重视数学人才的培养。他指出,随着人工智能、数据科学和量子计算等领域的快速发展,社会对数学人才的需求正在急剧增长。然而,当前数学教育和人才培养体系远远跟不上这一需求。陶哲轩强调,数学不仅是科学研究的基础工具,更是培养逻辑思维和解决问题能力的关键,社会需要从基础教育到高等研究的各个层面加大对数学的投入。
Fifteen years later, the Apple Cards origin story
十五年后,回顾 Apple Card 的诞生故事
这篇文章回顾了 Apple Card 信用卡项目从构想到推出的完整历程。自 2019 年发布以来,Apple Card 一直是苹果在金融服务领域的重要尝试。文章深入探讨了项目背后的设计哲学、与高盛的合作关系、以及苹果如何在竞争激烈的支付市场中打造差异化产品。十五年后回望,Apple Card 不仅改变了用户对信用卡的体验预期,也为苹果生态的金融服务布局奠定了基础。
What even is an OS now?
现在的操作系统到底是什么?
这篇文章对”操作系统”这一概念在当代技术环境中的定义提出了深刻质疑。随着云计算、容器化、Web 应用和边缘计算的普及,传统操作系统的边界正在模糊。作者指出,现代软件栈中,操作系统不再是唯一的资源管理者和抽象层,而是被分解为多个层次——从内核到容器运行时,再到沙箱环境和浏览器。文章引发读者思考:在 AI 驱动和云原生的时代,操作系统的核心使命是否正在被重新定义?
One Piece of Flock Camera Data Put This Innocent Woman in Jail for 13 Days
一段 Flock 摄像头数据让这位无辜女子被关押 13 天
这篇文章揭露了 Flock 安防摄像头系统在执法中的严重问题。一名无辜女性仅因一段模糊的 Flock 摄像头录像数据就被错误指控并关押 13 天。Flock 是一家与地方警方合作的私人安防摄像头公司,其密集部署的摄像头网络引发了关于隐私、误判和执法依赖私人监控数据的广泛争议。文章呼吁对这类私人监控技术与执法系统的结合进行更严格的监管和审查。
One Month Without AI
一个月没有 AI
作者记录了自己尝试一个月完全不使用 AI 工具的生活体验。在 AI 已经深度融入日常工作和生活的 2026 年,这一实验颇具意义。作者描述了在写作、编程、信息检索等场景中逐步摆脱 AI 辅助的过程,以及由此带来的认知变化——从最初的不适应到逐渐恢复独立思考和深度工作的能力。文章并非反对 AI,而是提醒人们在享受 AI 便利的同时,保持对人类自身认知能力的关注和培养。
Floci: Locally emulating any cloud service
Floci:在本地模拟任何云服务
Floci 是一个开源工具,允许开发者在本地环境中模拟各种云服务,无需连接真实的云提供商。这一工具对于希望在不产生费用或依赖外部服务的情况下进行开发和测试的开发者来说非常有价值。Floci 支持模拟常见的云 API,如存储、计算和数据库服务,为本地开发、CI/CD 测试和离线工作提供了灵活的解决方案。
Plunging test scores are a slow-moving catastrophe
考试成绩的持续下滑是一场缓慢移动的灾难
《经济学人》发表社论,警示全球学生考试成绩持续下滑的严重性。文章指出,近年来多个国家和国际评估项目中,学生的阅读、数学和科学成绩均出现显著下降,这一趋势被称为”缓慢移动的灾难”。作者分析认为,疫情后的学习中断、教育资源的分配不均、以及数字化教学的不充分适应都是重要原因。文章呼吁教育政策制定者和社会各界高度重视这一问题,采取系统性措施加以应对。
A single function Jev-like wrapper for LLMs, including vision models
一个类似 Jev 的 LLM 单函数封装,支持包括视觉模型在内的多种模型
这篇文章介绍了一种简洁的封装方案,为大型语言模型(包括多模态视觉模型)提供了一个统一的单函数接口。借鉴了 Jev 库的设计理念,该封装使得开发者可以用一致的 API 调用不同类型的 AI 模型,无需为每个模型编写不同的适配代码。这对于希望快速原型开发和切换模型的团队来说非常实用,降低了多模型集成的复杂度。
Is your Postgres migration safe or not safe?
你的 Postgres 迁移安全吗?
safenotsafe.dev 是一个实用的工具网站,帮助开发者评估 PostgreSQL 数据库迁移的安全性。该工具通过分析迁移脚本、 schema 变更和数据操作,识别潜在的风险点,如数据类型不兼容、索引丢失、约束冲突等问题。对于计划进行数据库迁移的开发者来说,这是一个非常有价值的参考工具,可以帮助避免迁移过程中常见的陷阱和数据丢失风险。
How to keep enjoying programming in a world of LLMs
在 LLM 时代如何继续享受编程
这篇文章探讨了在大型语言模型日益强大的背景下,程序员如何保持对编程的热爱和热情。作者认为,LLM 虽然能够完成大量代码生成工作,但编程的核心价值——问题解决、系统设计和创造性思维——依然不可替代。文章建议开发者将 LLM 视为工具而非替代者,专注于提升高层次的架构能力和创新思维,同时保持对技术本质的好奇心和探索欲。
Automattic has a new board after failed attempt to put CEO on leave
Automattic 董事会重组,CEO 停职尝试失败后
WordPress 母公司 Automattic 经历了董事会动荡后,迎来了新的董事会成员。此前,部分股东试图将 CEO 停职,但这一尝试最终失败。文章详细描述了这场公司治理危机的前因后果,包括股东之间的分歧、对战略方向的不同看法,以及最终达成的妥协方案。这一事件反映了远程工作模式下的科技公司在公司治理方面面临的独特挑战。
Banks and Credit Unions to Team Up Against Apple Pay Fees
银行与信用合作社联手对抗 Apple Pay 费用
多家美国银行和信用合作社计划联合起来,对抗 Apple Pay 收取的交易费用。这一联合行动反映了传统金融机构对科技巨头在支付领域不断扩大的影响力的担忧。银行方面认为,Apple Pay 的费用结构不公平,正在侵蚀其利润空间。此次联合可能推动监管层面的审查,也可能促使 Apple 重新考虑其支付业务的收费策略。
OpenAI Blog
Proaction boosts sales 60% and saves 75+ hours with Codex
Proaction 利用 Codex 实现销售额增长 60%,节省 75 多小时
OpenAI 发布案例研究,展示科技公司 Proaction 如何利用 Codex 显著提升业务效率。通过集成 Codex 到开发流程中,Proaction 实现了销售额 60% 的增长,同时为团队节省了超过 75 小时的工作时间。文章详细介绍了 Proaction 如何将 Codex 应用于代码生成、调试和文档编写等场景,以及这一工具如何改变了团队的开发节奏和产品质量。
Two years of OpenAI Academy
OpenAI 学院两周年
OpenAI 庆祝其 Academy 项目成立两周年。自推出以来,OpenAI Academy 已为全球数十万学习者提供了免费的 AI 教育课程,涵盖从基础概念到高级应用的各个层次。文章回顾了 Academy 的发展历程,包括课程内容的持续更新、学习者的反馈和改进,以及 OpenAI 对未来 AI 教育的愿景。该项目体现了 OpenAI 推动 AI 知识普及和负责任使用的承诺。
OpenAI extends cyber access to Ukraine for civilian defense
OpenAI 向乌克兰扩展网络访问权限以支持民用防御
OpenAI 宣布向乌克兰提供其 AI 工具的网络访问权限,用于民用防御目的。这一举措旨在帮助乌克兰的技术团队和民间组织利用 OpenAI 的技术增强网络安全能力,应对持续的网络威胁。文章强调,这一决定基于人道主义考虑,旨在支持受冲突影响地区的民用防御需求,同时确保技术的使用符合安全和伦理准则。
Sam Altman’s remarks at the United Nations Security Council
Sam Altman 在联合国安理会的讲话
OpenAI 首席执行官 Sam Altman 在联合国安理会发表讲话,探讨人工智能对全球安全的影响。Altman 强调了 AI 技术在国防、网络安全和危机应对中的潜力,同时也指出了潜在的风险和挑战。他呼吁国际社会加强合作,建立 AI 治理的国际框架,确保技术发展服务于全人类的福祉。此次讲话标志着 AI 治理议题正式进入联合国最高安全决策层面。
Harvey turns legal context into stronger drafts with GPT-6 Astra
Harvey 利用 GPT-6 Astra 将法律上下文转化为更强有力的草案
法律科技平台 Harvey 宣布集成 OpenAI 的 GPT-6 Astra 模型,以提升法律文档起草的质量。通过深入理解法律上下文和判例,GPT-6 Astra 能够帮助律师生成更加精准和有力的法律文件。文章介绍了 Harvey 与 OpenAI 的合作细节,以及这一技术如何改变法律行业的文档工作流程,提高律师的工作效率和文档质量。
How invideo improves color grading 3x with GPT-6 Astra
invideo 如何利用 GPT-6 Astra 将调色效率提升 3 倍
视频制作平台 invideo 宣布利用 GPT-6 Astra 模型将视频调色效率提升了三倍。通过 AI 驱动的自动调色功能,创作者可以快速获得专业级别的色彩效果,无需手动调整每一个参数。文章详细介绍了 invideo 的技术实现方案,以及 GPT-6 Astra 在多模态理解方面的优势如何赋能视频创作流程。
Ringg’s AI agents resolve up to 65% of customer calls with OpenAI
Ringg 的 AI 代理利用 OpenAI 技术解决高达 65% 的客户来电
客户服务热线平台 Ringg 宣布,其 AI 代理系统利用 OpenAI 的技术成功解决了高达 65% 的客户来电。这一成果显著降低了人工客服的工作负担,同时提升了客户满意度。文章介绍了 Ringg 的技术架构和训练方法,以及 AI 代理在处理复杂客户咨询方面的能力边界和持续改进方向。
Introducing MentalHealthBench
推出 MentalHealthBench
OpenAI 发布了 MentalHealthBench,这是一个专门用于评估 AI 模型在心理健康领域表现的综合基准测试。该基准涵盖了心理咨询、情绪识别、危机干预等多个维度,旨在推动 AI 在心理健康服务中的安全有效应用。文章详细介绍了 MentalHealthBench 的设计原则、评估方法和初步结果,强调了在心理健康领域使用 AI 时需要特别关注的安全性和伦理考量。
ChatGPT Ads expands to Southeast Asia and Taiwan
ChatGPT 广告业务扩展至东南亚及台湾
OpenAI 宣布 ChatGPT 广告平台正式扩展至东南亚和台湾地区。这一扩展标志着 OpenAI 在商业化道路上的重要一步,使其广告网络覆盖更多国际市场。文章介绍了 ChatGPT 广告的投放机制、目标受众定位方式,以及广告主如何利用这一平台触达 AI 用户群体。此次扩展也反映了东南亚和台湾市场对 AI 技术的日益增长的需求。
Airbnb widens access to GPT-6 Astra and OpenAI frontier models
Airbnb 扩大 GPT-6 Astra 及 OpenAI 前沿模型的访问范围
Airbnb 宣布将其 GPT-6 Astra 和 OpenAI 前沿模型的访问范围扩大到更多内部团队和产品线。这一扩展将使 Airbnb 能够在搜索优化、客户服务、内容生成等多个业务场景中更深入地应用 AI 技术。文章介绍了 Airbnb 的 AI 战略蓝图,以及前沿模型如何帮助平台提升用户体验和运营效率。
Anthropic Blog
Claude discovers a novel enzyme system with CRISPR-like repeats
Claude 发现具有 CRISPR 样重复序列的新型酶系统
Anthropic 宣布其 AI 系统 Claude 在生物学研究中取得了突破性发现——识别出一种具有 CRISPR 样重复序列的新型酶系统。这一发现由 Claude 在分析大量基因组数据时完成,为基因编辑技术和分子生物学研究提供了新的工具候选。Anthropic 强调,这一发现体现了 AI 在科学探索中的巨大潜力,同时也展示了负责任的 AI 研究框架的重要性。
Partnering with Accenture on embedded evaluation
与埃森哲合作开展嵌入式评估
Anthropic 宣布与全球咨询公司埃森哲(Accenture)建立合作伙伴关系,共同开发嵌入式 AI 评估方案。该方案将 Anthropic 的安全评估方法论集成到企业客户的 AI 部署流程中,帮助组织在开发和使用 AI 系统时持续监测安全性和可靠性。这一合作标志着 Anthropic 在推动企业级 AI 安全标准方面的又一重要进展。
Introducing the Life Sciences Verification Program
推出生命科学验证计划
Anthropic 推出了生命科学验证计划(Life Sciences Verification Program),旨在为使用 Claude 进行生命科学研究的机构和研究人员提供安全验证和合规支持。该计划包括严格的访问控制、使用审计和研究伦理审查,确保 AI 工具在敏感的生命科学研究中得到负责任的使用。这一计划反映了 Anthropic 对 AI 在生物安全领域应用的审慎态度。
Developing Enterprise Frontier Safeguards with our customers
与客户共同开发企业前沿安全护栏
Anthropic 分享了与客户合作开发企业级前沿 AI 安全护栏的经验和方法。文章详细介绍了 Anthropic 如何与早期客户共同设计和测试安全机制,包括内容过滤、使用限制和异常检测等功能。这些安全护栏旨在帮助企业在享受前沿 AI 模型强大能力的同时,有效控制潜在风险。这一协作模式体现了 Anthropic”共同构建更安全 AI”的理念。
Improving our alignment and security efforts
改进对齐与安全努力
Anthropic 发布了其在 AI 对齐和安全研究方面的最新进展报告。文章概述了团队在可解释性研究、红队测试、和对抗性评估等方面的新成果,以及这些工作如何帮助提升 Claude 系统的安全性和可靠性。Anthropic 强调,AI 安全是一个持续演进的过程,需要不断投入研究和改进,以应对日益复杂的挑战。
Previewing the Model Hardware Standard
预览模型硬件标准
Anthropic 发布了模型硬件标准(Model Hardware Standard)的预览版本,旨在为 AI 模型的硬件部署提供统一的安全和性能规范。该标准涵盖了从芯片设计到系统集成的各个环节,确保 AI 模型在不同硬件平台上的一致性和安全性。文章详细介绍了标准的核心要求、测试方法和认证流程,以及 Anthropic 与硬件合作伙伴的协作计划。
Expanding our support for scientists
扩大对科学家的支持
Anthropic 宣布扩大对科学研究人员的支持计划,包括提供更多 Claude API 额度、建立科学家咨询委员会,以及资助独立的 AI 安全研究项目。这一扩展旨在促进 AI 技术在科学研究中的负责任应用,同时收集科学家群体的反馈以改进产品。Anthropic 认为,与科学界的紧密合作是推动 AI 安全研究的重要路径。
Funding better evaluations of AI’s impact on wellbeing
资助评估 AI 对幸福感影响的更好方案
Anthropic 宣布设立专项基金,用于资助评估 AI 技术对人类幸福感和心理健康影响的独立研究。该基金支持学术界和研究机构开展长期追踪研究,探索 AI 使用与社会福祉之间的关系。文章强调,Anthropic 认为在追求技术进步的同时,必须系统性地评估 AI 对社会和个体层面的影响,以确保技术发展真正造福人类。
How Claude’s text watermark works
Claude 文本水印的工作原理
Anthropic 详细介绍了 Claude 文本水印技术的工作原理。该技术通过在模型输出中嵌入不可见的标记,帮助识别由 AI 生成的文本内容。文章解释了水印的编码方式、嵌入机制和检测算法,以及这一技术如何在保护知识产权和促进内容透明度之间取得平衡。Anthropic 强调,水印技术是 AI 内容治理的重要组成部分,将在未来发挥越来越重要的作用。
Improving Fable 5’s biology safeguards
改进 Fable 5 的生物学安全护栏
Anthropic 发布了关于改进 Fable 5 模型生物学安全护栏的更新。Fable 是 Anthropic 用于研究 AI 系统行为的实验性模型系列,此次更新增强了模型在处理生物学相关请求时的安全限制,包括对敏感生物实验信息的过滤和警告机制。文章强调了在推进 AI 能力发展的同时,持续加强安全护栏的重要性,特别是在涉及生物安全的敏感领域。
Google AI Blog
Google Beam expands with new regions, partners, and customers
Google Beam 扩展至新地区、合作伙伴和客户
Google 宣布其 Beam 平台(用于 AI 模型部署和推理的基础设施服务)扩展至新的地理区域,并新增了多家合作伙伴和客户。此次扩展将 Beam 的覆盖范围延伸至欧洲和亚太地区,为更多开发者提供低延迟的 AI 推理服务。文章介绍了 Beam 的技术架构优势,以及新合作伙伴如何利用该平台加速 AI 应用的部署和规模化。
New experts join Google’s AI & Economy team
新专家加入 Google AI 与经济团队
Google 宣布多名新专家加入其 AI 与经济研究团队,该团队致力于研究 AI 技术对全球经济的影响。新成员来自经济学、社会学和政策研究等领域,将为团队带来多元化的研究视角。文章介绍了团队近期的研究方向,包括 AI 对劳动力市场的影响、生产力增长趋势,以及政策制定者如何应对 AI 带来的经济变革。
Co-creating the future of fashion with Google
与 Google 共同创造时尚的未来
Google 发布了一篇关于 AI 与时尚产业融合的文章,介绍了如何利用 AI 技术推动时尚设计的创新。文章展示了 Google 与多家时尚品牌合作的项目,包括 AI 辅助设计、个性化推荐和可持续时尚等方向。通过这些合作,Google 希望帮助时尚产业在保持创意的同时,利用 AI 提升效率和可持续性。
Making global data easier to explore
让全球数据更易探索
Google 推出了联合国数据commons平台的新功能,使全球发展数据更加易于探索和可视化。该平台整合了来自联合国各机构的数千个数据集,涵盖贫困、教育、健康、气候变化等多个领域。文章介绍了新功能的交互设计和分析工具,以及研究人员和政策制定者如何利用这些数据进行更深入的分析。
AI for Societal Impact
面向社会影响的 AI
Google 发布了关于 AI 社会影响的综合报告,展示了 Google AI 研究在医疗、教育、环境和灾害响应等领域的应用成果。报告强调,Google 致力于将 AI 技术应用于解决全球性挑战,同时确保技术的负责任使用。文章详细介绍了多个成功案例,包括 AI 辅助疾病诊断、个性化学习系统和气候预测模型等。
Building AI to accelerate science and improve lives
构建 AI 以加速科学研究和改善生活
Google 高管 James Manyika 发表文章,阐述 Google 在 AI 科学研究领域的战略方向。文章强调,Google 正致力于构建能够加速科学发现的 AI 系统,从蛋白质折叠到气候建模,AI 正在改变科学研究的方式。同时,Google 也关注如何将 AI 技术转化为改善普通人生活的实际应用,确保技术进步惠及更广泛的人群。
AI for everyone in every language
让每个人都能用每种语言使用 AI
Google 发布了关于 AI 多语言能力的最新进展,强调其致力于让全球每种语言的用户都能平等地享受 AI 技术带来的便利。文章介绍了 Google 在多语言模型训练、低资源语言支持和翻译技术方面的突破,以及这些技术如何帮助打破语言壁垒,促进全球知识共享。Google 表示,语言多样性是 AI 发展的重要方向。
New insights from Google’s AI & Economy ATLAS
Google AI 与经济 ATLAS 的新见解
Google 发布了 AI 与经济 ATLAS 平台的最新数据和分析洞察。ATLAS 是一个交互式数据平台,提供 AI 投资、采用和影响的全球数据可视化。最新一期报告揭示了 AI 投资在不同行业和地区的分布趋势,以及 AI 采用对企业生产力和就业结构的实际影响。数据表明,AI 的经济影响正在加速,但不同地区和行业之间存在显著差异。
Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery
观看宇航员 Christina Koch 与 Google 的 James Manyika 探讨太空、技术与发现
Google 发布了一段对话视频,邀请宇航员 Christina Koch 与 Google 高管 James Manyika 探讨太空探索、技术进步和科学发现的主题。Koch 分享了她在国际空间站的工作经历,以及 AI 和自动化技术如何改变太空探索的方式。对话还涉及了人类探索未知的精神、技术发展的伦理考量,以及未来太空任务的可能性。
DevFest is back
DevFest 回归
Google 宣布 DevFest 开发者大会将于 2026 年回归,这是 Google 全球最大的开发者社区活动之一。今年的 DevFest 将聚焦 AI 开发、云技术和移动应用等主题,预计将在全球数十个城市举办线上线下结合的活动。文章介绍了活动的亮点议程、演讲嘉宾阵容,以及开发者如何参与和贡献这一年度盛会。
Hugging Face Blog
Accelerating vision-language models with LFM2.5-VL-DSpark
利用 LFM2.5-VL-DSpark 加速视觉语言模型
LiquidAI 团队发布了 LFM2.5-VL-DSpark,一种用于加速视觉语言模型推理的新方法。该技术通过优化模型架构和推理流程,显著提升了多模态模型的处理速度,同时保持了高质量的输出效果。文章详细介绍了技术的核心创新点,包括动态稀疏激活和硬件感知的优化策略,以及在实际应用中的性能表现。
How to Use NVIDIA Warp and MjWarp to Accelerate Robotics Simulation and Learning Workflows
如何使用 NVIDIA Warp 和 MjWarp 加速机器人仿真和学习工作流
NVIDIA 发布了关于如何使用 Warp 和 MjWarp 框架加速机器人仿真和强化学习工作流的详细指南。Warp 是一个 Python 原生的高性能仿真框架,而 MjWarp 则是针对 MuJoCo 物理引擎的 Warp 实现。文章通过实际代码示例,展示了如何利用这些工具将机器人仿真的速度提升数个数量级,从而加速 AI 训练和算法开发。
How UK AISI and EvalEval Are Making Benchmark Results Reproducible
UK AISI 和 EvalEval 如何让基准测试结果可复现
英国 AI 安全研究所(AISI)与 EvalEval 合作,推动 AI 基准测试结果的复现性。文章介绍了双方共同开发的评估框架和标准流程,确保不同研究团队可以在相同条件下复现基准测试结果。这一努力对于建立可信的 AI 安全评估体系至关重要,有助于消除因实现差异导致的评估结果不一致问题。
Transformers now runs llama.cpp quants
Transformers 现已支持 llama.cpp 量化模型
Hugging Face Transformers 库宣布原生支持 llama.cpp 的量化模型格式。这一集成使得用户可以直接在 Transformers 中加载和使用 llama.cpp 量化的模型,无需额外的转换步骤。文章介绍了集成的技术细节、性能优势,以及如何在实际项目中利用这一功能降低推理成本和内存占用。
Jun Kim, oMLX creator and maintainer, joins Hugging Face to support the MLX community
oMLX 创建者兼维护者 Jun Kim 加入 Hugging Face,支持 MLX 社区
Hugging Face 宣布 oMLX 的创建者和维护者 Jun Kim 正式加入公司,负责支持 MLX 社区的发展。MLX 是 Apple 推出的用于机器学习的高效框架,在 Apple Silicon 设备上表现优异。Jun Kim 的加入将加强 Hugging Face 与 MLX 生态的整合,为开发者提供更好的跨平台机器学习体验。
Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem
像物理学家一样剪枝 LLM:将块移除作为伊辛优化问题
Multiverse Computing CAI 团队发表了一篇将大语言模型剪枝问题类比为物理学中伊辛模型优化问题的研究论文。文章提出了一种新的剪枝方法,将模型权重的重要性评估转化为伊辛模型的基态搜索问题,利用量子退火和经典优化算法求解。实验结果表明,该方法在保持模型性能的同时,能够显著减少模型参数量。
tokenizers v1: encode, decode and scaling, measured
tokenizers v1:编码、解码与扩展性,实测
Hugging Face 发布了 tokenizers 库 v1 版本的详细性能报告,全面评估了其在编码、解码和扩展性方面的表现。文章提供了与主流 tokenizer 实现的性能对比数据,展示了 v1 版本在吞吐量、内存占用和延迟方面的优化成果。对于需要处理大规模文本数据的 AI 应用来说,这一更新提供了更高效的分词解决方案。
Your Agent Aced the Task. Will It Do It Again?
你的代理完成了任务。它还能再完成一次吗?
IBM 研究团队发表文章,探讨 AI 代理(Agent)在任务执行中的一致性和可靠性问题。文章指出,当前许多 AI 代理在基准测试中表现出色,但在重复执行相同任务时往往无法保持稳定的性能。研究团队提出了评估代理一致性的新方法,并探讨了导致性能波动的原因,包括随机性、上下文敏感性和训练数据偏差等因素。
Async GRPO with LoRA across HF Jobs: a bucket, a proxy, and no NCCL
跨 HF Jobs 的异步 GRPO 与 LoRA:一个桶、一个代理,无需 NCCL
Hugging Face 发布了一篇关于在分布式训练环境中实现异步 GRPO(广义回报优化)与 LoRA 微调的技术文章。该方法通过引入任务桶和代理机制,避免了传统 NCCL 通信的开销,显著提升了多 GPU 环境下的训练效率。文章详细介绍了系统架构、实现细节和性能测试结果,为大规模 AI 模型训练提供了新的技术路径。
Rebuilding AUTOMATIC1111 with Gradio Workflow
用 Gradio Workflow 重建 AUTOMATIC1111
Hugging Face 发布了一篇关于如何使用 Gradio Workflow 重建流行的 AUTOMATIC1111 Stable Diffusion WebUI 的技术指南。文章展示了如何利用 Gradio 的现代工作流功能,构建一个更加模块化、可扩展的 AI 图像生成界面。这一重建不仅提升了用户体验,也为其他 AI 应用的界面开发提供了参考模板。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
正交性之后:德性伦理代理与 AI 对齐
Peli Grietzer 发表文章,探讨在超越”正交性论题”之后,如何将德性伦理学应用于 AI 对齐研究。文章认为,传统的 AI 对齐方法过于关注目标函数的精确指定,而忽视了代理(agent)的品格和德性培养。作者提出,一个具有良好德性的 AI 代理更可能在未知情境中做出符合人类价值观的判断,这一视角为 AI 安全研究提供了新的理论框架。
AGI Is Not Multimodal
AGI 并非多模态
Benjamin A. Spiegel 撰文论证,通用人工智能(AGI)的实现并不依赖于多模态能力。文章指出,当前 AI 研究中存在一种将多模态能力与 AGI 混为一谈的倾向,但真正的 AGI 核心在于推理、规划和通用问题解决能力,而非仅仅能够处理多种数据类型。作者呼吁研究界更加关注 AGI 的本质特征,避免被多模态的表象所分散注意力。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中的角色变迁
Henry Kvinge 发表文章,探讨数学在机器学习研究中的角色如何随着时间演变。文章回顾了从早期统计方法到深度学习,再到当前几何和拓扑方法的应用历程,指出数学正在从提供分析工具转变为直接指导模型架构设计。作者认为,对称性和结构等数学概念正在成为理解和学习理论的核心语言。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺少什么:一种目标感
Kenneth Li 撰文探讨当前 LLM 聊天机器人在”目标感”方面的缺失。文章认为,尽管 LLM 在对话流畅性和知识广度上取得了显著进步,但它们缺乏真正的意图性和目的导向性。作者提出,赋予 AI 系统某种形式的目标感和内在动机,可能是通向更自然、更有意义的人机交互的关键一步。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要以幸福感为基础的 AI 积极愿景
Joel Lehman 发表文章,呼吁 AI 社区构建以人类幸福感和福祉为核心的积极愿景。文章批评了当前 AI discourse 中过度关注风险和控制问题的倾向,认为这可能导致对 AI 潜力的悲观看法。作者主张,AI 研究应该更加积极地探索如何提升人类生活质量、促进社会福祉,并将这些目标作为技术发展的指导原则。
Financial Market Applications of LLMs
LLM 在金融市场的应用
Richard Dewey 撰文综述了大型语言模型在金融市场中的各种应用场景。文章涵盖了从金融文本分析、风险评估到自动化交易策略生成等多个领域,分析了 LLM 如何改变金融行业的运作方式。同时,文章也指出了当前应用面临的挑战,包括数据质量、模型可解释性和监管合规等问题。
A Brief Overview of Gender Bias in AI
AI 性别偏见简要概述
Yennie Jun 发表文章,系统性地概述了 AI 系统中的性别偏见问题。文章从训练数据偏差、模型设计缺陷到实际应用中的不公平结果,全面分析了性别偏见在 AI 系统中的表现形式和成因。作者提出了多项缓解策略,包括多样化数据集构建、偏见检测工具和包容性设计原则,呼吁整个行业共同努力解决这一问题。
Mamba Explained
Mamba 原理解析
Kola Ayonrinde 发表文章,对 Mamba 架构进行了深入浅出的原理解析。Mamba 是一种新兴的序列建模架构,以其高效的长序列处理能力受到关注。文章详细解释了 Mamba 的核心组件,包括状态空间模型(SSM)、选择性扫描机制和硬件感知的并行算法,帮助读者理解其为何能够在保持线性复杂度的同时处理长序列。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终让自动驾驶汽车成为现实?
Jérémy Cohen 撰文探讨大型语言模型是否有可能成为实现自动驾驶汽车的关键技术。文章分析了当前自动驾驶技术面临的挑战,包括长尾场景处理、复杂决策制定和系统可解释性等问题,并探讨了 LLM 在这些问题上的潜在应用价值。作者认为,虽然 LLM alone 可能不足以实现完全自动驾驶,但它们可以作为重要补充,加速自动驾驶技术的发展。
Do text embeddings perfectly encode text?
文本嵌入是否完美编码了文本?
Jack Morris 发表文章,探讨文本嵌入(text embeddings)是否能够在理论上完美编码文本信息。文章从信息论和表示学习的角度分析了嵌入空间的表达能力,指出当前嵌入模型在压缩信息和保留语义细节之间存在着固有的权衡。研究结果为理解嵌入模型的局限性提供了理论框架,对改进嵌入方法具有指导意义。
DeepMind Blog
Introducing Gemini 3.8 Live with Live Avatar
推出带实时虚拟形象的 Gemini 3.8 Live
DeepMind 发布了 Gemini 3.8 Live,这是 Gemini 系列的全新实时交互版本,支持实时虚拟形象(Live Avatar)功能。用户可以通过虚拟形象与 Gemini 进行更加自然和沉浸式的对话体验。文章介绍了 Live Avatar 的技术实现,包括实时渲染、表情同步和语音驱动动画等关键技术,以及这一功能在客户服务、教育和娱乐等领域的应用前景。
Advancing Private AI Compute with secure, server-side memory
通过安全的服务器端内存推进私有 AI 计算
DeepMind 发布了关于安全服务器端内存技术在私有 AI 计算中应用的研究成果。该技术通过在服务器端提供加密的内存环境,确保 AI 模型在处理敏感数据时的隐私和安全。文章详细介绍了技术架构、安全保证和性能优化策略,以及其在金融、医疗等对数据隐私要求极高的行业中的应用潜力。
Gemini 3.8 text-to-speech says hello
Gemini 3.8 文本转语音问世
DeepMind 发布了 Gemini 3.8 的文本转语音(TTS)功能,能够生成高度自然和富有表现力的人类语音。该 TTS 系统支持多种语言和情感风格,可以适应不同的应用场景需求。文章介绍了 TTS 模型的技术特点,包括语音质量、延迟表现和多语言支持能力,以及 DeepMind 在语音合成领域的研究进展。
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
推出 Gemini 3.8 Live 和 3.8 Live 扩展思维
DeepMind 同时发布了 Gemini 3.8 Live 和扩展思维版本(Extended Thinking)。扩展思维功能允许模型在回答复杂问题时进行更深层次的推理和思考,生成更加全面和准确的回答。文章详细介绍了扩展思维的工作原理、适用场景和性能表现,以及这一功能如何提升 Gemini 在专业领域的应用价值。
AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome
AlphaGenome Atlas:人类基因组中每种可能的 DNA 碱基变化的预测图谱
DeepMind 发布了 AlphaGenome Atlas,这是一个覆盖人类基因组中所有可能单碱基变化的预测图谱。该图谱利用 AlphaFold 系列技术,预测每种 DNA 碱基变化对基因功能和蛋白质结构的影响。这一资源将为遗传学研究、疾病诊断和个性化医疗提供前所未有的数据支持,是计算生物学领域的重要里程碑。
Introducing WeatherNext 3, our most advanced and accurate global weather AI model
推出 WeatherNext 3,我们最先进、最准确的全球天气 AI 模型
DeepMind 发布了 WeatherNext 3,这是其最新一代全球天气预测 AI 模型。该模型在预测精度和计算效率方面均达到了新的高度,能够提供更准确的中长期天气预报。文章介绍了 WeatherNext 3 的技术架构、训练数据和性能评估结果,以及其在农业、航空、灾害预警等领域的应用价值。
Proactive cyber defense for governments and enterprises
为政府和企业提供主动网络防御
DeepMind 发布了面向政府和企业客户的主动网络防御解决方案。该方案利用 AI 技术实时监测和预测网络威胁,在攻击发生前采取防御措施。文章介绍了方案的技术原理、部署方式和实际效果,以及 DeepMind 在 AI 网络安全领域的研究积累和应用经验。
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber
推出 Gemini 3.8 Flash 和 3.8 Flash Cyber
DeepMind 发布了 Gemini 3.8 的 Flash 版本,包括通用版和网络安全专用版。Flash 版本在保持高性能的同时,显著降低了推理成本和延迟,使其更适合大规模部署和实时应用。网络安全专用版则针对安全分析和威胁检测进行了专门优化。文章详细介绍了两个版本的技术特点、性能指标和适用场景。
Introducing agentic video understanding with Gemini
推出 Gemini 的代理式视频理解
DeepMind 发布了基于 Gemini 的代理式视频理解能力,使 AI 系统能够像人类一样主动探索和理解视频内容。与传统视频分析不同,代理式理解允许 AI 提出疑问、聚焦关键帧和进行多轮推理,从而获得更深入的视频内容理解。文章介绍了这一能力的技术实现和在视频搜索、内容审核和教育等领域的应用前景。
Gemini Omni 1.1 Flash lets you build with more control
Gemini Omni 1.1 Flash 让你拥有更多构建控制力
DeepMind 发布了 Gemini Omni 1.1 Flash 模型,为开发者提供了更精细的控制能力。该版本支持更细粒度的参数调节、自定义推理策略和增强的可解释性功能,使开发者能够更好地控制 AI 系统的行为。文章详细介绍了新增的控制功能、API 改进和实际开发案例,帮助开发者充分利用这一版本的能力。
Meta Engineering
Bringing Private Processing to Meta AI Glasses
为 Meta AI 眼镜带来隐私处理技术
Meta 工程团队发布了关于在 Meta AI 眼镜中实现本地隐私处理技术的文章。该技术使得眼镜能够在设备端完成语音识别、图像分析等 AI 处理任务,无需将数据上传至云端,从而保护用户的隐私。文章介绍了本地 AI 模型优化、硬件加速和隐私保护机制的技术细节,以及这一创新对可穿戴 AI 设备发展的意义。
Open-Sourcing Rebalancer: A Generic, High-Performance Library for Solving Assignment Problems
开源 Rebalancer:用于求解分配问题的高性能通用库
Meta 开源了 Rebalancer 库,这是一个用于求解分配问题的高性能通用工具。分配问题是运筹学中的经典问题,广泛应用于资源调度、任务分配和物流优化等场景。Rebalancer 采用了先进的算法实现,在大规模问题上表现出色。文章介绍了库的设计哲学、API 接口和实际应用场景,以及开源这一工具对社区的价值。
Inside Petal: Building the World’s First Petabit-Class Transoceanic Subsea Cable
深入 Petal:建造全球首条拍比特级跨洋海底光缆
Meta 发布了关于 Petal 海底光缆项目的技术文章,详细介绍了全球首条拍比特级跨洋海底光缆的设计和建造过程。Petal 光缆采用了最新的光纤技术和信号处理算法,实现了前所未有的数据传输容量。文章涵盖了光缆的工程挑战、技术创新和部署策略,以及这一基础设施对全球 AI 和数据流动的重要意义。
ZGateway: Learnings from Putting a Proxy in Front of ZippyDB
ZGateway:在 ZippyDB 前放置代理的经验总结
Meta 工程团队分享了在 ZippyDB 数据库前部署 ZGateway 代理的经验。ZGateway 作为统一入口,提供了请求路由、负载均衡、缓存和监控等功能,显著提升了 ZippyDB 的性能和可管理性。文章详细介绍了 ZGateway 的架构设计、关键挑战和解决方案,以及在实际生产环境中的性能表现和运维经验。
An Organizational Second Brain: Building an AI That Learns From Experts
组织第二大脑:构建从专家学习的 AI
Meta 发布了关于”组织第二大脑”项目的文章,介绍了一种能够从组织内部专家知识中学习的 AI 系统。该系统通过捕捉专家的工作流程、决策模式和知识积累,构建了一个可查询和可学习的组织知识库。文章介绍了系统的技术架构、知识提取方法和实际应用效果,以及这一工具如何帮助组织提升知识传承和决策效率。
MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet
MetaRoCE:为 AI 规模以太网构建的新型 RDMA 传输协议
Meta 发布了 MetaRoCE,这是一种专为 AI 训练规模设计的新型 RDMA over Converged Ethernet 传输协议。该协议针对大规模 AI 集群的网络需求进行了优化,提供了更高的带宽利用率和更低的通信延迟。文章详细介绍了 MetaRoCE 的技术创新、性能测试结果,以及其在 Meta 大规模 AI 训练基础设施中的应用情况。
MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines
MTIA 300:Meta 首款内置网卡和通信卸载引擎的训练芯片
Meta 发布了 MTIA 300 训练芯片,这是 Meta 首款内置网络接口卡(NIC)和通信卸载引擎的 AI 训练芯片。这一集成设计显著减少了 AI 训练集群中的通信开销,提升了大规模分布式训练的效率。文章详细介绍了 MTIA 300 的架构设计、性能指标和与现有基础设施的兼容性,以及这一芯片对 Meta AI 基础设施战略的意义。
How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees
我们如何在 WhatsApp 上构建诈骗警报系统,同时保证端到端加密和可验证性
Meta 工程团队分享了在 WhatsApp 上构建诈骗警报系统的技术细节。该系统在保持端到端加密的同时,通过可验证的加密协议检测和分析诈骗消息。文章介绍了系统的安全架构、隐私保护机制和检测算法,以及如何在保护用户隐私的前提下有效识别和阻止诈骗行为。
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
Meta 发布了关于其广告排序系统多阶段架构的技术文章。该系统从用户行为序列出发,结合缩放定律(scaling laws)优化模型规模,实现了广告推荐精度和效率的显著提升。文章详细介绍了各个阶段的设计思路、模型架构和训练策略,以及这一系统如何处理 Meta 海量广告请求的实际挑战。
Towards Data Science
AI Slop Is Already in Your Training Dataset. I Tested Three Ways to Spot It.
AI 垃圾数据已经进入你的训练数据集,我测试了三种检测方法
Abdullahi Dattijo 发表文章,揭示了 AI 生成内容(俗称”AI slop”)已经污染了部分训练数据集的问题。作者测试了三种检测 AI 生成内容的方法,包括统计特征分析、风格识别和一致性检查,并比较了它们的准确性和适用场景。文章呼吁 AI 研究社区重视数据质量问题,并提供了实用的检测工具和最佳实践建议。
Your LLM Has a Curved Space of Paragraphs
你的 LLM 拥有一个弯曲的段落空间
Shuyang Xiang 发表文章,探讨了 LLM 内部表示空间的几何特性。文章指出,LLM 对段落的表示并非均匀分布,而是形成了一个具有曲率的流形空间。这一发现对于理解 LLM 的语义表示能力、改进嵌入方法和优化检索增强生成(RAG)系统具有重要的理论意义。作者通过实验验证了这一假设,并提出了相应的应用建议。
10 Things I’m Learning Beyond AI to Become More Technologically Fluent
为成为更技术流利的人,我正在 AI 之外学习的 10 件事
Rashi Desai 分享了她在 AI 技术之外学习提升技术素养的 10 个关键领域。文章涵盖了从系统架构到 DevOps、从数据工程到网络安全等多个技术方向,强调在 AI 时代,全面的技术理解比单一领域的深度更为重要。作者认为,只有建立了广泛的技术基础,才能更好地理解和利用 AI 工具。
Your Model’s MSE Is Lying to You: Part II
你的模型的 MSE 在欺骗你:第二部分
Waleed Esmail 继续探讨均方误差(MSE)作为模型评估指标的局限性。在第二部分中,作者深入分析了 MSE 在不同数据分布和异常值情况下的误导性,并提出了多种替代评估方法和修正策略。文章强调,数据科学家需要根据具体应用场景选择合适的评估指标,避免被单一指标所误导。
RAG Isn’t an Agent — I Built the Layer Between Retrieval and Action
RAG 不是代理——我构建了检索与行动之间的层
Emmimal P Alexander 发表文章,区分了 RAG(检索增强生成)与 AI 代理的本质差异,并介绍了自己构建的介于检索和行动之间的中间层。文章指出,RAG 本质上只是信息检索和生成的组合,而真正的代理需要具备目标设定、规划、执行和反思等能力。作者提出的中间层填补了这一空白,为构建更智能的 AI 系统提供了新的思路。
Jev vs. LLMs: When AI Moves from Generation to Decision-Making
Jev 与 LLM:当 AI 从生成走向决策
Nhu Hoang 发表文章,比较了 Jev 框架与 LLM 在决策制定方面的差异。文章指出,LLM 主要擅长内容生成,而在结构化决策制定方面存在局限。Jev 框架则通过引入形式化推理和约束满足机制,使 AI 能够从生成模式转向决策模式。作者探讨了这一转变的技术挑战和实际应用前景。
How to Maximize Your Coding Agent Subscriptions
如何最大化你的编程代理订阅价值
Eivind Kjosbakken 发表文章,为使用编程代理(如 GitHub Copilot、Cursor 等)的开发者提供了最大化订阅价值的实用建议。文章涵盖了从提示工程到工作流整合的多个方面,帮助开发者更有效地利用 AI 编程助手提升生产力。作者强调,成功的 AI 编程助手使用不仅依赖于工具本身,更取决于使用者的策略和方法。
Beyond RAGs: Building Actually Truthful AI Harnesses
超越 RAG:构建真正可信的 AI harness
Ari Joury, PhD 发表文章,探讨了如何构建真正可信的 AI 系统,超越了传统的 RAG 方法。文章指出,单纯的检索增强无法保证 AI 输出的真实性,需要引入事实验证、来源追踪和不确定性量化等多层机制。作者提出了一个综合性的可信 AI 框架,并讨论了其在医疗、法律等高风险领域的应用。
Towards Spec-Driven Test Automation: Part 1
迈向规格驱动的测试自动化:第一部分
Gal Arav 发表文章,介绍了规格驱动测试自动化(Spec-Driven Test Automation)的概念和方法。文章指出,传统的测试自动化往往依赖于具体的实现细节,而规格驱动的方法则从需求和规格出发,自动生成和维护测试用例。第一部分介绍了该方法的基本原理和实施框架,为后续实践奠定了基础。
When the Correct Answer Is Nothing, What Does Your Pipeline Return?
当正确答案为空时,你的管道返回什么?
Hubert García Gordon 发表文章,探讨了在 AI 管道中处理”无答案”场景的技术挑战。文章指出,当检索或推理系统无法找到正确答案时,简单的返回空值可能导致下游系统的错误处理。作者提出了一套完整的空答案处理策略,包括置信度评估、回退机制和用户提示设计,以确保管道在各种情况下的鲁棒性。