zgba 站群
AI日报 - 2026-09-17

2026-09-17

今日要点


Hacker News

EU chief opens door for Canada to become ‘associate member’

欧盟领导人开放加拿大成为”关联成员”的可能性

欧盟领导人近日表示,考虑允许加拿大成为欧盟的”关联成员”(associate member)。这一提议标志着欧盟与北美盟友关系的进一步深化,可能为加拿大在贸易、安全和科技政策等领域与欧盟的更紧密合作铺平道路。此举也被视为欧盟扩大其地缘政治影响力的一部分,尤其是在当前全球地缘政治格局快速变化的背景下。

Read more →


Mistral X Mozilla: Private, Multilingual AI Browsing

Mistral 与 Mozilla 合作:私密多语言 AI 浏览

Mistral AI 与 Mozilla 宣布合作,推出结合 Mistral 多语言大模型与 Mozilla 浏览器隐私保护能力的 AI 浏览解决方案。该方案旨在为用户提供既保护隐私又支持多语言的智能浏览体验,将先进的 AI 能力嵌入到 Mozilla 的隐私优先架构中,让用户在享受 AI 辅助的同时无需牺牲数据安全。

Read more →


Apple Reference Image: A New Approach for Verified Photography

Apple Reference Image:验证摄影的新方法

Apple 发布了一项名为”Apple Reference Image”的新方案,旨在为摄影验证提供新的技术路径。该方案通过建立标准化的参考图像体系,帮助识别和验证照片的真实性,应对日益严重的深度伪造(deepfake)和图像篡改问题。这一举措反映了 Apple 在内容真实性与数字信任领域的前瞻性布局。

Read more →


Hackers Got Inside a Flock Camera

黑客入侵了 Flock 摄像头

据 Wired 报道,安全研究人员成功入侵了 Flock Safety 公司的社区监控摄像头系统,揭示了其内部工作原理和数据收集机制。该事件引发了对城市监控技术隐私影响的广泛关注,尤其是这类系统如何收集、存储和使用社区公共区域的视频数据。研究人员的发现促使人们重新审视智能监控设备在公共安全与个人隐私之间的平衡问题。

Read more →


The Google Play app review process now regularly takes longer than a week

Google Play 应用审核流程现在通常超过一周

据报道,Google Play 商店的应用审核流程近期频繁出现延迟,许多开发者的应用审核时间已超过一周。这一变化引发了开发者社区的担忧,认为这可能影响应用更新速度和用户体验。分析人士指出,审核延迟可能与 Google 加强内容安全审查、增加 AI 辅助审核环节等因素有关。

Read more →


Small programming tricks

小程序编程技巧

本文探讨了小型编程技巧在软件开发中的重要性,强调即使是最微小的代码优化和编程习惯,也能在长期开发中产生显著影响。作者通过多个实际案例说明,良好的编程实践不仅提升代码质量,还能减少调试时间和维护成本,是每位开发者应当重视的基础技能。

Read more →


PS5 Linux lead quits: “a bunch of noobs using LLMs” that “they don’t understand”

PS5 Linux 项目首席离职:批评”一群不懂技术的 LLM 新手”

PS5 Linux 移植项目的技术负责人宣布离职,并在博客中批评当前开源项目生态中大量”使用 LLM 但并不理解其输出”的新手开发者。他指出,这种趋势正在降低开源项目的整体技术质量,导致大量缺乏深度理解的代码被引入项目。这一言论在开发者社区引发了关于 AI 辅助编程与专业技术能力之间关系的广泛讨论。

Read more →


Salesforce Global Outage

Salesforce 全球性服务中断

Salesforce 遭遇全球范围的服务中断事件,其多个产品线的状态页面显示服务异常。此次中断影响了全球大量企业的客户关系管理(CRM)运营,引发了对企业级 SaaS 服务可靠性的关注。Salesforce 团队正在紧急排查问题原因并恢复服务。

Read more →


Original Sony PlayStation 2 security chip ‘broken wide open’ after 26 years

索尼初代 PS2 安全芯片在 26 年后被彻底破解

经过四年多的逆向工程努力,一位爱好者成功破解了索尼 PlayStation 2 中使用了 26 年的 CXP102064 Mechacon 安全芯片。这一突破不仅让 PS2 的原始安全机制完全公开,也为游戏保存和复古计算社区提供了重要资源。该芯片曾用于防止未经授权的软件和光盘在 PS2 上运行,其破解标志着游戏硬件安全史上的一个重要里程碑。

Read more →


Learning Programming in an Age of LLMs

LLM 时代的编程学习

本文探讨了在大型语言模型(LLM)普及的时代,程序员应当如何学习和掌握编程技能。作者认为,虽然 LLM 可以生成代码,但深入理解编程原理、算法思维和系统架构仍然至关重要。文章建议开发者将 LLM 作为辅助工具而非替代品,注重培养解决复杂问题的能力,并在 AI 辅助下提升而非替代自身的技术深度。

Read more →


Training a 4B model to produce 81% faster query plans than Postgres

训练 4B 模型生成比 Postgres 快 81% 的查询计划

研究人员训练了一个 40 亿参数的模型,使其能够生成比 PostgreSQL 默认查询规划器快 81% 的数据库查询计划。该研究展示了 AI 在数据库优化领域的巨大潜力,通过机器学习方法学习最优查询策略,可以显著提升数据库查询性能。这一成果为智能数据库优化开辟了新方向。

Read more →


Recreating Voodoo Graphics and a Late-1990s Gaming PC on an FPGA

在 FPGA 上重现 Voodoo Graphics 和 1990 年代末游戏 PC

作者成功在 FPGA 上完整重现了 1990 年代末著名的 3dfx Voodoo Graphics 图形卡以及配套的游戏 PC 系统。这一项目不仅还原了经典硬件的图形渲染能力,还让开发者能够在现代环境中运行和体验那个时代的经典游戏。该项目展示了 FPGA 在硬件仿真和复古计算领域的强大能力。

Read more →


Claude Cowork and chat are now one Claude

Claude Cowork 与聊天功能合并为统一的 Claude

Anthropic 宣布将 Claude Cowork 与 Claude 聊天功能合并为统一的 Claude 体验。这意味着用户将在同一个界面中无缝获得对话式 AI 辅助和协作式工作流支持,无需在两个独立产品之间切换。此次整合反映了 Anthropic 对产品体验简化和功能融合的战略方向。

Read more →


Dream-RSI: Recursive Self-Improvement through Evolving Worlds

Dream-RSI:通过演化世界实现递归自我改进

本文介绍了一项名为 Dream-RSI 的研究,探索了通过演化虚拟世界来实现 AI 系统的递归自我改进(Recursive Self-Improvement)。该研究提出了一种新颖的框架,让 AI 在模拟环境中不断测试和改进自身能力,从而推动 AI 系统的自主进化。这一方向对 AI 安全和发展路径具有重要启示。

Read more →


A warning about ‘model welfare’

关于”模型福利”的警告

Mustafa Suleyman 发表文章,对当前 AI 领域中关于”模型福利”(model welfare)的讨论发出警告。他指出,过度关注 AI 系统的”福利”状态可能分散对真正重要的 AI 安全和对齐问题的注意力,并可能导致资源错配和监管混乱。文章呼吁业界保持理性,聚焦于可验证的安全措施而非形而上学的讨论。

Read more →


OpenAI Blog

Helping older adults use AI in everyday life

帮助老年人将 AI 融入日常生活

OpenAI 发布了一篇关于如何帮助老年人使用 AI 技术的指南文章。文章介绍了针对老年用户群体设计的 AI 交互方式,包括简化界面、语音优先交互、以及针对常见日常任务(如健康管理、信息查询、社交沟通)的 AI 辅助功能。OpenAI 强调,AI 技术应当具有包容性,确保不同年龄层的用户都能从中受益。

Read more →


Reimagining advertising with AI

用 AI 重新构想广告

OpenAI 探讨了 AI 如何重塑广告行业,从创意生成、受众定位到效果优化的全流程。文章展示了 AI 在广告领域的应用案例,包括自动生成广告文案、智能投放策略和实时效果分析。OpenAI 认为,AI 正在将广告从传统的经验驱动模式转变为数据驱动的智能决策模式。

Read more →


How to connect AI usage to business value

如何将 AI 使用与商业价值挂钩

本文提供了实用的方法论,帮助企业和组织将 AI 技术应用与可量化的商业价值联系起来。文章涵盖了从需求分析、ROI 评估到规模化部署的完整框架,强调企业应当建立清晰的 AI 价值指标体系,避免”为 AI 而 AI”的盲目投入,确保每一项 AI 投资都能产生可衡量的业务回报。

Read more →


How workers are unlocking new ways of working

员工如何解锁新的工作方式

OpenAI 分享了多个案例,展示员工如何利用 AI 工具重新定义和优化工作流程。文章涵盖了从日常行政任务自动化到复杂决策支持的多种应用场景,强调了人机协作新模式带来的效率提升和创新可能。OpenAI 认为,AI 正在推动工作方式的根本性变革,而非简单的工具替代。

Read more →


How Fyxer built an AI executive assistant people trust

Fyxer 如何打造人们信任的 AI 高管助理

本文介绍了 Fyxer 公司如何利用 OpenAI 技术构建一款获得用户信任的 AI 高管助理产品。文章详细阐述了 Fyxer 在安全性、可靠性和用户体验方面的设计哲学,包括严格的权限控制、透明的 AI 决策过程和持续的用户反馈迭代。该案例为其他希望构建企业级 AI 产品的团队提供了宝贵经验。

Read more →


Perplexity trusts GPT-6 Astra with end-to-end systems

Perplexity 将端到端系统托付给 GPT-6 Astra

Perplexity 宣布在其端到端系统中全面采用 GPT-6 Astra 模型,以提升搜索准确性和响应质量。这一合作标志着 GPT-6 Astra 在专业搜索领域的重要落地,Perplexity 表示新模型在事实准确性和多步推理方面表现突出,能够显著改善用户的搜索体验。

Read more →


Rapidly scaling online storage to serve over 1 billion ChatGPT users

快速扩展在线存储以服务超过 10 亿 ChatGPT 用户

OpenAI 发布了技术文章,详细介绍了如何快速扩展在线存储基础设施以支撑超过 10 亿 ChatGPT 用户的服务需求。文章涵盖了存储架构设计、数据分片策略、缓存优化和弹性扩容等关键技术决策,为大规模 AI 服务的基础设施搭建提供了重要的工程参考。

Read more →


Cognition helps Devin test its own work with GPT‑6 Astra

Cognition 利用 GPT-6 Astra 帮助 Devin 测试自身工作

Cognition 公司宣布使用 GPT-6 Astra 来辅助其 AI 编程助手 Devin 进行自我测试和质量验证。这一方法利用 GPT-6 Astra 的强大推理能力,对 Devin 生成的代码进行审查和测试,显著提升了 Devin 的输出质量和可靠性。该案例展示了多模型协作在 AI 产品开发中的创新应用。

Read more →


How a researcher uses Codex and ChatGPT to search for new antimicrobial molecules

研究人员如何使用 Codex 和 ChatGPT 搜索新型抗菌分子

本文介绍了一位研究人员如何利用 OpenAI 的 Codex 和 ChatGPT 工具加速新型抗菌分子的发现过程。通过 AI 辅助的文献检索、分子结构分析和实验设计,研究人员大幅缩短了传统药物发现所需的周期。这一案例展示了 AI 在科学研究,尤其是生物医药领域的巨大潜力。

Read more →


Now everyone can put data to work

现在每个人都能让数据发挥作用

OpenAI 宣布推出新功能,让普通用户也能轻松利用 AI 分析和处理自己的数据。无论是个人的文档、电子表格还是业务数据,用户都可以通过简单的对话方式让 AI 帮助提取洞察、生成报告和做出决策。这一功能降低了数据分析的技术门槛,使 AI 驱动的数据决策变得更加普及。

Read more →


Anthropic Blog

Improving our alignment and security efforts

改进我们的对齐与安全努力

Anthropic 发布了关于改进 AI 对齐和安全工作的最新进展报告。文章详细介绍了公司在价值观对齐、红队测试、输出过滤和内部安全审查等方面的新措施和研究成果。Anthropic 强调,随着模型能力的不断提升,持续加强安全对齐工作是其核心承诺,公司将投入更多资源确保 AI 系统的安全可靠。

Read more →


Previewing the Model Hardware Standard

预览模型硬件标准

Anthropic 发布了模型硬件标准(Model Hardware Standard)的研究预览,旨在为 AI 模型的硬件部署提供统一的技术规范和性能基准。该标准涵盖了从芯片架构到软件栈的多个层面,目标是促进 AI 硬件生态的互操作性和效率提升,为开发者和硬件制造商提供明确的指导框架。

Read more →


Introducing Claude Opus 5

推出 Claude Opus 5

Anthropic 正式发布 Claude Opus 5,这是其旗舰级大语言模型的第五代版本。Opus 5 在推理能力、多轮对话、代码生成和复杂任务处理等方面均有显著提升,同时保持了 Anthropic 一贯重视的安全性和可解释性。该模型将面向企业和研究人员开放,标志着 Anthropic 在前沿 AI 能力竞赛中的最新进展。

Read more →


Developing Enterprise Frontier Safeguards with our customers

与客户共同开发企业前沿安全保障

Anthropic 分享了与客户合作开发企业级 AI 安全保障机制的经验。文章介绍了 Anthropic 如何与各行业领先企业共同制定针对前沿 AI 模型的安全策略,包括访问控制、使用审计、内容过滤和应急响应等关键措施。这种协作模式确保了安全措施既符合技术最佳实践,又能满足各行业的特定合规需求。

Read more →


Expanding our support for scientists

扩大对科学家的支持

Anthropic 宣布扩大对科学研究人员的支持计划,为学术界提供更便捷的 Claude API 访问、专项研究资金和技术指导。该计划旨在促进 AI 技术在各个科学领域的应用,包括生物学、物理学、材料科学和社会科学等,推动 AI 辅助科学发现的进程。

Read more →


Funding better evaluations of AI’s impact on wellbeing

资助更好的 AI 对幸福感影响评估

Anthropic 宣布设立专项基金,用于资助关于 AI 对人类幸福感影响的研究评估。该基金支持学术界和独立研究机构开展系统性研究,评估 AI 技术在社会、心理和工作环境等方面的影响。Anthropic 认为,全面了解 AI 的社会影响对于负责任地发展 AI 技术至关重要。

Read more →


How Claude’s text watermark works

Claude 文本水印的工作原理

Anthropic 详细介绍了 Claude 生成的文本中嵌入的水印技术。该技术通过在模型输出中隐式嵌入可检测的标记,帮助识别 AI 生成的内容,从而增强 AI 输出的可追溯性和透明度。文章解释了水印的技术实现方式、检测机制以及在防止 AI 内容滥用方面的应用价值。

Read more →


Improving Fable 5’s biology safeguards

改进 Fable 5 的生物学安全保障

Anthropic 发布了关于改进 Fable 5 模型生物学安全保障措施的更新。Fable 5 是 Anthropic 专注于生物学研究领域的专用模型,此次更新加强了对敏感生物学信息(如病原体相关研究)的过滤和管控机制。Anthropic 强调,在促进科学研究的同时,必须严格防范 AI 被用于生物安全风险的潜在途径。

Read more →


Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer

Mariano-Florentino (Tino) Cuéllar 出任 Anthropic 首席全球事务官

Anthropic 宣布前欧盟委员会竞争事务专员 Mariano-Florentino(Tino)Cuéllar 将加入公司,担任首席全球事务官(Chief Global Affairs Officer)。Cuéllar 在监管政策、国际事务和科技治理方面拥有丰富经验,他的加入将增强 Anthropic 在全球政策对话和监管合规方面的能力。

Read more →


Investigating three real-world incidents in our cybersecurity evaluations

调查网络安全评估中的三个真实事件

Anthropic 发布了关于在网络安全评估中发现的三个真实事件的调查报告。这些事件涉及 AI 模型在实际应用场景中可能遇到的安全挑战和漏洞利用尝试。通过深入分析这些案例,Anthropic 分享了改进模型安全防御的经验教训,并为行业提供了有价值的网络安全实践参考。

Read more →


Google AI Blog

AI for Societal Impact

面向社会影响的 AI

Google 发布了关于 AI 社会影响的综合报告,探讨了人工智能技术如何在教育、医疗、环境保护和公共服务等领域产生积极的社会影响。报告强调了负责任的 AI 发展原则,包括公平性、透明度和可及性,并展示了 Google 在推动 AI 技术造福社会方面的具体举措和成果。

Read more →


Building AI to accelerate science and improve lives

构建 AI 以加速科学研究和改善生活

Google 高级副总裁 James Manyika 撰文介绍了 Google 在利用 AI 加速科学研究和改善人类生活方面的努力。文章涵盖了从基础科学研究到应用创新的多个领域,包括气候变化建模、疾病诊断、材料发现等,展示了 AI 如何成为推动科学进步和解决全球性挑战的关键工具。

Read more →


AI for everyone in every language

让每个人都能用每种语言使用 AI

James Manyika 在文章中阐述了 Google 推动 AI 多语言化和普惠化的战略方向。Google 正在努力让 AI 技术能够支持全球所有主要语言,确保不同语言背景的用户都能平等地享受 AI 带来的便利。文章介绍了多语言模型的技术挑战和解决方案,以及 Google 在语言包容性方面的具体投入。

Read more →


New insights from Google’s AI & Economy ATLAS

Google AI 与经济 ATLAS 的新洞察

Google 发布了 AI 与经济 ATLAS 项目的最新研究成果,提供了关于 AI 对全球经济影响的深入分析。报告涵盖了 AI 生产力效应、就业市场变化、行业转型趋势等多个维度,为政策制定者和企业决策者提供了基于数据的洞察和参考。

Read more →


Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery

观看宇航员 Christina Koch 与 Google 的 James Manyika 探讨太空、技术与发现

Google 发布了一段对话视频,邀请宇航员 Christina Koch 与 Google 高级副总裁 James Manyika 就太空探索、技术创新和科学发现等话题进行深入交流。Koch 分享了她在国际空间站的工作经历和对未来太空探索的展望,Manyika 则探讨了 AI 和新技术如何推动太空探索的进步。

Read more →


DevFest is back

DevFest 回归

Google 宣布 DevFest 开发者大会将于 2026 年回归。DevFest 是 Google 面向全球开发者社区的年度盛会,涵盖 Android、Cloud、AI/ML、Web 等多个技术主题。今年的 DevFest 将提供更多线上和线下参与方式,为开发者提供学习最新技术、交流经验和建立联系的平台。

Read more →


用 Search 做好三次大比赛准备的三种方法

Google Search 团队发布了一篇实用指南,介绍跑者如何利用 Google Search 功能为即将到来的大型比赛做好充分准备。文章涵盖了训练计划制定、路线规划、装备选购和赛事信息查询等多个方面,展示了 Search 如何成为运动爱好者的得力助手。

Read more →


用 Search 新功能为比赛做好准备

Google Search 推出了全新的足球相关功能,为球迷提供更丰富的比赛信息和互动体验。新功能包括实时比分更新、球员数据统计、战术分析和赛事推荐等,帮助球迷更全面地了解和享受足球比赛。

Read more →


Recreating a 70-year love story frame by frame

逐帧重现一段 70 年的爱情故事

Google 发布了一个利用 AI 技术重现一段 70 年爱情故事的创意项目。通过 AI 图像生成和视频合成技术,该项目将一对夫妇从青年到暮年的珍贵照片和故事以动态影像的形式呈现,展现了 AI 在情感叙事和文化遗产保护方面的创新应用。

Read more →


Proactive cyber defense for governments and enterprises

为政府和企业提供主动网络防御

Google 发布了面向政府和企业客户的主动网络防御解决方案。该方案利用 AI 和机器学习技术,在威胁发生之前识别和阻断潜在的网络攻击,为关键基础设施和企业数据提供更强有力的保护。Google 强调,主动防御是应对日益复杂的网络威胁的必要策略。

Read more →


The Gradient

After Orthogonality: Virtue-Ethical Agency and AI Alignment

正交性之后:德性伦理代理与 AI 对齐

本文探讨了 AI 对齐领域中”正交性论题”(Orthogonality Thesis)之后的理论发展,提出了基于德性伦理(Virtue Ethics)的 AI 代理框架。作者认为,传统的工具理性对齐方法存在局限,而引入德性伦理视角可以帮助构建更具道德敏感性和价值一致性的 AI 系统。

Read more →


AGI Is Not Multimodal

AGI 并非多模态

本文论证了通用人工智能(AGI)的实现并不依赖于多模态能力。作者指出,尽管多模态 AI 在应用层面具有优势,但 AGI 的核心特征在于其通用推理和问题解决能力,而非输入输出模态的多样性。文章对当前 AI 研究中的多模态热潮提出了反思性的批判。

Read more →


Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research

形状、对称性与结构:数学在机器学习研究中的角色变迁

本文回顾了数学在机器学习研究中的作用演变,特别关注几何形状、对称性和结构概念如何深刻影响模型设计和训练方法。作者指出,近年来数学工具的引入正在推动机器学习从经验驱动向理论驱动转变,为理解深度学习提供了更坚实的数学基础。

Read more →


What’s Missing From LLM Chatbots: A Sense of Purpose

LLM 聊天机器人缺少什么:一种目标感

本文探讨了当前大语言模型聊天机器人在”目标感”方面的缺失。作者认为,真正的智能体应当具有内在的目标驱动和意图理解能力,而不仅仅是被动响应输入。文章提出了构建具有目标感的 AI 系统的方向和挑战,引发了对 AI 智能本质的深入思考。

Read more →


We Need Positive Visions for AI Grounded in Wellbeing

我们需要以幸福感为基础的 AI 积极愿景

本文呼吁 AI 社区构建以人类幸福感为核心的积极愿景,而非仅仅关注技术能力的提升。作者认为,AI 的发展应当服务于人类的整体福祉,包括心理健康、社会关系和生活质量等方面。文章提出了将幸福感指标纳入 AI 评估体系的具体建议。

Read more →


Financial Market Applications of LLMs

LLM 在金融市场的应用

本文综述了大型语言模型在金融市场的多种应用场景,包括市场分析、风险评估、交易策略生成和监管合规等。文章既肯定了 LLM 在金融领域的潜力,也指出了数据质量、模型可解释性和监管合规等方面的挑战,为金融机构的 AI 应用提供了全面的参考。

Read more →


A Brief Overview of Gender Bias in AI

AI 性别偏见简要概述

本文对 AI 系统中的性别偏见问题进行了全面概述,涵盖了训练数据中的性别偏差、模型输出中的刻板印象强化以及算法决策中的不平等影响。文章提出了检测和缓解性别偏见的技术方法,并强调了多元化和包容性在 AI 开发过程中的重要性。

Read more →


Mamba Explained

Mamba 原理解析

本文对 Mamba 架构进行了深入浅出的原理解析。Mamba 是一种新兴的序列建模架构,结合了状态空间模型(SSM)的高效性和注意力机制的灵活性。文章详细解释了 Mamba 的核心组件、选择性扫描机制以及其在长序列处理中的优势,为理解这一架构提供了清晰的技术指南。

Read more →


Car-GPT: Could LLMs finally make self-driving cars happen?

Car-GPT:LLM 能否最终让自动驾驶汽车成为现实?

本文探讨了大型语言模型在自动驾驶汽车领域的应用潜力。作者分析了 LLM 在路径规划、决策制定、场景理解和人机交互等方面的能力,评估了它们是否足以推动自动驾驶技术的实质性突破。文章认为,LLM 可能是自动驾驶系统的重要组成部分,但仍需与专用感知和控制模块协同工作。

Read more →


Do text embeddings perfectly encode text?

文本嵌入是否完美编码了文本?

本文研究了文本嵌入(text embeddings)对文本信息的编码完整性问题。通过逆向工程实验,作者发现当前的文本嵌入模型并不能完美地保留原始文本的所有语义信息,存在信息损失和语义模糊的现象。这一发现对依赖嵌入表示的下游应用具有重要的启示意义。

Read more →


arXiv CS.AI

Optimal Pruning for Neural Architectures using Fisher Information Distances

使用 Fisher 信息距离进行神经网络架构的最优剪枝

本文提出了一种基于 Fisher 信息距离的神经网络剪枝方法,用于确定最优的架构剪枝策略。该方法通过量化参数对模型输出的信息贡献,实现了在保持模型性能的同时最大化剪枝效率,为高效神经网络设计提供了新的理论框架。

Read more →


Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation

语言模型的安全纠错:保持能力的冻结基线调整

本文提出了一种安全纠错方法,通过在冻结基础模型参数的前提下进行调整,实现对语言模型错误输出的修正,同时保持模型的核心能力不受损害。该方法为 AI 系统的安全性和可靠性提供了新的技术路径。

Read more →


GPEvac: GNN-Based PPO for Adaptive Evacuation Routing During Shooting Events

GPEvac:基于 GNN 的 PPO 用于枪击事件中的自适应疏散路由

本文提出了 GPEvac 系统,利用图神经网络(GNN)结合近端策略优化(PPO)算法,在枪击事件等紧急情况下实现自适应疏散路径规划。该系统能够实时感知环境变化并动态调整疏散策略,为公共安全应急响应提供了智能化的解决方案。

Read more →


Position: AI Is Not Ready for Strategic Conflicts

立场声明:AI 尚未准备好应对战略冲突

本文发表了一篇立场文章,论证当前 AI 技术尚未准备好应对战略冲突场景。作者指出,AI 在复杂战略决策中的局限性,包括对不确定性的处理能力不足、缺乏真正的战略理解以及潜在的误判风险,都使得 AI 在战略冲突领域的应用需要极其谨慎。

Read more →


Calibrate, Then Route: A Measured Study of Learned Request Routing for Disaggregated LLM Serving

先校准,再路由:解耦 LLM 服务的学习请求路由测量研究

本文对解耦式大语言模型服务中的请求路由策略进行了系统的测量研究。作者提出了”先校准、再路由”的方法论,通过精确校准各服务节点的性能特征,然后利用学习到的路由策略优化请求分配,显著提升了大规模 LLM 服务的效率和响应速度。

Read more →


Artificial intelligence and biosecurity: capabilities, threat pathways, and defense-in-depth governance

人工智能与生物安全:能力、威胁路径与纵深治理

本文系统分析了 AI 技术在生物安全领域的应用能力和潜在威胁路径,提出了纵深防御(defense-in-depth)的治理框架。文章涵盖了 AI 在生物武器开发中的风险、检测技术的进步以及多层级的治理策略,为 AI 生物安全政策的制定提供了全面的参考。

Read more →


Where Should the KV Cache Live? Placement Policies Across GPU, CPU, and SSD for Long-Lived Sessions

KV 缓存应该放在哪里?面向长会话的 GPU、CPU 和 SSD 放置策略

本文研究了长会话场景下 KV 缓存的最佳放置策略,比较了 GPU、CPU 内存和 SSD 三种存储介质的性能特征和适用场景。作者提出了动态放置策略,根据会话特性和访问模式自动优化 KV 缓存的存储位置,显著提升了长会话 LLM 服务的性能和经济性。

Read more →


Toward Governance-Aware Autonomous GIS: A Narrative Review of Ethical and Privacy Risks in LLM-Enabled GeoAI

迈向治理感知的自主 GIS:LLM 赋能地理 AI 的伦理与隐私风险叙事综述

本文对 LLM 赋能的地理 AI(GeoAI)系统中的伦理和隐私风险进行了叙事性综述。文章探讨了自主地理信息系统在数据隐私、算法偏见、决策透明度和责任归属等方面的挑战,提出了治理感知的自主 GIS 框架,以确保地理 AI 技术的负责任发展。

Read more →


arXiv CS.CL

Few-Shot Degradation Is Not What It Seems: Behavioral Evidence, Representation Analysis, and a Random-Text Control Across 12 Models, 2 Tasks, and 2 Architectures

少样本退化并非表面所见:跨 12 个模型、2 个任务和 2 种架构的行为证据、表征分析与随机文本控制

本文对大语言模型的少样本学习退化现象进行了全面研究,涵盖了 12 个模型、2 个任务和 2 种架构。研究发现,少样本性能下降并非简单的能力退化,而是与模型内部表征的变化和行为模式调整有关。研究引入了随机文本控制实验,为理解少样本学习的本质提供了新的视角。

Read more →


The Functionalizer: Lossless Functional Decomposition for Subword Tokenization

Functionalizer:子词分词的无损功能分解

本文提出了 Functionalizer 方法,用于子词分词(subword tokenization)的无损功能分解。该方法能够将复杂的分词策略分解为可组合的功能模块,在保持分词质量的同时提高了分词系统的可解释性和灵活性,为 NLP 预处理提供了新的技术工具。

Read more →


Optimal Model Activation Policies for Inference Networks of Large Language Models

大语言模型推理网络的最优模型激活策略

本文研究了大语言模型推理网络中的最优激活策略问题,提出了在不同推理阶段动态选择模型子结构的方法。通过优化激活策略,可以在保持推理质量的同时显著降低计算成本和延迟,为高效的大模型推理部署提供了理论指导和实践方案。

Read more →


Single Document Extractive Summarization using Domination in Hypergraph

基于超图支配的单文档抽取式摘要

本文提出了一种基于超图支配理论的单文档抽取式摘要方法。该方法将文档中的句子表示为超图中的节点,利用支配关系识别关键句子,从而实现高质量的摘要生成。实验表明,该方法在多个基准数据集上取得了有竞争力的性能。

Read more →


Latent Undertow: How Ordinary Typos Break Probes

隐性暗流:普通拼写错误如何破坏探针

本文研究了普通拼写错误对 AI 模型探针(probes)的影响,发现即使是微小的拼写错误也能显著破坏探针的预测能力。这一发现揭示了模型内部表征对输入扰动的敏感性,对理解模型的鲁棒性和可靠性具有重要的理论意义。

Read more →


Bias Audits Detect Bias but Disagree on Ranking: Evidence from Ten Instruments and Ten Frontier Models

偏见审计能检测偏见但在排名上存在分歧:来自十种工具和十个前沿模型的证据

本文使用十种偏见审计工具和十个前沿 AI 模型进行了系统性研究,发现虽然不同工具都能检测到偏见存在,但在偏见的严重程度排名上存在显著分歧。这一发现表明,当前的偏见评估方法缺乏一致性标准,需要建立更加统一和可靠的评估框架。

Read more →


Comment on arXiv:2607.01233: Survivorship Bias in Published-Paper Baselines for Research-Idea Distributions

对 arXiv:2607.01233 的评论:研究想法分布中已发表论文基准的幸存者偏差

本文对一篇关于研究想法分布的论文提出了评论,指出其中使用的已发表论文基准存在幸存者偏差问题。作者认为,仅基于已发表文献的分析可能高估了某些研究方向的可行性和成功率,呼吁在研究趋势分析中考虑发表偏差的影响。

Read more →


Crash Narrative-Guided Countermeasure Recommendation Using Large Language Models: A Retrieval-Augmented Generation Framework for Intersection Safety

碰撞叙事引导的对策推荐:基于 RAG 框架的交叉路口安全

本文提出了一种基于大语言模型的碰撞叙事引导对策推荐系统,采用检索增强生成(RAG)框架为交叉路口安全提供智能建议。系统通过分析历史碰撞数据生成叙事场景,然后检索相关的安全对策并生成定制化的安全建议,为智能交通系统提供了新的技术路径。

Read more →


arXiv CS.LG

Causal neural set filtering for online multi-target tracking

用于在线多目标追踪的因果神经网络集过滤

本文提出了一种基于因果神经网络集过滤的在线多目标追踪方法。该方法利用因果推理原理,从多个候选目标中筛选出最可能的真实目标集合,显著提升了复杂场景下的多目标追踪准确性和鲁棒性。

Read more →


Managing Action Preconditions in Neuro-Symbolic RL: Three Placement Strategies for Embodied Agents

神经符号强化学习中的动作前提条件管理:具身智能体的三种放置策略

本文研究了神经符号强化学习中动作前提条件的管理问题,提出了三种不同的放置策略供具身智能体使用。通过系统比较不同策略在复杂任务中的表现,本文为神经符号 AI 系统的实践部署提供了有价值的指导。

Read more →


OmniHarness: Harnessing Generalizable Visual Generation via Symbolic Policy Learning

OmniHarness:通过符号策略学习实现可泛化的视觉生成

本文提出了 OmniHarness 框架,通过符号策略学习实现可泛化的视觉生成能力。该方法将符号推理与深度学习相结合,使生成模型能够理解并遵循复杂的视觉约束条件,在图像生成的一致性和可控性方面取得了显著进步。

Read more →


Driver Behavior Estimation at Signalized Intersections Using a Physics-Constrained Decision-Conditioned Autoregressive Transformer

使用物理约束决策条件自回归 Transformer 估计信号交叉路口的驾驶员行为

本文提出了一种物理约束的决策条件自回归 Transformer 模型,用于估计信号控制交叉路口的驾驶员行为。该模型结合了物理驾驶约束和决策条件建模,能够更准确地预测驾驶员在复杂交通场景中的行为选择。

Read more →


HintMiner: Automatic Question Hints Mining From Q&A Web Posts with Language Model via Self-Supervised Learning

HintMiner:通过自监督学习利用语言模型从问答网页帖子中自动挖掘问题提示

本文提出了 HintMiner 系统,利用自监督学习从问答网页帖子中自动挖掘问题提示(hints)。该系统能够帮助学习者发现解题的关键线索,提升在线学习的效果和效率,为教育技术领域提供了实用的自动化工具。

Read more →


POSPAN: Position-Constrained Span Masking for Language Model Pre-training

POSPAN:用于语言模型预训练的位置约束跨度掩码

本文提出了 POSPAN 方法,一种用于语言模型预训练的位置约束跨度掩码技术。该方法通过在掩码过程中引入位置约束,使模型能够更好地学习文本的局部结构和语义关系,提升了预训练模型的理解和生成能力。

Read more →


Signed p-adic Residual Encodings of Finite-Domain All-Different Systems with a Sudoku Case Study

有限域全不同系统的带符号 p-adic 残差编码:以数独为例

本文研究了有限域全不同系统(all-different constraints)的带符号 p-adic 残差编码方法,并以数独问题作为案例进行了验证。该方法为约束满足问题提供了新的数学表示和求解思路,在组合优化领域具有潜在应用价值。

Read more →


You Don’t Need To Train: Agentic Heuristic Learning Studio for Executable Human Activity Recognition

你不需要训练:用于可执行人类活动识别的代理启发式学习工作室

本文提出了一个无需训练的代理启发式学习工作室,用于可执行的人类活动识别。该方法利用启发式规则和代理推理替代传统的监督训练,降低了活动识别系统的开发门槛和计算成本,同时保持了较高的识别准确率。

Read more →


arXiv CS.CV

MechReason: Benchmarking Multi-Image Multi-Hop Reasoning in Mechanical Engineering

MechReason:机械工程中多图像多跳推理的基准测试

本文发布了 MechReason 基准,用于评估 AI 系统在机械工程中多图像多跳推理任务上的表现。该基准涵盖了机械设计、故障诊断和工程分析等多个场景,为衡量 AI 在专业工程领域的推理能力提供了标准化的评估工具。

Read more →


DenseFace: Bias Mitigation in Face Recognition via Density-Aware Probabilistic Matching

DenseFace:通过密度感知概率匹配缓解人脸识别中的偏见

本文提出了 DenseFace 方法,通过密度感知的概率匹配机制缓解人脸识别系统中的偏见问题。该方法考虑了不同人群在特征空间中的分布密度差异,实现了更加公平和准确的人脸识别,对推动 AI 公平性具有重要的实践意义。

Read more →


Hyperbolic Contrastive Learning with Entailment for Spatial Transcriptomics

用于空间转录组学的含蕴含关系的双曲对比学习

本文提出了一种结合蕴含关系的双曲对比学习方法,用于空间转录组学数据分析。双曲空间能够自然地建模生物数据的层次结构,而蕴含关系则提供了额外的生物学约束,该方法在空间基因表达模式分析中取得了优异性能。

Read more →


SceneBench: A Hierarchical Benchmark for Vision-Language Understanding of 3D Scenes

SceneBench:面向 3D 场景视觉-语言理解的分层基准

本文发布了 SceneBench,一个面向 3D 场景视觉-语言理解的分层基准测试。该基准涵盖了从基础物体识别到复杂场景推理的多个层次,为评估多模态 AI 系统在 3D 环境中的理解能力提供了全面的测试框架。

Read more →


ProtoLIP: From Sentence-Level to Object-Level Evidence Disentanglement

ProtoLIP:从句子级到对象级证据解耦

本文提出了 ProtoLIP 方法,实现了从句子级到对象级的证据解耦。该方法能够更精细地定位和分离图像中的证据信息,提升了视觉问答和图像解释任务的可解释性和准确性,为多模态 AI 的可解释性研究提供了新的技术路径。

Read more →


Sequence Recognition in Bharatnatyam dance

婆罗多舞序列识别

本文研究了印度古典舞蹈婆罗多舞(Bharatnatyam)的序列识别问题。作者提出了一个深度学习框架,能够自动识别舞蹈动作序列中的基本单元(adavus)和组合模式,为舞蹈分析、教学和文化遗产保护提供了智能化的技术工具。

Read more →


Racing in Volume with Flow Ensembles

用流集成进行体积 Racing

本文提出了一种基于流集成(flow ensembles)的体积 Racing 方法,用于高效探索高维参数空间。该方法结合了正常流(normalizing flows)的精确密度估计和集成学习的鲁棒性,在贝叶斯优化和实验设计领域具有广泛应用前景。

Read more →


Reasoning with Image Generation

通过图像生成进行推理

本文探索了利用图像生成技术进行推理的新范式。作者提出,通过生成中间视觉表示,AI 系统可以进行更直观和可解释的推理过程。该方法在复杂视觉推理任务中展现了潜力,为连接视觉生成与逻辑推理提供了新的思路。

Read more →


DeepMind Blog

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

DeepMind 发布了 Gemini 3.8 Live 系列模型,包括标准版和 Extended Thinking(扩展思维)版。Live 版本专为实时交互场景优化,支持低延迟的流式输出和动态推理。Extended Thinking 版本则配备了增强的推理能力,适合处理需要深度思考的复杂任务。

Read more →


AlphaGenome Atlas: A predictive map of every possible DNA letter change in the human genome

AlphaGenome Atlas:人类基因组中每种可能 DNA 碱基变化的预测图谱

DeepMind 发布了 AlphaGenome Atlas,这是首个全面预测人类基因组中每种可能 DNA 碱基变化影响的图谱。该图谱利用 AlphaFold 系列技术,能够预测单核苷酸变异对基因功能和蛋白质结构的影响,为精准医学和遗传学研究提供了强大的工具。

Read more →


Introducing WeatherNext 3, our most advanced and accurate global weather AI model

推出 WeatherNext 3:最先进精准的全球天气 AI 模型

DeepMind 发布了 WeatherNext 3,这是其最先进和精准的全球天气 AI 模型。WeatherNext 3 在天气预报的准确性和时效性方面实现了重大突破,能够提供更长时间跨度的高精度预测,对灾害预警、农业规划和能源管理等领域具有重要应用价值。

Read more →


Proactive cyber defense for governments and enterprises

为政府和企业提供主动网络防御

DeepMind 发布了面向政府和企业客户的主动网络防御解决方案。该方案利用 AI 技术实时监测和预测网络威胁,在攻击发生前主动识别和阻断潜在风险,为关键基础设施和企业数据提供智能化的安全防护。

Read more →


Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

推出 Gemini 3.8 Flash 和 3.8 Flash Cyber

DeepMind 发布了 Gemini 3.8 Flash 系列模型,包括标准 Flash 版和专为网络安全设计的 Cyber 版。Flash 系列在保持高性能的同时大幅提升了推理速度,适合对延迟敏感的应用场景。Cyber 版则针对网络安全任务进行了专门优化。

Read more →


Introducing agentic video understanding with Gemini

推出 Gemini 智能体视频理解

DeepMind 发布了基于 Gemini 的智能体视频理解能力,使 AI 能够以智能体的方式主动理解和交互视频内容。该能力支持复杂视频场景的推理、关键事件的识别和交互式问答,为视频分析和理解开辟了新的技术方向。

Read more →


Gemini Omni 1.1 Flash lets you build with more control

Gemini Omni 1.1 Flash 让你构建时拥有更多控制力

DeepMind 发布了 Gemini Omni 1.1 Flash 模型,为开发者提供了更精细的控制能力。该版本支持更灵活的参数调节、更精确的输出控制和更丰富的工具集成选项,使开发者能够根据具体需求定制 AI 行为,构建更加可靠和可控的应用。

Read more →


Piloting the world’s first double-blind AI evaluations

试点全球首个双盲 AI 评估

DeepMind 启动了全球首个双盲 AI 评估试点项目,评估者和被评估的 AI 系统均不知道测试的具体内容和预期结果。这一方法旨在消除评估偏差,提供更客观和可靠的 AI 性能评估,为行业建立更科学的评估标准奠定了基础。

Read more →


Intelligent transcription with Gemini 3.5 Transcribe

使用 Gemini 3.5 Transcribe 实现智能转录

DeepMind 发布了 Gemini 3.5 Transcribe,一款基于 Gemini 的智能语音转录工具。该工具不仅提供高精度的语音转文字服务,还能自动识别说话人、提取关键信息和生成结构化摘要,适用于会议记录、采访整理和内容创作等多种场景。

Read more →


From Atari to EVE Online: Building on 15 Years of AI Research in Games

从 Atari 到 EVE Online:基于 15 年游戏 AI 研究的积淀

DeepMind 回顾了 15 年来在游戏 AI 领域的研究历程,从早期的 Atari 游戏到复杂的 MMO 游戏 EVE Online。文章展示了 DeepMind 在游戏 AI 方面的技术积累和突破,以及这些研究如何推动通用 AI 能力的发展,为未来更智能的 AI 系统奠定了基础。

Read more →


Meta Engineering

ZGateway: Learnings from Putting a Proxy in Front of ZippyDB

ZGateway:在 ZippyDB 前放置代理的经验总结

Meta 工程团队分享了在 ZippyDB 数据库前部署 ZGateway 代理的经验。文章详细介绍了代理架构的设计决策、性能优化策略和在实际生产环境中遇到的问题及解决方案,为大规模分布式数据库的代理层设计提供了宝贵的实践参考。

Read more →


An Organizational Second Brain: Building an AI That Learns From Experts

组织第二大脑:构建从专家学习的 AI

Meta 介绍了”组织第二大脑”项目,旨在构建一个能够从组织内部专家知识中学习的 AI 系统。该系统通过捕捉专家的经验、决策模式和隐性知识,为组织成员提供智能化的决策支持和知识检索服务,提升了组织整体的知识管理和协作效率。

Read more →


MetaRoCE: A New RDMA Transport Built for AI-Scale Ethernet

MetaRoCE:为 AI 规模以太网构建的新型 RDMA 传输协议

Meta 发布了 MetaRoCE,一种专为 AI 规模计算设计的新型 RDMA over Converged Ethernet 传输协议。该协议针对大规模 AI 训练集群的网络需求进行了优化,提供了更高的带宽利用率和更低的延迟,是 Meta 自研网络基础设施的重要组成部分。

Read more →


MTIA 300: Meta’s First Training Chip with Built-in NICs and Communication-Offloading Engines

MTIA 300:Meta 首款内置 NIC 和通信卸载引擎的训练芯片

Meta 发布了 MTIA 300 训练芯片,这是 Meta 首款内置网络接口卡(NIC)和通信卸载引擎的 AI 训练芯片。该芯片通过硬件级的通信优化,显著提升了大规模分布式训练的效率,是 Meta 在 AI 硬件自研道路上的重要里程碑。

Read more →


How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees

我们如何在 WhatsApp 上构建诈骗警报:端到端加密与可验证性保障

Meta 分享了在 WhatsApp 上构建诈骗警报系统的技术细节。该系统在保持端到端加密的前提下,通过可验证的安全机制识别和警告潜在的诈骗消息,在保护用户隐私的同时提升了平台的安全性,展示了加密通信与安全检测之间的技术平衡。

Read more →


From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking

从用户序列到缩放定律:Meta 广告排序的多阶段架构

Meta 工程团队介绍了其广告排序系统的多阶段架构设计,从用户行为序列分析到基于缩放定律的模型优化。该系统通过分阶段处理用户特征、上下文信息和广告内容,实现了大规模广告推荐的高效和精准,是 Meta 广告技术的核心竞争力之一。

Read more →


GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model

GEM 训练:Meta 如何将 LLM 规模广告基础模型的效率提升一倍

Meta 介绍了 GEM(Generative Engine for Meta)训练方法,成功将 LLM 规模广告基础模型的训练效率提升了一倍。该方法通过创新的分布式训练策略和梯度优化技术,在保持模型质量的同时大幅降低了训练成本,为大规模广告 AI 模型的训练提供了新的范式。

Read more →


Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization

探索层次化兴趣表示以优化 Meta 广告深层转化漏斗

Meta 研究了层次化兴趣表示方法在广告深层转化漏斗优化中的应用。该方法通过构建多层次的用户兴趣模型,更准确地捕捉用户的深层购买意图,从而提升广告在转化漏斗下游环节的效果,为精准营销提供了新的技术思路。

Read more →


Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler

使用开源内核调度器现代化 Meta 广告服务平台

Meta 分享了使用开源内核调度器现代化广告服务平台的经验。通过引入先进的调度算法和开源工具,Meta 显著提升了广告服务的资源利用效率和响应性能,同时降低了运维复杂度,为大规模广告系统的工程实践提供了有价值的参考。

Read more →


Towards Data Science

How to Make Linear Regression Survive Outliers

如何让线性回归在异常值中生存

本文介绍了多种处理线性回归中异常值的技术方法,包括稳健回归、加权最小二乘和异常值检测与剔除策略。作者通过实际案例展示了不同方法的效果对比,帮助数据科学家在面对异常值时选择最合适的处理方案。

Read more →


Silent Broadcasting Can Ruin Your Model

静默广播可能毁掉你的模型

本文揭示了机器学习管道中”静默广播”(silent broadcasting)现象的危害——即隐式的数值广播操作可能导致模型性能严重下降。作者通过具体案例展示了这一问题,并提供了检测和避免静默广播的最佳实践建议。

Read more →


The KV Cache Tax: Why Inference Servers Run Out of Memory Before Compute

KV 缓存税:为什么推理服务器先耗尽内存而非计算资源

本文深入分析了大语言模型推理服务器中 KV 缓存的内存消耗问题,解释了为什么在实际部署中内存往往先于计算资源成为瓶颈。作者提出了 KV 缓存优化策略,包括分页缓存、量化和换出机制,帮助降低推理成本。

Read more →


The N Squared Pizza Problem

N 平方披萨问题

本文以”披萨问题”为隐喻,探讨了机器学习中 N 平方复杂度问题的本质和解决方案。作者通过类比披萨切割的数学问题,解释了为什么某些机器学习算法的复杂度会随数据规模呈平方级增长,并提出了有效的优化策略。

Read more →


Reparameterization Tricks: Variance Reduction by Smarter Gradients

重参数化技巧:通过更智能的梯度降低方差

本文详细介绍了重参数化技巧(reparameterization trick)在降低梯度方差中的应用。作者解释了重参数化如何将随机性从参数中分离出来,使梯度估计更加稳定,从而提升变分推断和强化学习等方法的训练效率和收敛速度。

Read more →


How to Build Consistent Designs with Claude Code

如何使用 Claude Code 构建一致的设计

本文介绍了如何使用 Claude Code 工具构建一致且高质量的 UI/UX 设计。作者分享了通过 AI 辅助实现设计系统一致性、组件复用和风格统一的最佳实践,帮助开发者和设计师提升设计效率和一致性。

Read more →


Seizing the Moment: The Hidden Silhouette of Data

把握时机:数据的隐藏轮廓

本文探讨了数据科学中”时机”的重要性,揭示了数据时间序列中隐藏的轮廓和模式。作者通过多个案例展示了如何利用时间维度的数据分析发现关键洞察,强调了在正确的时间点做出决策的重要性。

Read more →


How Many Labeled Examples Does a Text Classifier Actually Need? I Measured It.

文本分类器实际上需要多少标注样本?我做了测量

本文通过系统性实验测量了文本分类器所需的最小标注样本数量。作者测试了不同规模的数据集和多种分类模型,得出了实用的样本量建议,帮助数据科学家在标注成本和模型性能之间找到最佳平衡点。

Read more →


Your Model’s MSE Is Lying to You

你的模型 MSE 正在欺骗你

本文指出均方误差(MSE)作为评估指标可能掩盖模型的真实性能问题。作者通过案例展示了 MSE 在分布偏移、异常值和不平衡数据等场景下的局限性,并推荐了更全面的评估策略和替代指标。

Read more →


When to Use One Model and When to Use a Team of Agents

何时使用单一模型,何时使用智能体团队

本文探讨了单一模型与多智能体团队在不同场景下的适用性。作者提供了决策框架,帮助实践者根据任务复杂度、资源约束和质量要求,选择是使用单一强大模型还是协作式多智能体系统,并分析了两种方案的优缺点和最佳实践。

Read more →

生成二维码中...
↗

请点击右上角 ···

选择 发送给朋友 或 收藏