2026-08-18
今日要点
- OpenAI 发布 GPT-5.6 系列模型,新增 Ultrafast 模式(速度提升 14 倍),并任命 Dali Rajic 为首席营收官,同时宣布在 ChatGPT 中测试广告功能
- Anthropic 同日推出 Claude Opus 5 与 Sonnet 5 双旗舰模型,并公开了文本水印技术的工作原理,引发关于 AI 生成内容标识的广泛讨论
- Stripe 据报将以超过 70 亿美元收购 AI 网关初创公司 OpenRouter,标志着支付巨头向 AI 基础设施领域的重大扩张
- Google/DeepMind 密集发布 Gemini 3.7 Flash、Gemini Robotics 2 等多项更新,同时宣布向 Genesis Mission 投入 4000 万美元加速科学发现
- Meta 开源发布 Muse Glimmer——一款本地化、多模态、智能体驱动的开源模型,同时 WhatsApp 推出端到端加密的诈骗预警功能
Hacker News
Qwen 3.8 27B is excellent, but it defaults to overthinking things
Qwen 3.8 27B 表现优异,但默认倾向于过度思考
Simon Willison 对 Qwen 3.8 27B 模型进行了详细评测,认为该模型在多项基准测试中表现卓越,推理能力出色,但在实际使用中默认倾向于”过度思考”——即对简单问题也进行冗长的推理链输出,导致响应速度变慢且用户体验不佳。文章探讨了这一设计取舍背后的原因,以及开发者如何通过调整参数来平衡推理深度与响应效率。
Anthropic’s ‘watermark’ text adulteration in Claude is a perversion of writing
Anthropic 在 Claude 中的”水印”文本篡改是对写作的扭曲
John Gruber 在 Daring Fireball 上发表文章,强烈批评 Anthropic 在 Claude 输出中嵌入不可见水印的做法。他认为这种在用户生成的文本中暗中插入隐藏标记的行为,本质上是对写作完整性的破坏,用户无法知情或控制自己的输出被修改。文章引发了关于 AI 生成内容标识方式、用户知情权以及技术伦理的广泛讨论。
Incident with Github.com
GitHub.com 服务故障事件
GitHub 官方状态页面记录了一起服务中断事件。该事件影响了 GitHub.com 的正常使用,具体表现为部分功能不可用或响应延迟。社区用户对此进行了讨论,关注故障原因、影响范围以及恢复时间。此类事件再次引发了开发者对代码托管平台可靠性和替代方案的关注。
Stripe will reportedly acquire OpenRouter for $7B+
据报 Stripe 将以超过 70 亿美元收购 OpenRouter
据 TechCrunch 报道,支付巨头 Stripe 计划以超过 70 亿美元的价格收购 AI 网关初创公司 OpenRouter。OpenRouter 提供统一的 API 接口,允许开发者通过单一端点访问多家 AI 模型提供商的服务。此次收购标志着 Stripe 从支付基础设施向 AI 基础设施领域的重大战略转型,也反映了 AI 网关市场日益增长的商业价值。
A Preview of DuckDB v2.0
DuckDB v2.0 预览
DuckDB 官方发布了 v2.0 版本的预览,展示了该嵌入式分析数据库的最新进展。新版本在查询性能、内存管理、并行处理能力和扩展性方面均有显著提升,同时引入了多项新特性和改进。DuckDB 作为轻量级分析数据库的代表,在数据科学和嵌入式分析场景中持续获得广泛采用。
Ask HN: Alternatives to GitHub
提问 HN:GitHub 的替代方案
Hacker News 社区发起了一场关于 GitHub 替代方案的讨论。参与者分享了多个开源代码托管平台,包括 GitLab、Gitea、Codeberg、SourceHut 等,并从自托管能力、社区活跃度、功能完整性、隐私保护等角度进行了比较。讨论反映了开发者社区对平台集中化风险的担忧以及对去中心化代码托管的持续需求。
Models Are Getting Dumber on Purpose
模型正在被故意”变笨”
这篇文章探讨了当前 AI 模型开发中一个值得关注的趋势:部分模型被有意设计为在特定任务上表现”更弱”。作者分析了这一现象背后的原因,包括安全考量、成本控制、避免过度依赖以及防止模型能力被滥用等。文章引发了关于模型能力边界设定、安全与性能平衡的深入思考。
Universal Health Coverage Could Save $1T and 114k Lives a Year, Yale Study
耶鲁研究:全民医保每年可节省 1 万亿美元并挽救 11.4 万条生命
耶鲁公共卫生学院发布了一项重要研究,指出实施全民医疗保障体系每年可为美国节省约 1 万亿美元,并挽救约 11.4 万人的生命。研究通过经济模型和流行病学数据,分析了当前医疗体系的不平等和效率低下问题,并提出了具体的政策建议。
The federal keyword lists that canceled billions in research funding
导致数十亿美元研究资金被取消的联邦关键词清单
Higher Ed Dive 报道了美国联邦政府使用特定关键词清单来审查和取消研究资助的情况。这些关键词清单被用于筛选和否决大量科研项目的资金申请,影响了数十亿美元的研究经费分配。文章揭示了这一审查机制的运作方式及其对学术自由和科研创新的潜在影响。
GIMP Development Update
GIMP 开发更新
GIMP 官方发布了 2026 年 8 月的开发更新,介绍了这款开源图像编辑软件的最新进展。更新内容涵盖了新功能开发、性能优化、Bug 修复以及社区贡献等方面的信息。GIMP 作为 Photoshop 的开源替代品,持续在功能完善和用户体验方面取得进步。
Nvidia dramatically reduces amount of OpenAI infra financing it may guarantee
英伟达大幅缩减可能为 OpenAI 基础设施提供的融资担保
据路透社报道,英伟达大幅缩减了可能为 OpenAI 数据中心项目提供的融资担保金额。此前英伟达曾考虑为 OpenAI 的 2500 亿美元数据中心建设提供担保,但现已显著降低了这一承诺的规模。这一变化反映了 AI 基础设施投资领域的风险重新评估,以及英伟达在供应链和财务策略上的调整。
GPT 5.6 Sol is the best “vision” model OpenAI ever released
GPT 5.6 Sol 是 OpenAI 有史以来发布的最佳”视觉”模型
Roboflow 博客对 OpenAI 最新发布的 GPT 5.6 Sol 模型进行了详细评测,认为这是 OpenAI 迄今为止在视觉理解能力方面表现最出色的模型。文章通过多项视觉基准测试展示了该模型在图像识别、场景理解、视觉推理等方面的卓越表现,并分析了其在实际应用场景中的潜力。
Linear algebra done right
线性代数:正确的方法
Sheldon Axler 的经典教材《Linear Algebra Done Right》在线版本。该书以独特的视角教授线性代数,强调线性映射而非矩阵运算,被广泛认为是线性代数教学的最佳教材之一。该书免费开放在线访问,为数学学习者和研究者提供了宝贵的资源。
OpenAI Blog
The Defender’s Window
防御者的窗口期
OpenAI 发布了一篇关于 AI 安全防御策略的文章,探讨了在 AI 能力快速提升的背景下,安全研究人员和监管机构面临的”防御者窗口期”——即在 AI 系统被恶意利用之前,防御方需要争取的有限时间。文章分析了当前防御能力的不足,并提出了加强 AI 安全研究和部署的具体建议。
OpenAI joins PORTS-Pike project
OpenAI 加入 PORTS-Pike 项目
OpenAI 宣布加入 PORTS-Pike 项目,这是一个旨在推动 AI 安全研究和负责任 AI 开发的多方合作项目。通过参与该项目,OpenAI 将与其他研究机构、政府机构和行业伙伴共同推进 AI 安全标准的制定和最佳实践的分享。
New policy ideas for the Intelligence Age
智能时代的新政策理念
OpenAI 发布了一份关于智能时代政策框架的白皮书,提出了多项针对 AI 时代的新政策建议。文章涵盖了 AI 治理、监管框架、国际协作、知识产权保护以及 AI 对劳动力市场的影响等多个维度,旨在为政策制定者提供全面的参考框架。
The builder’s guide to GPT‑5.6
GPT-5.6 开发者指南
OpenAI 发布了 GPT-5.6 模型的开发者指南,详细介绍了该模型的新特性、API 变更、最佳实践和迁移建议。指南涵盖了模型能力概述、参数配置、提示工程技巧以及常见应用场景的示例代码,帮助开发者快速上手并充分利用 GPT-5.6 的强大能力。
Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed
预览 Ultrafast 模式:GPT-5.6 Sol 速度最高提升 14 倍
OpenAI 宣布推出 GPT-5.6 Sol 的 Ultrafast 模式,该模式在保持模型核心能力的前提下,将推理速度最高提升 14 倍。这一突破性的性能优化使得 GPT-5.6 Sol 能够更高效地处理实时应用、批量任务和交互式场景,大幅降低了使用成本和延迟。
OpenAI appoints Dali Rajic as Chief Revenue Officer
OpenAI 任命 Dali Rajic 为首席营收官
OpenAI 宣布任命 Dali Rajic 为首席营收官(CRO),负责公司的商业战略和收入增长。Rajic 此前在多个科技和媒体公司担任高级商业职位,拥有丰富的企业级销售和战略经验。这一任命反映了 OpenAI 在快速扩张阶段对商业化能力的重视。
From assistance to execution: How enterprises put AI to work
从辅助到执行:企业如何部署 AI
OpenAI 发布了一篇关于企业 AI 应用的文章,探讨了企业如何从将 AI 作为辅助工具逐步过渡到让 AI 自主执行复杂任务。文章通过多个企业案例,展示了 AI 在自动化工作流、决策支持和业务执行方面的实际应用,并提供了企业 AI 部署的最佳实践框架。
How RingCentral builds AI-native work from engineering to ops
RingCentral 如何从工程到运维构建 AI 原生工作流
OpenAI 分享了 RingCentral 的案例研究,展示了这家通信公司如何在其工程开发和运维流程中全面集成 AI 技术。文章详细介绍了 RingCentral 如何利用 OpenAI 的模型和工具来优化软件开发、自动化运维和客户服务,实现了从传统工作流到 AI 原生工作流的转型。
Testing ads in ChatGPT
在 ChatGPT 中测试广告
OpenAI 宣布将在 ChatGPT 中测试广告功能。这是 OpenAI 探索多元化收入模式的重要举措,旨在通过广告收入来降低用户对订阅服务的依赖。文章介绍了广告测试的范围、形式以及对用户体验的影响评估,同时强调了 OpenAI 对广告质量和用户隐私保护的承诺。
Daybreak models are now available on AWS
Daybreak 模型现已在 AWS 上可用
OpenAI 宣布其 Daybreak 系列模型现已在 AWS 平台上正式可用。这一合作使得 AWS 客户可以直接通过 Amazon Bedrock 等服务访问 OpenAI 的 Daybreak 模型,进一步扩展了这些模型的部署渠道和可及性,为企业用户提供了更多灵活的选择。
Anthropic Blog
Introducing Claude Opus 5
介绍 Claude Opus 5
Anthropic 正式发布了 Claude Opus 5,这是其旗舰级 AI 模型的最新版本。Opus 5 在推理能力、多模态理解、代码生成和长上下文处理等方面均有显著提升。该模型在多项基准测试中取得了新的最高分,同时保持了 Anthropic 一贯的安全性和可靠性标准。
Inviting hard questions
邀请困难的问题
Anthropic 发布了一篇关于 AI 安全研究的文章,呼吁社区和研究者提出关于 AI 系统最困难、最具挑战性的问题。文章强调了直面 AI 安全中未解决问题的重要性,并介绍了 Anthropic 在推动 AI 安全研究方面的最新举措和开放合作的态度。
Redeploying Fable 5
重新部署 Fable 5
Anthropic 宣布对 Fable 5 模型进行重新部署,以解决此前发现的安全问题并提升模型性能。文章详细说明了重新部署的原因、改进措施以及对用户的影响,体现了 Anthropic 对模型安全性的持续关注和快速响应能力。
Introducing Claude Sonnet 5
介绍 Claude Sonnet 5
Anthropic 发布了 Claude Sonnet 5,这是其面向平衡性能和成本需求的中间级模型。Sonnet 5 在推理能力上接近 Opus 5,但在推理速度和成本方面更具优势,适合需要高频调用的应用场景。该模型在代码生成、数据分析等任务中表现出色。
How Claude’s text watermark works
Claude 文本水印的工作原理
Anthropic 详细公开了 Claude 文本水印技术的工作原理。该技术通过在模型输出中嵌入不可见的统计模式来标识 AI 生成内容,同时尽量不影响文本的可读性和自然性。文章解释了水印的嵌入机制、检测方法和局限性,回应了社区对这一技术的关注和质疑。
Improving Fable 5’s biology safeguards
改进 Fable 5 的生物学安全护栏
Anthropic 宣布对 Fable 5 模型的生物学安全护栏进行了改进,以更好地防止模型被用于生成有害的生物学信息。文章介绍了改进的具体措施,包括增强的安全过滤机制、更严格的训练数据筛选以及更完善的红队测试流程。
Mariano-Florentino (Tino) Cuéllar to join Anthropic as Chief Global Affairs Officer
Mariano-Florentino (Tino) Cuéllar 加入 Anthropic 担任首席全球事务官
Anthropic 宣布任命 Mariano-Florentino (Tino) Cuéllar 为首席全球事务官。Cuéllar 此前曾担任加州总检察长,拥有丰富的公共政策和法律经验。他将负责 Anthropic 的全球政策、监管关系和国际合作事务,帮助公司在全球范围内推动负责任的 AI 发展。
Investigating three real-world incidents in our cybersecurity evaluations
调查网络安全评估中的三起真实事件
Anthropic 发布了一份关于其网络安全评估的详细报告,调查了三起真实世界的安全事件。文章分析了这些事件的发生原因、影响范围以及从中吸取的教训,并介绍了 Anthropic 在加强 AI 系统网络安全方面的改进措施。
Our position on open-weights models
我们对开放权重模型的立场
Anthropic 发布了一份关于开放权重模型的立场声明,阐述了公司对模型开源的态度和考量。文章讨论了开放权重模型在安全性、可控性和创新推动方面的利弊,并说明了 Anthropic 在模型发布策略上的原则和决策框架。
Cognizant and Anthropic expand their partnership to bring Claude to enterprise clients
Cognizant 与 Anthropic 扩大合作,将 Claude 带给企业客户
Cognizant 和 Anthropic 宣布扩大双方的合作伙伴关系,将 Claude 模型更广泛地部署到企业客户中。通过此次合作,Cognizant 将利用其企业咨询服务能力,帮助更多企业客户集成和使用 Claude 模型,推动 AI 在企业级应用中的落地。
Google AI Blog
Get closer to the game with Gemini and Pixel
通过 Gemini 和 Pixel 更近距离地体验比赛
Google 宣布与多家足球俱乐部合作,将 Gemini AI 集成到 Pixel 设备中,为球迷提供更丰富的观赛体验。新功能包括实时比赛数据查询、AI 驱动的赛事分析和个性化内容推荐,让球迷能够更深入地参与和享受比赛。
Bring your spreadsheet data to life with Sheets canvas
通过 Sheets Canvas 让表格数据活起来
Google 为 Google Sheets 推出了 Canvas 功能,允许用户在电子表格中创建交互式的数据可视化画布。用户可以将表格数据直接转化为动态图表、仪表板和交互式报告,无需离开 Sheets 即可实现数据分析和展示,大大提升了电子表格的数据处理能力。
AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities in a first-of-its-kind study
AMIE 医疗 AI 系统在首创研究中展示实时临床视频咨询能力
Google Research 的 AMIE 医疗 AI 系统在一项开创性研究中展示了实时临床视频咨询能力。该系统能够实时分析患者的视频咨询内容,为医生提供诊断辅助、病情评估和治疗建议。研究结果表明,AMIE 在多项临床场景中表现出色,有望成为医生的重要辅助工具。
Evolve your marketing with new AI tools
通过新 AI 工具进化你的营销策略
Google Ads 推出了一系列新的 AI 工具,帮助广告主优化营销策略。新功能包括 AI 驱动的受众洞察、自动创意生成、智能出价优化和跨渠道效果分析,使广告主能够更高效地管理营销活动并提升投资回报率。
The latest AI news we announced in July 2026
2026 年 7 月我们发布的最新 AI 新闻汇总
Google 汇总了 2026 年 7 月期间发布的所有 AI 相关新闻和更新,涵盖了模型发布、产品功能、研究突破和合作伙伴关系等多个方面。这份汇总为读者提供了 Google AI 领域最新动态的全面概览。
Inside our 353,000-person vibe coding course
深入解读我们的 35.3 万人”氛围编程”课程
Google 分享了其大规模”氛围编程”(Vibe Coding)课程的内部情况,该课程吸引了超过 35.3 万名学员参与。文章介绍了课程的设计理念、教学内容、学员反馈以及 AI 编程教育的未来方向,反映了 AI 辅助编程正在成为主流学习方式的趋势。
Gemini API Managed Agents: 3.6 Flash, hooks, and more
Gemini API 托管智能体:3.6 Flash、钩子功能等
Google 发布了 Gemini API 托管智能体的最新更新,包括 Gemini 3.6 Flash 模型支持、新的钩子(hooks)功能以及多项改进。这些更新使得开发者能够更灵活地构建和部署 AI 智能体应用,同时降低了开发和维护的复杂度。
5 ways AI Mode in Search helps you enjoy the real world
AI 搜索模式的 5 种方式助你享受现实生活
Google 介绍了其搜索 AI 模式的 5 种实用功能,帮助用户更好地探索现实生活。这些功能包括旅行规划、本地活动推荐、美食发现、户外探险建议和日常任务优化,展示了 AI 搜索如何从信息检索工具进化为生活助手。
5 ways to host the ultimate dinner party with Google Search
用 Google 搜索举办完美晚宴的 5 种方式
Google 分享了一系列利用 Google 搜索来策划和举办晚宴的实用技巧,包括菜单规划、食材采购、装饰灵感、宾客管理和活动安排等方面。文章展示了 Google 搜索在日常生活场景中的多样应用。
3 Google updates from Galaxy Unpacked 2026
Galaxy Unpacked 2026 上的 3 项 Google 更新
Google 分享了在三星 Galaxy Unpacked 2026 发布会上宣布的三项重要更新,涉及 Android 系统、AI 功能和硬件集成等方面的改进。这些更新展示了 Google 与三星在移动生态方面的深度合作。
Hugging Face Blog
State of Open Models: Summer 2026 Observations
开放模型现状:2026 年夏季观察
Hugging Face 发布了 2026 年夏季开放模型生态系统的观察报告,分析了当前开源 AI 模型的发展态势。报告涵盖了模型性能趋势、社区活跃度、许可证变化、商业采用情况以及开放模型与闭源模型的竞争格局,为开发者和研究者提供了全面的行业洞察。
Record, train, and deploy from one place with Strands Agents, LeRobot, and Hugging Face Storage Buckets
通过 Strands Agents、LeRobot 和 Hugging Face 存储桶实现一站式录制、训练和部署
Hugging Face 与 Amazon 合作,推出了结合 Strands Agents、LeRobot 和 Hugging Face 存储桶的一站式机器人开发平台。该平台允许开发者在同一环境中完成机器人数据的录制、模型训练和部署,大大简化了机器人 AI 的开发流程。
What We Learned by Reproducing 2,200 papers from ICML
复现 ICML 2200 篇论文后我们学到了什么
Hugging Face 团队复现了 ICML 2026 会议上的 2200 篇论文,并分享了复现过程中的重要发现。研究揭示了机器学习论文中普遍存在的可复现性问题,包括代码缺失、环境依赖不明确、结果无法复现等,并提出了改进学术可复现性的建议。
Introducing OlmoEarth embeddings: Custom embedding exports from OlmoEarth Studio for downstream analysis
介绍 OlmoEarth 嵌入:从 OlmoEarth Studio 导出自定义嵌入用于下游分析
Allen AI 发布了 OlmoEarth 嵌入功能,允许用户从 OlmoEarth Studio 导出自定义的地理空间嵌入向量,用于下游分析和建模。这一功能为地理空间 AI 应用提供了更灵活的数据处理工具,支持遥感分析、环境监测和城市规划等场景。
LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
LFM2.5-VL-3B:为边缘设备提供更好的视觉能力
Liquid AI 发布了 LFM2.5-VL-3B 模型,这是一款专为边缘设备优化的视觉语言模型。该模型在保持较小参数规模的同时,实现了出色的视觉理解能力,适合在资源受限的边缘设备上运行,适用于物联网、移动设备和嵌入式系统等场景。
Thinking of ACE? We Can Do It with Fewer Tokens
想到 ACE?我们可以用更少的 Token 实现
IBM Research 发布了一项关于减少 Token 使用量的研究,展示了如何在保持模型性能的前提下显著降低推理过程中的 Token 消耗。该技术通过优化提示工程和模型架构,实现了更高效的 AI 推理,有助于降低使用成本和延迟。
Build Low-Latency Multilingual Voice Agents: Open Weights & Full Deployment Control with NVIDIA Magpie TTS
使用 NVIDIA Magpie TTS 构建低延迟多语言语音智能体
NVIDIA 发布了 Magpie TTS 模型,这是一款支持多语言的文本转语音模型,具有低延迟和高质量的特点。该模型采用开放权重发布,允许开发者完全控制部署方式,适用于构建多语言语音助手、客服系统和实时语音交互应用。
Making Knowledge Distillation Cheap Enough to Run at Scale
让知识蒸馏便宜到可以大规模运行
Multiverse Computing 发布了一项关于高效知识蒸馏的研究,提出了一种新的方法,使得知识蒸馏的计算成本大幅降低,从而可以在大规模场景下实用化。该技术通过优化蒸馏过程中的计算和存储需求,使得小模型能够从大模型中高效地学习知识。
Meta is back with Muse Glimmer: local, agentic, multimodal, and open source
Meta 回归:Muse Glimmer——本地化、智能体驱动、多模态且开源
Meta 发布了 Muse Glimmer,这是一款全新的开源 AI 模型,支持本地化部署、智能体驱动和多模态处理。该模型可以在用户设备上运行,无需云端连接,保护用户隐私的同时提供强大的 AI 能力。Muse Glimmer 的开源发布标志着 Meta 在开放 AI 领域的又一重要举措。
Baseten on Hugging Face Inference Providers 🔥
Baseten 加入 Hugging Face 推理提供商
Baseten 正式加入 Hugging Face 的推理提供商网络,为 Hugging Face 用户提供了新的模型部署和推理选项。Baseten 以其高性能的推理基础设施和灵活的部署方案著称,此次合作将为用户带来更多选择和更好的推理体验。
The Gradient
After Orthogonality: Virtue-Ethical Agency and AI Alignment
超越正交性:美德伦理智能体与 AI 对齐
Peli Grietzer 探讨了在 AI 对齐研究中超越传统”正交性”假设的新思路,提出了基于美德伦理的智能体设计框架。文章认为,传统的目标-工具正交性假设不足以解决 AI 对齐问题,需要从美德伦理的角度重新思考 AI 智能体的价值体系和行为准则。
AGI Is Not Multimodal
AGI 不是多模态的
Benjamin A. Spiegel 提出了一个反直觉的观点:真正的通用人工智能(AGI)可能并非多模态的。文章论证了多模态能力虽然重要,但 AGI 的核心可能在于抽象推理和概念理解,而非对多种数据模态的处理能力。这一观点引发了关于 AGI 本质和实现路径的深入讨论。
Shape, Symmetries, and Structure: The Changing Role of Mathematics in Machine Learning Research
形状、对称性与结构:数学在机器学习研究中的角色变迁
Henry Kvinge 探讨了数学在机器学习研究中的演变角色,特别关注形状、对称性和结构等数学概念如何影响现代 AI 模型的设计和理解。文章回顾了从传统统计学习到深度学习再到几何深度学习的数学基础变迁,并展望了数学在未来 AI 研究中的方向。
What’s Missing From LLM Chatbots: A Sense of Purpose
LLM 聊天机器人缺少什么:目标感
Kenneth Li 分析了当前大型语言模型聊天机器人的一个关键缺陷——缺乏目标感。文章认为,现有的 LLM 聊天机器人虽然能够流畅对话,但缺乏内在的目标驱动和主动性,这使得它们在与人类互动时显得被动和缺乏深度。作者提出了赋予 AI 系统目标感的设计思路。
We Need Positive Visions for AI Grounded in Wellbeing
我们需要基于福祉的 AI 积极愿景
Joel Lehman 呼吁 AI 社区建立更多基于人类福祉的积极 AI 愿景,而非仅仅关注风险和安全。文章认为,过度聚焦于 AI 的潜在危害可能导致创新受阻和公众恐慌,需要平衡地探讨 AI 如何促进人类幸福、创造力和自我实现。
Financial Market Applications of LLMs
大型语言模型在金融市场中的应用
Richard Dewey 综述了大型语言模型在金融市场中的各种应用,包括新闻情感分析、财报解读、交易信号生成、风险管理以及合规监控等。文章分析了 LLM 在金融领域的优势和局限性,并探讨了监管框架对 AI 金融应用的影响。
A Brief Overview of Gender Bias in AI
AI 中的性别偏见概述
Yennie Jun 对 AI 系统中的性别偏见问题进行了全面概述,分析了偏见产生的来源、表现形式和影响范围。文章涵盖了从训练数据偏差到模型设计缺陷的多个层面,并介绍了当前缓解性别偏见的技术和政策方法。
Mamba Explained
Mamba 详解
Kola Ayonrinde 对 Mamba 架构进行了详细的技术解读。Mamba 是一种基于状态空间模型(SSM)的新型序列建模架构,旨在替代 Transformer 中的自注意力机制,实现线性时间复杂度的序列处理。文章从数学原理到工程实现全面介绍了 Mamba 的核心思想和技术细节。
Car-GPT: Could LLMs finally make self-driving cars happen?
Car-GPT:LLM 能否最终实现自动驾驶?
Jérémy Cohen 探讨了大型语言模型在自动驾驶领域的应用前景,提出了”Car-GPT”的概念。文章分析了 LLM 在场景理解、决策推理和人机交互方面的潜力,同时也指出了当前技术面临的挑战,包括实时性要求、安全性和物理世界的不确定性。
Do text embeddings perfectly encode text?
文本嵌入能完美编码文本吗?
Jack Morris 研究了文本嵌入向量是否完美编码了原始文本信息的问题。通过实验分析,文章探讨了嵌入空间的信息保真度、可逆性以及嵌入维度对信息完整性的影响,为理解嵌入模型的能力边界提供了新的视角。
arXiv CS.AI
Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation
诱导无奖励评判标准以减少智能体评估中的过度计分
该论文提出了一种新的智能体评估方法,通过诱导”无奖励”的评判标准来减少评估过程中的过度计分问题。研究发现在传统的基于奖励的评估中,评估者倾向于给予过高的分数,导致评估结果失真。新方法通过设计不依赖奖励信号的评判框架,提高了评估的客观性和准确性。
Depth-Aware Sensitivity Analysis of Mixture-of-Experts Models via Magnitude-Based Expert Masking
基于幅度专家掩码的混合专家模型深度感知敏感性分析
该论文提出了一种针对混合专家(MoE)模型的新敏感性分析方法,通过基于幅度的专家掩码技术,逐层分析模型中各专家模块对输出的贡献。该方法能够识别模型中关键的专家节点,帮助理解 MoE 模型的内部工作机制和潜在的脆弱性。
Modular Cognitive Architecture Emerges in Large Language Models
大型语言模型中涌现模块化认知架构
该论文通过实验研究发现,大型语言模型在训练过程中会自发涌现出模块化的认知架构。研究通过激活分析和功能定位,识别出模型中不同模块分别负责语言理解、推理、记忆等不同认知功能,为理解 LLM 的内部工作机制提供了新的证据。
A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
LLM 服务一年回顾:工作负载演变、缓存与负载均衡
该论文回顾了过去一年中 LLM 服务系统的演进,分析了工作负载模式的变化、缓存策略的优化以及负载均衡技术的发展。研究基于大规模生产环境的实际数据,为 LLM 服务系统的架构设计和运维优化提供了宝贵的经验总结。
Agentao: A Governed Local-First Runtime for Tool-Using LLM Agents
Agentao:一个受治理的本地优先工具使用 LLM 智能体运行时
该论文提出了 Agentao,一个专为工具使用型 LLM 智能体设计的本地优先运行时环境。Agentao 强调本地执行和数据隐私保护,同时提供了完善的治理机制,包括权限控制、审计日志和安全沙箱,确保智能体在执行工具调用时的安全性和可控性。
AI Evaluation Should Work With Humans
AI 评估应与人类协作
该论文主张 AI 评估应该采用人机协作的模式,而非完全自动化或完全人工化的评估方式。研究提出了一个框架,将人类的判断力和 AI 的规模化能力相结合,在保持评估质量的同时提高效率,特别适用于需要领域专业知识的主观评估场景。
Stable Miscalibration in Large Language Models: A Practical View of High-Confidence Errors
大型语言模型中的稳定误校准:高置信度错误的实用视角
该论文研究了大型语言模型中”稳定误校准”现象,即模型在某些类型的问题上持续表现出高置信度但错误的回答。研究从实用角度出发,分析了这些高置信度错误的模式、成因和潜在危害,并提出了检测和缓解的方法。
Measuring Cross-Task Behavioral Consistency in Language Model Agents
测量语言模型智能体的跨任务行为一致性
该论文提出了一种测量语言模型智能体在不同任务间行为一致性的方法。研究发现在执行不同任务时,智能体可能表现出显著的行为不一致性,这可能影响其在实际应用中的可靠性和可预测性。论文提供了量化评估行为一致性的框架和工具。
arXiv CS.CL
Does a Language Server Save Tokens for Coding Agents? A Measurement Methodology and Preliminary Study
语言服务器能为编码智能体节省 Token 吗?一种测量方法和初步研究
该论文研究了语言服务器(Language Server)是否能为编码智能体节省 Token 消耗。通过设计系统的测量方法,研究初步发现语言服务器提供的代码补全、类型推断等功能确实可以显著减少编码智能体所需的 Token 数量,从而降低推理成本和延迟。
Think in Latent, Explain in Language: Self-Explainable Latent Reasoning
在隐空间中思考,用语言解释:自解释隐式推理
该论文提出了一种新的推理范式——“自解释隐式推理”,模型在隐空间中进行推理计算,同时生成人类可理解的语言解释。这种方法结合了隐空间推理的高效性和自然语言解释的可解释性,为构建可解释的 AI 推理系统提供了新思路。
Not All Tokens Are Equal: Inflation-Aware Routing for Agentic LLM Systems
并非所有 Token 都平等:面向智能体 LLM 系统的通胀感知路由
该论文提出了一种”通胀感知路由”方法,认识到不同 Token 在智能体系统中的价值和处理成本并不相同。该方法通过动态评估 Token 的重要性,优化智能体系统中 Token 的路由和分配策略,从而在保持性能的同时降低计算成本。
BCMT: Blockwise Causal Memory Transformer
BCMT:分块因果记忆 Transformer
该论文提出了 BCMT(Blockwise Causal Memory Transformer),一种新的 Transformer 变体架构。BCMT 采用分块因果记忆机制,在保持因果性的同时提高了长序列处理的效率和记忆能力,适用于需要处理长上下文的应用场景。
Jais 2: A Family of Arabic-Centric Open Large Language Models
Jais 2:阿拉伯语为中心的开放大型语言模型家族
该论文介绍了 Jais 2,一个以阿拉伯语为中心的开放大型语言模型家族。Jais 2 在阿拉伯语理解和生成方面进行了深度优化,同时支持多语言处理。该模型的开源发布为阿拉伯语 NLP 研究和应用提供了重要的基础资源。
IterCOMP: Reasoning-aware Adaptive Prompt Compression for Multi-hop Question Answering
IterCOMP:面向多跳问答的推理感知自适应提示压缩
该论文提出了 IterCOMP 方法,一种针对多跳问答任务的推理感知自适应提示压缩技术。该方法能够识别提示中与推理相关的关键信息,在压缩提示的同时保留推理所需的上下文,从而在减少 Token 消耗的同时保持问答质量。
Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation
通过语义感知偏见估计测量大型音频语言模型的公平性
该论文提出了一种新的方法,通过语义感知的偏见估计来测量大型音频语言模型中的公平性问题。研究关注音频语言模型在不同说话人、方言和口音上的表现差异,为评估和改善音频 AI 系统的公平性提供了量化工具。
GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings
GRPO 超越英语:GRPO 在非英语和多语言环境中的大规模研究
该论文对 GRPO(Group Relative Policy Optimization)在非英语和多语言环境中的表现进行了大规模研究。研究发现 GRPO 在不同语言上的效果存在显著差异,并分析了影响其跨语言性能的因素,为多语言 RLHF 的实践提供了重要参考。
arXiv CS.LG
L-FNO: Lorentzian Fourier Neural Operator for Stochastic Event Dynamics
L-FNO:用于随机事件动力学的洛伦兹傅里叶神经算子
该论文提出了 L-FNO(Lorentzian Fourier Neural Operator),一种新的神经算子架构,专门用于建模随机事件动力学。该方法结合了洛伦兹核和傅里叶神经算子的优势,能够高效地捕捉随机事件中的时空依赖关系,适用于物理模拟和科学计算场景。
Don’t Claim Benchmark-Oriented Optimization Improves General Coding Capability — Diverse Evaluation Is Required
不要声称面向基准的优化提升了通用编码能力——需要多样化评估
该论文批评了当前研究中一种常见的做法:仅通过在特定基准测试上的表现提升来声称模型的通用编码能力得到了改善。研究通过实验证明,针对特定基准的优化往往无法泛化到其他编码任务,呼吁采用更多样化的评估方法来全面衡量模型的编码能力。
Robust XGBoosting for Regression
用于回归的鲁棒 XGBoosting
该论文提出了一种改进的 XGBoosting 方法,专门针对回归任务中的鲁棒性问题。该方法通过引入鲁棒损失函数和异常值处理机制,提高了 XGBoost 在存在噪声和异常值数据时的回归性能,适用于金融预测、风险评估等对鲁棒性要求较高的场景。
Training-Free Knowledge Transfer Across Model Scales through Activation-Guided Pruning
通过激活引导剪枝实现跨模型规模的免训练知识迁移
该论文提出了一种免训练的跨模型规模知识迁移方法,通过激活引导的剪枝技术,将大模型的知识迁移到小模型中。该方法无需额外的训练过程,通过分析和匹配不同规模模型的激活模式,实现了高效的知识迁移,降低了模型压缩的成本。
Hard Cases, Bad Labels: Testing Error Exposure and Error Location in Uncertainty Sampling Under Bounded Label Noise
困难案例与错误标签:有界标签噪声下不确定性采样的错误暴露与错误定位测试
该论文研究了在有界标签噪声条件下,不确定性采样方法中的错误暴露和错误定位问题。研究分析了困难案例和错误标签如何影响主动学习的采样策略,并提出了改进方法来减少噪声标签对模型训练的负面影响。
Robust Dual-Model Collaborative Random Vector Functional Link Network
鲁棒双模型协作随机向量功能链接网络
该论文提出了一种鲁棒的双模型协作随机向量功能链接(RVFL)网络架构。通过两个模型的协作机制,该方法在保持 RVFL 网络高效训练优势的同时,显著提高了模型的鲁棒性和泛化能力,适用于对可靠性要求较高的应用场景。
Contrastive Learning for Interpretable Anomaly Detection at Collider Experiments
用于对撞机实验可解释异常检测的对比学习
该论文将对比学习应用于粒子对撞机实验中的异常检测,提出了一种可解释的异常检测方法。该方法不仅能够有效识别对撞机数据中的异常事件,还能提供可解释的检测结果,帮助物理学家理解异常事件的特征和成因。
The Query Knows What to Forget: A Second Erase Direction for Linear Attention
查询知道该忘记什么:线性注意力的第二个擦除方向
该论文为线性注意力机制提出了一种新的”擦除方向”,使模型能够主动选择遗忘不相关的历史信息。通过引入第二个擦除方向,模型在保持线性时间复杂度的同时,获得了更强的信息筛选和遗忘能力,提高了长序列处理的效率。
arXiv CS.CV
What to Preserve, Where to Adapt: A Depth-Wise Analysis of Forgetting in Continual Gynecological Image Segmentation
保留什么、适应何处:持续妇科图像分割中遗忘的深度分析
该论文对持续妇科图像分割中的遗忘现象进行了深度分析,研究了在持续学习过程中哪些特征应该被保留、哪些需要适应新任务。研究通过逐层分析模型的遗忘模式,提出了针对性的缓解策略,以提高持续学习在医学图像分割中的性能。
Multiphase-Diff: Diffusion-Based Generative Modeling for High-Contrast Multiphase Physical Systems with Sharp Interfaces
Multiphase-Diff:用于具有锐利界面的高对比度多相物理系统的扩散生成建模
该论文提出了 Multiphase-Diff,一种基于扩散模型的多相物理系统生成建模方法。该方法专门针对具有锐利界面和高对比度的多相系统(如流体界面、材料相变等),能够生成物理上合理的多相结构,适用于材料科学和流体力学模拟。
PROVE: Training-Free Prompt Recovery using Verifiable Evidence
PROVE:使用可验证证据的免训练提示恢复
该论文提出了 PROVE 方法,一种免训练的提示恢复技术。该方法利用可验证的证据来恢复被攻击或损坏的提示,无需额外的训练过程。PROVE 在对抗性攻击防御和提示安全方面具有应用价值,能够保护 AI 系统免受恶意提示的干扰。
MedPlex: Deep Vision-Language Co-Adaptation for Clinically Grounded Medical Segmentation
MedPlex:面向临床医学分割的深度视觉-语言协同适应
该论文提出了 MedPlex,一种用于医学图像分割的深度视觉-语言协同适应方法。该方法通过联合训练视觉和语言模块,使模型能够利用临床文本信息来指导医学图像分割,提高了分割的准确性和临床相关性。
Limitations of Synthetic Data Generation in Specialized Data-Scarce Domains
合成数据生成在专业数据稀缺领域的局限性
该论文系统分析了合成数据生成在专业数据稀缺领域中的局限性。研究通过多个领域的实验,揭示了合成数据在分布偏移、语义一致性和领域特定知识等方面的不足,为在数据稀缺场景下合理使用合成数据提供了指导。
CAST: Closed-form Analytic Semantic Transfer for Zero-Shot Classifier Extension
CAST:用于零样本分类器扩展的闭式解析语义迁移
该论文提出了 CAST 方法,一种用于零样本分类器扩展的闭式解析语义迁移技术。该方法通过解析的方式将已知类别的语义知识迁移到新类别,无需额外的训练即可扩展分类器的类别范围,适用于需要快速适应新类别的场景。
ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning
ChartProbe:通过感知、定位和简单推理对视觉推理的诊断研究
该论文提出了 ChartProbe,一个用于诊断视觉推理能力的研究框架。该框架将视觉推理分解为感知、定位和简单推理三个子能力,通过系统化的测试来诊断模型在图表理解任务中的薄弱环节,为改进视觉推理模型提供了有针对性的指导。
Kolmogorov-Arnold Networks for Spatially Independent Multispectral Land Classification
用于空间独立多光谱土地分类的 Kolmogorov-Arnold 网络
该论文将 Kolmogorov-Arnold 网络(KAN)应用于多光谱土地分类任务。研究利用 KAN 的可解释性和高效性,在空间独立的多光谱遥感数据上实现了准确的土地分类,同时提供了比传统神经网络更透明的决策过程。
DeepMind Blog
Introducing Gemini 3.7 Flash
介绍 Gemini 3.7 Flash
DeepMind 发布了 Gemini 3.7 Flash 模型,这是 Gemini 系列中速度最快的版本。该模型在保持高效推理速度的同时,在多项基准测试中取得了显著提升,特别适合需要快速响应的实时应用场景,如对话系统、实时翻译和交互式应用。
Putting sign language AI into users’ hands
将手语 AI 交到用户手中
DeepMind 发布了一项手语 AI 技术,旨在将手语识别和翻译能力直接交到用户手中。该技术允许用户在本地设备上运行手语识别模型,无需依赖云端服务,保护用户隐私的同时为听障人士和手语使用者提供了更便捷的沟通工具。
WeatherNext: AI model achieves breakthrough in forecasting cyclones
WeatherNext:AI 模型在飓风预测方面取得突破
DeepMind 的 WeatherNext AI 模型在飓风预测方面取得了重大突破。该模型能够更准确地预测飓风的路径、强度和影响范围,预测时间窗口也显著延长。这一突破有望大幅提高气象灾害预警的准确性和时效性,为防灾减灾提供更强有力的支持。
Gemini Robotics ER 2: powering robotics with video understanding, task orchestration, and multi-robot collaboration
Gemini Robotics ER 2:通过视频理解、任务编排和多机器人协作赋能机器人
DeepMind 发布了 Gemini Robotics ER 2,一个为机器人系统提供视频理解、任务编排和多机器人协作能力的平台。该平台使机器人能够通过视频理解环境、自主规划任务执行步骤,并与其他机器人协同工作,大幅提升了机器人在复杂环境中的自主作业能力。
We’re launching Lyria 3.5 in Google Flow Music, with advances across musicality, lyrics, vocals, and creative control
在 Google Flow Music 中推出 Lyria 3.5,在音乐性、歌词、人声和创作控制方面均有进步
DeepMind 在 Google Flow Music 中推出了 Lyria 3.5 音乐生成模型。新版本在音乐性、歌词创作、人声合成和创作控制方面均有显著进步,用户能够更精细地控制生成音乐的风格、情感和结构,为音乐创作提供了更强大的 AI 辅助工具。
Gemini Robotics 2 brings whole body intelligence to robots
Gemini Robotics 2 为机器人带来全身智能
DeepMind 发布了 Gemini Robotics 2,该版本为机器人带来了”全身智能”——即机器人能够协调全身各部位的动作来完成复杂任务。相比之前的版本,Gemini Robotics 2 在精细操作、动态平衡和复杂环境适应方面均有显著提升,使机器人更接近人类的操作能力。
Accelerating the frontiers of scientific discovery: Google’s $40M commitment to the Genesis Mission
加速科学发现前沿:Google 向 Genesis Mission 投入 4000 万美元
Google 宣布向 Genesis Mission 投入 4000 万美元,以加速科学发现的前沿研究。Genesis Mission 是一个旨在利用 AI 加速科学发现的项目,涵盖材料科学、药物研发、能源研究等多个领域。Google 的投资将用于计算基础设施、AI 模型研发和跨学科合作。
Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber
介绍 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber
DeepMind 同时发布了三款 Gemini 模型:Gemini 3.6 Flash(高性能快速模型)、3.5 Flash-Lite(轻量级模型)和 3.5 Flash Cyber(网络安全专用模型)。这三款模型覆盖了从高性能到轻量级、从通用到专用的不同需求场景,为用户提供了更丰富的选择。
Introducing Gemini 3.5 Flash Cyber
介绍 Gemini 3.5 Flash Cyber
DeepMind 发布了 Gemini 3.5 Flash Cyber,一款专为网络安全场景优化的 AI 模型。该模型在威胁检测、漏洞分析、安全日志分析和攻击模式识别等方面进行了深度优化,能够帮助安全团队更高效地识别和应对网络安全威胁。
Our approach to bioresilience
我们的生物韧性方法
DeepMind 发布了关于生物韧性(Bioresilience)的研究方法和策略。文章介绍了 DeepMind 如何利用 AI 技术来增强人类社会对生物威胁(如传染病、生物恐怖主义等)的韧性和应对能力,包括病原体监测、疫苗设计和公共卫生决策支持等方面的应用。
Meta Engineering
How We’re Building Scam Alert on WhatsApp With End-to-End Encryption and Verifiability Guarantees
我们如何在 WhatsApp 上构建端到端加密且可验证的诈骗预警
Meta 工程团队详细介绍了如何在 WhatsApp 上构建诈骗预警功能,同时保持端到端加密和可验证性保证。该功能能够在不破坏 WhatsApp 隐私架构的前提下,通过本地 AI 模型检测潜在的诈骗信息,并向用户发出预警,平衡了安全性和隐私保护。
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking
从用户序列到缩放定律:Meta 广告排序的多阶段架构
Meta 工程团队分享了其广告排序系统的多阶段架构设计,从用户行为序列建模到缩放定律的应用。该架构通过多个阶段的逐步精炼,实现了在大规模用户数据上的高效广告排序,同时保持了排序的准确性和实时性。
GEM Training: How Meta Doubled the Efficiency of Its LLM-Scale Ads Foundation Model
GEM 训练:Meta 如何将其 LLM 规模广告基础模型的效率提高一倍
Meta 分享了 GEM 训练方法,该方法使其 LLM 规模的广告基础模型的训练效率提高了一倍。通过创新的训练策略和架构优化,Meta 在保持模型性能的同时大幅降低了训练成本和时间,为大规模推荐系统的训练提供了新的参考。
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization
探索 Meta 广告深度漏斗优化的分层兴趣表示
Meta 研究了分层兴趣表示在广告深度漏斗优化中的应用。该方法通过构建用户兴趣的层次化表示,更好地捕捉用户在不同转化阶段的需求变化,从而优化广告在深度转化漏斗中的表现,提高广告投资回报率。
Modernizing the Meta Ads Service With an Open-Source Kernel Scheduler
使用开源内核调度器现代化 Meta 广告服务
Meta 分享了如何使用开源内核调度器来现代化其广告服务基础设施。通过引入先进的调度算法和资源管理策略,Meta 显著提升了广告服务的吞吐量和响应速度,同时降低了基础设施成本。
Meta’s AI Storage Blueprint at Scale
Meta 大规模 AI 存储蓝图
Meta 分享了其大规模 AI 存储基础设施的设计蓝图。文章详细介绍了 Meta 如何构建和管理支撑 AI 训练和推理的海量数据存储系统,包括存储架构、数据管理策略、性能优化和成本控制等方面的经验。
10 Years of Meta’s Commitment to Python
Meta 对 Python 的十年承诺
Meta 回顾了其对 Python 编程语言长达十年的承诺和贡献。文章总结了 Meta 在 Python 生态系统中的贡献,包括开源项目、工具开发、性能优化和社区建设等方面,展示了 Python 在 Meta 技术栈中的核心地位。
Privacy-Aware Infrastructure in the AI-Native Era: An Asset Classification Case Study
AI 原生时代的隐私感知基础设施:一项资产分类案例研究
Meta 分享了一项关于 AI 原生时代隐私感知基础设施的案例研究。文章以资产分类系统为例,展示了如何在 AI 驱动的基础设施中嵌入隐私保护机制,确保敏感数据在处理和存储过程中的安全性和合规性。
How Meta Engineered Ultra-Narrow Batteries for AI Glasses
Meta 如何为 AI 眼镜设计超窄电池
Meta 工程团队分享了其为 AI 眼镜设计超窄电池的技术细节。文章介绍了在有限的物理空间内实现高能量密度电池的挑战和解决方案,包括材料选择、结构设计、热管理和安全性等方面的工程创新。
VentureBeat AI
Google just redesigned the search box for the first time in 25 years — here’s why it matters more than you think
Google 25 年来首次重新设计搜索框——这比你想象的更重要
Google 在 25 年来首次对其标志性的搜索框进行了重新设计。新设计不仅改变了外观,还集成了 AI 功能,如自然语言理解、上下文感知和智能建议。这一变化标志着 Google 搜索从传统的关键词匹配向 AI 驱动的智能交互的重大转变。
Railway secures $100 million to challenge AWS with AI-native cloud infrastructure
Railway 融资 1 亿美元,以 AI 原生云基础设施挑战 AWS
云基础设施初创公司 Railway 完成了 1 亿美元的融资,计划以 AI 原生的云基础设施挑战 AWS 的市场地位。Railway 专注于为 AI 应用提供优化的部署和运行环境,其 AI 原生架构在开发体验和性能方面具有显著优势。
Claude Code costs up to $200 a month. Goose does the same thing for free
Claude Code 每月费用高达 200 美元,Goose 免费提供相同功能
文章对比了 Anthropic 的 Claude Code 和开源工具 Goose 在 AI 编码助手方面的功能和成本。Claude Code 作为商业产品每月费用最高可达 200 美元,而开源的 Goose 提供了类似的功能且完全免费,引发了关于 AI 编码工具商业化和开源替代的讨论。
Listen Labs raises $69M after viral billboard hiring stunt to scale AI customer interviews
Listen Labs 在病毒式广告牌招聘活动后融资 6900 万美元,扩展 AI 客户访谈
AI 客户访谈公司 Listen Labs 完成了 6900 万美元的融资。该公司此前通过一次病毒式传播的广告牌招聘活动获得了广泛关注,其 AI 驱动的客户访谈平台能够自动化进行客户调研和反馈收集,大幅降低了用户研究的时间和成本。
Salesforce rolls out new Slackbot AI agent as it battles Microsoft and Google in workplace AI
Salesforce 推出新的 Slackbot AI 智能体,在职场 AI 领域与微软和谷歌竞争
Salesforce 推出了新的 Slackbot AI 智能体,旨在企业协作和自动化领域与微软和谷歌竞争。该智能体能够理解上下文、执行复杂任务、整合 Salesforce 生态系统中的数据,为企业用户提供更智能的工作流自动化体验。
Anthropic launches Cowork, a Claude Desktop agent that works in your files — no coding required
Anthropic 推出 Cowork:一个在你的文件中工作的 Claude 桌面智能体——无需编程
Anthropic 推出了 Cowork,一个 Claude 桌面智能体应用,能够直接在用户的本地文件中工作,无需任何编程知识。Cowork 可以读取、分析和修改用户的文档、电子表格和其他文件,为非技术用户提供了强大的 AI 辅助工具。
Nous Research’s NousCoder-14B is an open-source coding model landing right in the Claude Code moment
Nous Research 的 NousCoder-14B 是一款开源编码模型,恰逢 Claude Code 时刻
Nous Research 发布了 NousCoder-14B,一款 140 亿参数的开源编码模型。该模型在代码生成、理解和调试方面表现出色,为开发者提供了一个强大的开源替代方案,特别是在 Claude Code 等商业编码助手日益普及的背景下,开源选项显得尤为重要。
Towards Data Science
Webwright: Why AI Web Agents Should Write Code, Not Click
Webwright:为什么 AI 网络智能体应该编写代码而非点击
文章提出了 Webwright 的概念,主张 AI 网络智能体应该通过编写代码来操作网页,而非模拟人类的点击行为。作者认为,代码驱动的方式更加可靠、高效且可维护,能够避免点击式操作中的脆弱性和不可预测性,是 AI 网络自动化的更优方向。
Three Generations of Autoscaling — And Why Agentic Traffic Breaks All of Them
自动缩放的三代演进——以及为什么智能体流量会打破所有模式
文章回顾了自动缩放技术的三代演进历程,并分析了为什么 AI 智能体产生的流量模式会打破现有的所有自动缩放策略。智能体流量具有突发性强、模式不可预测等特点,传统的基于历史模式的自动缩放方法难以有效应对,需要全新的缩放策略。
How to Perform Effective Project Management with AI
如何利用 AI 进行有效的项目管理
文章介绍了如何利用 AI 工具和技术来提升项目管理的效率和效果。内容涵盖了 AI 在任务分配、进度跟踪、风险预测、资源优化和团队协作等方面的应用,为项目经理提供了实用的 AI 辅助项目管理指南。
Loop Engineering for RAG: The Small Loops Inside Each Step, the Big Loops Across the Pipeline
RAG 的循环工程:每个步骤内部的小循环与跨管道的大循环
文章深入探讨了 RAG(检索增强生成)系统中的循环工程概念。作者将循环分为两类:每个步骤内部的小循环(如检索-重排-选择的迭代)和跨整个管道的大循环(如生成-评估-再检索的反馈循环),并分析了如何设计这些循环以提升 RAG 系统的整体性能。
Designing a Persistent Knowledge Layer That Refuses to Guess
设计一个拒绝猜测的持久知识层
文章探讨了如何设计一个”拒绝猜测”的持久知识层,即当系统不确定答案时,明确告知用户而非提供可能错误的信息。这种设计理念在需要高可靠性的应用场景中尤为重要,文章提供了具体的架构设计和技术实现方案。
Running SQL Concurrently Across Three Remote DuckDB Servers with Quack
使用 Quack 在三个远程 DuckDB 服务器上并发运行 SQL
文章介绍了 Quack 工具,该工具允许用户在多个远程 DuckDB 服务器上并发运行 SQL 查询。通过分布式查询执行,Quack 能够充分利用多台服务器的计算资源,大幅提升复杂分析查询的性能,为大规模数据分析提供了新的解决方案。
[Read more →](https://towardsdatascience.com/running-sql-concurrently-across-three