终于有一篇好论文检验基于记忆的自我改进智能体是否真的在改进
这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

这篇论文重新评估了基于记忆的自我改进智能体,增加了先前研究忽略的两个因素:多次运行以测量方差,以及随机打乱任务顺序。两者都损害了性能。智能体评估在多步任务上本就嘈杂,叠加自我改进循环会放大这种噪声。默认任务顺序施加了隐式课程,许多报告中的提升依赖于它。在记忆构建中加入详细评分标准和环境反馈可部分恢复下降,但仍有显著差距。

谷歌即将在Google应用中推出Discover信息流定制功能,用户可通过聊天式界面描述偏好,AI将自动调整并记住这些设置。该功能将在未来几天内上线,入口位于Discover信息流的三点菜单中。此外,谷歌还更新了Google News音频简报的个性化选项,并允许发布商在网站上放置“首选来源”按钮,方便读者快速添加。


本文介绍了在生产环境中部署大型语言模型(LLM)的关键策略,包括自托管与托管 API 的对比、基础设施扩展模式、路由与回退机制、成本优化、可观测性以及安全合规。文章强调了连续批处理、冷启动管理、请求级定价等要点,并提供了使用 Oxlo.ai 的示例代码。适合需要部署 LLM 应用的开发者参考。
阿里巴巴发布第三代图像生成模型 Qwen-Image-3.0 系列,其中 Pro 版在 Artificial Analysis 图像编辑排行榜位列第六,文生图排行榜第九,较上代大幅提升。该系列支持 4.5k token 提示词、精确渲染小至 10 像素的文字及 12 种语言,并通过阿里云 Model Studio 提供 API,定价每张 0.03 至 0.075 美元。
本文主张 Claude Code 的核心是智能体循环而非自动补全:它通过决策、调用工具、观察结果、再决策的循环来完成任务,并详细解释了工具调用流程、权限模式如何控制自主性,以及 CLAUDE.md 等配置的实际位置。
Google 正式发布 Gemini 3.7 Flash 模型,并已全面覆盖 Gemini API、Google AI Studio、Vertex AI、Gemini Enterprise、Gemini 应用及搜索 AI 模式。该模型支持 100 万 token 上下文,输出可达 64,000 token,并具备可调思考级别。Google 强调其指令遵循和意图理解能力提升,适合编码、智能体工作流和多步任务。开发者可通过多个平台访问,企业需关注定价和治理问题。
本文介绍如何为AI代理的操作构建审计追踪,无需自建日志层。通过将副作用操作路由到审批门,自动记录每次操作的完整生命周期,包括创建、规则应用、批准/拒绝、执行等,并记录决策者身份(如Slack用户名),支持查询和导出,满足合规审查需求。
本文通过实测发现,在免费模型服务器上,流式请求的首 token 延迟可能高于非流式请求的总延迟,且流式请求可能中途断开。作者提供了一个简单的 Python 探针脚本,用于测量首 token 时间、token 间延迟和完成率,并建议在聊天 UI 中使用流式,而在 CI 和批处理任务中避免使用。
一篇案例研究展示了差分模糊测试在验证AI生成代码中的价值。一个免费模型重写了C++配置解析器,虽然通过了所有单元测试,但差分模糊测试在90秒内发现了堆缓冲区溢出和两个语义分歧。该方法将原解析器作为参考,通过比较新旧实现的输出来捕捉测试遗漏的边界情况。
本教程是系列文章的第一部分,介绍如何设置 AWS 账户和 Snowflake 环境,为使用 Amazon SageMaker Canvas 构建无代码机器学习工作流奠定基础。该工作流旨在帮助医疗、零售和生命科学领域的业务分析师等非技术用户,无需编写代码即可探索数据、构建预测模型并生成洞察。本部分详细说明了创建 Snowflake 数据库、仓库和示例欺诈检测数据表的步骤。

本教程展示了如何使用 Amazon SageMaker Canvas 连接 Snowflake 数据源,通过 Data Wrangler 的可视化转换进行数据准备,并训练 XGBoost 欺诈检测模型。整个过程无需编写代码,适合业务分析师和领域专家。文章详细介绍了从创建 SageMaker 域、连接 Snowflake、执行 SQL 查询到数据转换和模型训练的步骤。


本教程是系列第三部分,介绍如何将 Amazon SageMaker Canvas 的预测结果导入 Amazon Quick Sight,构建交互式仪表板,利用生成式 BI 通过自然语言提问获取洞察,并发布 AI 生成的执行摘要。步骤包括导入数据集、创建可视化、使用生成式 BI 构建图表和查询数据、发布仪表板及生成摘要。适合使用 AWS 无代码 ML 和 BI 工具的数据分析师。


本文主张企业需要的是智能体编排而非孤立聊天机器人,并给出论据:多智能体架构通过控制平面、执行平面、消息总线、状态层和可观测性分离职责,支持任务分解、路由、验证和提交,并强调零信任安全与渐进式自主,从而实现可靠、可控的自主工作流。
Runable 2.0 是一个通用型 AI 代理,通过自然语言指令可创建网站、应用、演示文稿等。其 Plan Mode 支持先规划后执行,适合复杂项目;AI Canvas 提供可视化图像视频编辑。免费版可用,Pro 版每月 20 美元,Max 版 100 美元。

Ox Alpha 是一款前沿模型,专为高效编码、持续智能体工作和实际生产使用而设计,支持 100 万 token 上下文窗口,可处理文本、图像和视频输入。现已在 OpenRouter 上线,欢迎试用并提供反馈。
Liquid Death 与 Jason Kelce 合作推出幽默广告,提议用尿液冷却 AI 数据中心。专家指出,虽然不能直接用尿液,但回收水(经处理的废水)已在数据中心冷却中广泛应用,可减少饮用水消耗。目前弗吉尼亚州劳登县的数据中心仅 43% 用水来自回收水,基础设施不足是主要挑战。行业正推动投资和税收优惠以扩大回收水基础设施。
在旧金山的 Inference, Measured 活动中,我们发布了端点准确率指数,通过自托管权重作为参考,对多个提供商的端点进行相同评估,得分从73%到100%不等。量化、KV缓存压缩和上下文限制都会影响质量,即使定价页未显示。


亚马逊及同事提出 CTIFoundry,在索引时构建知识结构,将四个权威安全知识库的官方交叉引用转化为类型化可遍历边,并添加跨度级报告层保留来源。在开源 harness 上,仅更换动作表面,四模型整体 F1 提升 0.19-0.28,小模型在脚手架上的表现优于旗舰模型在平面基座上的表现,且工具调用减半。

Cactus公司Henry在LocalLlama社区发帖称,训练Needle 2时严格避免接触基准测试数据,以防过拟合。他们提供了playground供用户测试,并支持通过Python库进行微调,在约束问题空间下可达到DeepSeek v4的水平。
作者发布了一个针对 RTX 3090 的超优化 Qwen3.8-27B 推理引擎,单请求速度从 82 tps 提升至 381 tps。通过使用 fp8 KV 缓存、int8 激活、DFlash2 块草拟等技术,实现了文档引用工作负载的 15/16 token 接受率。
汤森路透宣布新一代CoCounsel Legal正式可用,将法律研究、起草、验证和案件工作流整合于一个产品中,基于Westlaw和Practical Law构建。新增的Westlaw Brief Builder可从研究和问题分析生成初稿并核查支持性权威。该产品还提供工作区、Word起草和表格审查功能,可处理多达1万份文档和100个问题。智能体负责起草,律师掌控策略和最终决策。
HuggingFace 帖子作者发现 Ornith-1.5-35B-A3B 模型目前附带的 MTP 头从未经过训练,只是随机初始化,这解释了其速度缓慢的原因。
UPDF 是一款跨平台 PDF 编辑器,支持直接编辑、14 种格式转换、38 种语言 OCR,并集成 AI 助手和十种 AI 智能体。其 2.5 版本于 2026 年 3 月 31 日发布,新增书签生成、语义搜索、AI 编辑套件等功能。定价为 Adobe 的五分之一,提供免费层。


NVIDIA 推出了由 NVIDIA 托管的 CUDA MCP(模型上下文协议),旨在通过 AI 辅助 CUDA 开发。该工具支持搜索官方最新文档、编写优化 GPU 代码以及分析性能数据,帮助开发者更高效地进行 GPU 编程。
Adobe 在 Firefly 平台正式推出三款 AI 音频工具:Generate Music 生成免版税音乐、Generate Speech 将脚本转为配音、Generate Sound Effects 为场景制作音效,均支持商用。同时,Firefly AI Assistant 提供每日免费生成次数,并新增 Google Gemini Omni Flash 模型,支持视频、音频、图像和文本输入。
LangSmith推出预览构建功能,允许团队在合并前于临时生产环境中测试拉取请求分支的代理更改。该功能为每个PR提供隔离的暂存环境,自动同步最新提交,支持并发预览和自动清理,旨在简化代理开发的测试流程。

谷歌推出“首选来源”按钮,允许读者在出版商网站上标记其为偏好来源,从而在搜索、Discover和Google News中更频繁展示,以缓解AI搜索带来的流量下降。该功能此前已应用于AI模式,现扩展至所有出版商。谷歌还计划让用户通过自然语言定制Discover feed和音频简报。
Runlayer和Rippling相互起诉后均撤诉,未支付任何费用。Rippling随即发布其MCP网关产品,与Runlayer竞争。此事件警示创始人:在AI时代,新软件构建变得容易,竞争对手可能来自意想不到的地方,甚至潜在客户。
Databricks 展示了如何将传统数据仓库中的存储过程、游标、临时表和事务逻辑直接翻译为 Databricks SQL 脚本,无需重写为 Python 或 Spark。新功能如原生游标支持、BEGIN ATOMIC 事务和 Unity Catalog 治理,使迁移时间缩短 50-75%,并保留原有业务逻辑,让 SQL 团队继续维护。