AWS博客公布一套基于Step Functions的夜间记忆生命周期工作流,对Amazon Bedrock AgentCore智能体记忆进行TTL过期、相关性评分与整合修剪,并配套AWS CDK代码和回归测试。
热点
查看完整榜单AI时间线
2026-09-05
蒂姆·库克本周卸任苹果CEO,由前硬件主管John Ternus接任;Ternus在首份备忘录中预告下周将有一次“大规模发布”,外界猜测与iPhone活动有关。库克将留任执行董事长,专注政策事务。
2026-09-04
一篇新预印本论文发现,在策略强化学习训练下,大模型是否产生有害行为受环境设计影响,且现有安全基准大多无法预测此类风险。
新框架将大语言模型间的情绪谈判技能蒸馏到7B参数小模型中,在四个谈判领域多数场景下优于基线,去除情绪通道会显著降低总体效用。
一项系统综述分析了28篇2023年以来的相关研究,发现GenAI的采用面临技术不可靠、社会伦理风险与治理真空三大相互关联的挑战,并指出技术子系统演变速度与社会子系统适应速度之间的持续错位。
arXiv研究提出F-GRPO,通过困难感知缩放系数修正RLVR中有限组采样导致的罕见正确轨迹被忽略问题,在Qwen2.5-7B上提升数学推理pass@256 最多 6.2 个百分点。
ICML 2026论文提出ScoreMix,通过在反向扩散轨迹中混合类别条件分数生成合成样本,不依赖第三方基础模型或数据集,在8个公开人脸识别基准上将准确率最高提升7个百分点。
arXiv一篇论文提出结合差分隐私与拜占庭鲁棒聚合的联邦学习框架,在模拟跨机构分类任务中,面对25%恶意客户端时F1分数较普通FedAvg提升近3倍。
该代理基于累积检索上下文,动态决定是否、何时以及如何调用搜索与扩展工具,优于结构化检索和RL基线。
arXiv新论文提出Test Cases Scaling(TCS),通过两阶段强化学习自动生成高质量测试用例,在TACO和LiveCodeBench基准上提升pass@1和推理时答案选择。
新论文提出OPD-then-RL两阶段训练法,在逻辑与数学推理基准上超越纯OPD、纯RLVR及联合基线,并以OPD验证分数作为切换信号。
研究团队提出FWBC-VLA框架,结合视觉-语言-动作模型与全身控制,通过无传感器扭矩估计器感知接触状态,并在擦白板和开门实验中验证效果。
TIGPO通过跨训练轮次维护持久转换图,并将回访数据与历史探索配对,在ALFWorld和WebShop上超越此前方法。
来自多个机构的 14 位研究者提出DE-Venus,将RLVR监督定义为数据准备与策略优化中的演化状态,在公开基准和三个商业场景中以少量标签和数据达到同等或更优质量,并将收敛步骤减少 63%–75%。
中科大等机构研究人员提出EraseSAE框架,通过分解-归因-擦除流程在DiT架构的文本生成视频扩散模型中实现概念级擦除,声称在保持生成质量的同时优于现有方法。
剑桥团队提出AdaptiveSpec,在SGLang引擎上实现逐层自适应草稿树与容错验证,吞吐量较EAGLE-3最高提升56%,任务准确率恢复93%至完全无损。
新方法LeanGRPO通过重构数据并行布局并引入两种免重计算训练调度,在FlowGRPO/DanceGRPO中实现最高1.83倍端到端加速,同时保持原始优化目标。
arXiv新论文显示,单条查询驱动的在线蒸馏(OPD)在数百步内持续提升,覆盖全量数据训练 71.5% 的状态空间;16 条语义多样的查询可达到 98.9% 的覆盖率并匹配全量训练效果,但学生模型的吸收速度同样缓慢。
arXiv论文提出环境演化(Environment Evolution)方法,离线逐步增加任务难度,在Qwen3.6系列模型上最高提升18.0个百分点。
一项对约194篇文献的系统性筛选显示,数据中心AI节能研究存在验证不足与报告指标缺失问题;作者据此提出CLEAR-DC报告框架。
arXiv新论文提出PPO-STGNN,将PPO与STGNN结合,用于云边端异构环境下的DAG任务调度,目标是最小化完工时间并改善负载均衡,实验显示该方法在保持低完成时间的同时显著提升负载均衡。
2026-09-02
2026年9月2日,Anthropic公布了Claude消费级应用(Claude.ai和移动应用)的系统提示更新,并重新组织了文档页面。新版提示(Fable 5.1)首次明确禁止复制歌词、诗句、书籍段落及生成受版权保护的视觉作品与角色,同时调整了回答风格与物质使用指引。