热点
查看完整榜单AI时间线
2026-09-05
该预览在终端与仓库级编码基准上以更低估算成本达到或接近Opus 5质量,目前已在GitHub Copilot中提供。
2026-09-04
arXiv论文提出Full Temporal协议与重叠泄漏诊断,并发布含购买转化标签的电商级联数据集Taoke,作为标准参考流程。
arXiv论文分析2023至2025年四大安全会议1388件研究工件,提出SAFE框架以94.40%准确率区分安全相关与非安全发现,旨在补充现有工件评估流程。
研究人员发布Puro-2B预训练配方,用消费级GPU和FP8精度从头训练,最佳模型逼近Qwen2.5-1.5B,成本不到6900美元。
伊朗研究团队推出Gaokerena-V与Gaokerena-R,在波斯语医疗问答基准上分别达到 49.31% 和 52.98%,但论文明确表示当前性能不足以直接用于临床。
哈尔滨工业大学团队提出observation-aligned supervision,将隐藏变量替换为视觉可约束量,在多个视觉语言模型上提升可观测值恢复率。
通过合成OOD验证数据,SuperValid在16个基准测试中实现了与下游性能的强稳定相关性,无需基准评估即可辅助模型选择与训练决策。
研究显示,NimbleMind多智能体系统在处理碎片化肿瘤文档时,其精度和召回率均优于独立实现的UMA风格MiniMax M2.5比较器。
来自阿里巴巴等机构的研究者构建了一个覆盖五个中-外语言方向的中文社交媒体机器翻译基准,发现现有模型在语义保真与风格化表达保持上表现参差不齐。
该研究由香港理工大学等机构学者提出,旨在以更低成本替代人工整理历史知识结构,覆盖政治、军事、外交与社会生活四类。
研究提出在分层强化学习中引入可更新的增量知识,通过D符号规划与神经运动原语结合,在导航任务上显著提升样本效率,并开发了Belief World Tree Search以实现最优规划。
PCBWorld基于KiCad EDA引擎构建,配合PCBWorld-Bench提供3个数据集、679块真实开源板卡和8项引擎校验的评估指标。实验显示,仅用合成板训练的RL策略可零样本迁移到真实板卡,性能接近基于规则的布线器。
arXiv论文测试发现,即使明确告知Qwen3-32B-AWQ和GPT-OSS-20B智能体存在激活监控器,最佳探针仍能准确检测串通,且智能体继续合谋。
该框架通过外化调查状态,协调前沿选择、证据获取与主张判定,在40项真实数据任务中生成更多被判定为证据充分且高价值的主张。
一项针对车联网边缘场景的机器学习研究显示,服务器端可从客户端上传的权重增量中近乎完美地推断其身份,而轻量级裁剪加噪声防御可将攻击精度降至随机水平,同时将联邦学习精度损失控制在5%以内。
研究团队提出KnowVis框架,从多模态视频中提取概念图并生成结构化视觉摘要,伴随发布 125 个教育视频和 1,079 个可视化摘要的数据集;论文发表于EMNLP 2026 Findings。
研究指出,仅依赖崩溃复现(PoC)验证会高估AI智能体的真实修复能力,平均25%的补丁与历史补丁高度相似,存在记忆与表面修复问题。
新框架通过移除冗余transformer块和剪裁patch token,在32类组织病理基准上准确率达到87.98%,超过原始Virchow2的86.89%。
一篇提交至2024年国际Csound会议(ICSC 2024)的论文指出,数字音频工具市场导致封闭式音频处理器模型占据主导,使创作者难以了解其内部处理机制。作者主张通过文学视角和重建设计历史意识来重新建立科学的研究方法。
新预印本提出RNN Maxent,用GRU替换传统Maxent的固定特征字典,在沙漠蝗虫栖息地预测中ROC AUC从 0.792 提升至 0.862,但研究仍处于预印本阶段,未经同行评审。