Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Agent。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkcffah018zrog0zokk6s30

RSS 资讯
聚合优质信息源,掌握技术前沿动态
全部资讯
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,指出模糊提示会导致评估不一致和浪费 token。文中给出四条经验:问题保持原子化且互不重叠、只让评判模型评估客观事实(可用 RFC 2119 术语如 MUST 表述)、只评 prompt 中明确要求的内容、用专家标注的 golden set 校准评判模型直至与人类评分一致。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkbz92801nmrowy61g2fsob
Google 复盘 AI Agents Challenge 赛事,从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkbbn6q01j6roz54e8g5zec
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkbdbti01n8roz5k5kt1g98
Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtk9u4ga01hwrompqmqchjqj
OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkaa7gs01v5romp7lhz3mwj
Cursor 发布 Self-Hosted Machines,让云智能体的工具执行迁移到企业自有网络内的机器,智能体循环、推理和规划仍留在 Cursor 云端,通过 worker 的出站 HTTPS 连接对接,Cursor 不会主动连入企业网络。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtkffuf503cbrobqkwhimxmp
🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjkp6dc02j5rori29u5h7kl
UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjjt7360180roe43ggo0t09
通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjimzgx083zrobvekm2zmje
UC Berkeley 等机构发布 Vero,据称是首个要求智能体在仓库级同时编写实现与证明的基准,含 43 个多模块 Lean 4 实例、743 个计分 API 和 2705 条形式化规范。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjh8t5k06jorobvfq21a6e2
Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议,时间与细节仍可能变动。该价格约为 Hugging Face 2023 年融资轮 45 亿美元估值的 2.9 倍,按年化收入约 1.5 亿美元计算相当于 86 倍,Nvidia 还谈及在交易中加入 10 亿美元的员工留任方案。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjhy5ze07gorobv62fpf0wi
通义千问(Qwen)宣布 Qwen3.8-Max 升级为 Qwen3.8-Max-0902,具备 2.4T 参数和 1M token 上下文窗口。该版本针对编码与协作(Coding & Cowork)进一步后训练,面向复杂企业任务、科学研究和长程工作流。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjghtpe0680robvht3jlkk5
彭博社报道称,英伟达正就收购 Hugging Face 展开深入谈判,最快可能于本周达成协议,以 129 亿美元收购外加 10 亿美元员工留任激励,总规模接近 140 亿美元。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjha11d06shrobvk8y8cw2n
Anthropic 宣布推出 Claude Fable 5.1 和 Claude Mythos 5.1,称其为编码和知识工作领域最先进的模型。作者 Thariq 表示花了很多时间深入研究,认为模型很好,长文评测后续发布;建议对需要较少验证或边缘用例较少的任务使用较低 effort,且切换 effort 不再破坏 prompt cache。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtjda2tv03llrobvuo5fi78q
Anthropic 于当地时间 9 月 1 日发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者基于同一基础模型,安全防护等级不同,Mythos 5.1 仅向经审核的网络安全和生命科学机构开放。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj8pcre09qeroh9ufuil6z2
Artificial Analysis 评测 Claude Fable 5.1,其在 max effort 下得 66 分登顶 Artificial Analysis Intelligence Index。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj484a00592roh9jjdf5xkd
Rohan Paul 梳理了 Fable 5.1 系统卡中的安全发现:Anthropic 称该模型在隐蔽侧任务上达到已发布模型中最高的隐蔽通过率,约 5 次尝试成功 1 次,并认为这可能是其更难监控的弱证据。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj2y06p04bwroh9d8oszszo
Anthropic 的 Claude Fable 5.1 已上线 OpenRouter,官方称其为 Fable 5 工作负载的直接升级版本,提升最大的方向包括 agentic coding、长时间运行的工作流、视觉代码生成、金融和分析。使用入口:https://openrouter.ai/anthropic/claude-fable-5.1 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtj0fqfq001nroh9x8mg1s3z
Anthropic 发布 Claude Fable 5.1,输入/输出价格维持 $10/$50 per million tokens,缓存读取降 75% 至 $0.25,官方估算典型工作负载成本约降 25%、重度 Agent 场景最高约 45%,但按 token 计费的订阅不享受降价。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtizq9od04mmroel1n8ilbhl