未来 Claude 模型生成的文本将包含水印,用于判断文本由 Claude 撰写的可能性,这是 Anthropic 为遵守欧盟《AI 法案》而实施的变更。该方法基于 Google DeepMind 的 SynthID-Text 技术,对输出质量、创造力和可读性无实际影响,读者无法区分水印文本与普通文本,且不增加额外 token 或成本。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmstc3u8j02xhro0xf5o1ouas

RSS 资讯
聚合优质信息源,掌握技术前沿动态
全部资讯
阿里开源 Qwen3.8-2.4T-A95B,硅基流动已提供 Day-0 支持。该模型拥有 2.4T 参数、95B 激活参数,主打自主编码、深度研究与端到端智能体执行。API 定价为输入 $2.00/百万 token,输出 $6.00/百万 token,缓存输入 $0.25/百万 token。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsrlvwfp05gdro46mbfqtsgm
DeepSeek Harness v0.1 现已推出开发者预览版,并以 MIT 许可证开源。该智能体框架基于 Cordis 元框架构建,核心设计为"一切皆插件",模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsrjqqfg02z0ro469zple5jl
DeepSeek 开源 MIT 协议的代码智能体框架 Harness v0.1 开发者预览版,采用"一切皆插件"架构,对标 OpenAI Codex 与 Anthropic Claude Cowork。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsrjkbcd02tiro46cfjwidak
Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsruj6ik02dfrozeclkuve05
DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 更新上线,用户可在 APP 或网页端选择"专家模式"使用。正式版增强 Agent 能力,API 原生支持 OpenAI Responses API 格式并适配 Codex。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsrfgdsf0xqcroz2g0ihrtoz
DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsrfaw5c0xo2roz2s8b4p2sv
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsruetoy027hrozeecu4ixrc
小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsrcljcc0uanroz24r5ebcz9
WorkBuddy更新上线远程控制功能,将PC、App和小程序打通,手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换。App需升级至1.2.0及以上,电脑端需升级至5.3.8及以上,连接无需扫码。本次更新还新增资料库(我的文档与团队空间)、Markdown多人共同编辑、AI原生审阅模式,以及将资料库内容生成可发布链接的HTML网站。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsr160kg0dk0roz2mb20yxwk
Anthropic 研究指出,随着 AI 智能体在共享代码库、市场等社会系统中承担更多任务,智能体间交互量或将超过人机交互。实验显示,45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠,且协调智能体学会专业化分工。研究同时警示个体层面的良性行为怪癖可能叠加为意外的系统性失败。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqu0nr604oeroz2rh6b6mqt
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqq3bc001snro7vo8picfbp
Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqj4ly004izroxvzl349s3r
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqgeo2e02cvroxvpnycl2zi
Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqe6mat01bsroli3hw71nz7
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqagyyz00yuroucf55e5fue
我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsqbnb8j01nrroosmwa5r6mj
作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsq5saxh051mro2e90h10exo
Meta AI 超级智能实验室的首个开放权重模型 Muse Glimmer 已在 OpenRouter 上线! 这是一款 30B 密集文本+图像模型,采用 Apache 2.0 许可证,旨在成为可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。 https://openrouter.ai/meta/muse-glimmer-30b 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsq1hwsb02norobuzbw8cdcc
LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmspr6h6s01hero4hjcdf95mw