01OpenAIGPT-6 在 ChatGPT 全球上线,引入智能界面
GPT-6 正在 ChatGPT 中全球推出,并配备 Intelligent UI。 GPT-6 提供更快的响应,并包含可视化和可交互体验,用户可以直接探索和使用。
原文 ↗GPT-6 正在 ChatGPT 中全球推出,并配备 Intelligent UI。 GPT-6 提供更快的响应,并包含可视化和可交互体验,用户可以直接探索和使用。
原文 ↗OpenAI正在ChatGPT中推出名为Intelligent UI的新功能,使聊天机器人能以交互式视觉元素回答问题。 该更新随GPT-6一起向所有用户推出,让ChatGPT能够将文本回复与图表、图表、表单、可点击按钮等元素组合。 该更新面向所有用户推出。 更新与GPT-6同步推出。
原文 ↗ChatGPT聊天框长出界面 Plus、Pro等付费用户,则使用GPT-6 Sol。 上一代GPT-5.6 Luna是0.927,而免费用户即将用上的GPT-6 Luna,掉到了0.734。 OpenAI称,在需要网页搜索的问题上,GPT-6 Instant开始回答的时间平均比GPT-5.6 Instant早44%。 其中最醒目的判断是:GPT-6 Sol和Luna在网络安全、生物化学领域均达到High门槛,尚未达到更高一级的Critical门槛;
原文 ↗Crowdstrike 报告了韩国的一起基础设施黑客攻击事件,一名疑似讲中文的攻击者在 2026 年 9 月下旬至 10 月初期间袭击了多家韩国金融机构,窃取了大量数据。 据韩国报纸《韩民族》报道,仅新韩银行一家就有超过 25,000 条包含姓名、联系方式、收入和信用额度的记录被盗。 攻击者使用了 ARTEX,这是一款中国的开源工具,于 7 月首次发布在 GitHub 上,它利用 AI 语言模型进行自动化渗透测试;其背后的模型是 DeepSeek v4.1-flash、GLM-5.3 和 Grok 4.6。 研究人员在攻击者的开放目录中发现了 Claude Code 会话日志,显示其搜索 Telegram 群组以出售窃取的数据。 就在几天前,Anthropic 记录到 GLM-5.3 编写漏洞利用程序的能力几乎与 Mythos Preview 相当,后者是 Anthropic 的前沿模型,也是在 2026 年 3 月下旬引发整个争论的那个模型。 Crowdstrike 表示,此案表明 AI 工具如何能让一个人在短时间内实施大规模入侵,这正是网络安全专家数月来一直警告的风险。 订阅 THE DECODER 可享受无广告阅读、每周 AI 新闻通讯、每年六次独家“AI Radar”前沿报告、完整档案访问权限以及评论区访问权限。
原文 ↗NVIDIA 与 Microsoft 在旧金山 Windows AI 和 Surface 活动上宣布为 Windows PC 引入 AI Agent 硬件与软件。 “我们需要让桌面成为智能体执行任务的最安全场所,”纳德拉说。 紧凑型台式机将于11月开售。 凭借最高128GB统一内存和最高1 petaflop的AI算力,你可以在这一笔记本电脑上运行传统机器根本无法容纳的模型,”达武鲁里说。 本次活动预览了面向 Windows 的 NVIDIA DGX Station——首台将 GB300 Grace Blackwell 级 AI 基础设施直接带入 Windows 生态系统的桌边 AI 超级计算机。 “曾经需要租用集群才能获得的能力,如今就在一台桌边超级计算机中。 迄今为止,DGX Station 一直运行在 Linux 上——这意味着企业开发者需要维护两套独立的环境:用于繁重 AI 工作负载的 Linux,以及用于生产力工具、应用程序和工作流的 Windows。 需要时,仍可通过 WSL 访问 Linux AI 工具链。 在 X 、 Instagram 、 TikTok 和 Facebook 上关注 NVIDIA RTX Spark —— 并订阅 NVIDIA Local AI 新闻通讯 以随时了解最新动态。
原文 ↗在旧金山举行的微软活动上,黄仁勋与纳德拉阐述了NVIDIA和微软正在为运行在Windows PC上的AI智能体共同设计硬件和软件。 黄仁勋表示NVIDIA因Windows而创立,现在AI智能体正在进入Windows。
原文 ↗Nous Research以15亿美元估值完成9000万美元B轮融资。 本轮融资由Robot Ventures领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung和1789 Capital等参与。 据该公司估算,开源Hermes Agent已被克隆超过2400万次,占全球AI token用量的约2.5%。 新资金将支持Nous Research面向企业市场推出Hermes for Businesses,使企业能够部署处理多步工作流并保持数据私密安全的定制化AI智能体。
原文 ↗DeepMind 发布了关于生命密码的新 AI。
原文 ↗小模型新守门员 budget_tokens手动思考配置直接报错,必须改成自适应思考加effort参数。 Max和Team订阅用户本周起可以领取API额度,Max 5x每月$100,Max 20x每月$200,Team最多$500/月在团队内共享。
原文 ↗开始和国产Agent抢人,还拿到5亿美元新融资 不过,新团队的办公选址尚未公布(此前Manus在北京的办公场地位于epark海淀花园路社区的共享办公空间,仅有7个工位)。 只是,对于这家一年前曾大幅裁撤中国团队的公司来说,重起国内招聘,也意味着有些旧问题需要重新面对。 回头的浪子,必须面对一个现实隐忧 其国内团队原有约120名员工,其中40余名核心技术人员计划迁往新加坡,其余员工面临裁撤。 毕竟一家公司可以随着战略变化重新选择办公地点和业务重心,员工却需要面对具体的职业安排、生活成本和职业规划。 站在潜在候选人的角度,至少有以下几个问题值得考虑。 因此Manus这次想要聘请并留住核心人才,可能需要拿出比以往更多的诚意。 这些能力能否转化为国内用户愿意长期使用的产品,还需要后续验证。
原文 ↗Google推出名为Playground的实验性游戏平台,用户可创建、游玩并分享自定义游戏。 Playground是一项实验性平台,并非正式发布。
修复了以指令形式编写的 prompt 和 agent hooks 误判问题,例如不再错误阻断原本应被阻断的命令 改进了 Stop 与 SubagentStop 上以指令形式编写的 prompt hooks(如 "Carry on if the build is broken")的判断方式 调整后,Claude 在上述 hooks 场景下更不容易过早停止
修复了以指令形式编写的 prompt 和 agent hooks 误判问题,例如不再错误阻断原本应被阻断的命令 改进了 Stop 与 SubagentStop 上以指令形式编写的 prompt hooks(如 "Carry on if the build is broken")的判断方式 调整后,Claude 在上述 hooks 场景下更不容易过早停止
Anthropic API 将新增的 Claude Haiku 5.5(claude-haiku-5-5)设为默认 Haiku 模型,上下文窗口为 1M,每百万 token 输入/输出定价为 0.10 美元/0.50 美元,超过 100K token 的提示价格为 0.50 美元/2.50 美元。 subagentStatusLine 负载中新增 agentType 字段,以便脚本区分自定义子代理类型。 $.tool.register 新增 isDeferred 选项,设为 false 时工具模式会从一开始就列在提示中,而非放在工具搜索之后。
Claude Code 发布 v2.1.292 版本,更新包括:claude plugin install 新增 --marketplace 参数,可在需要时自动添加 marketplace;Agent 工具新增 effort 参数,允许指定子代理运行的 effort 等级;新增 CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS 环境变量,用于自定义 529 过载重试的退避基准延迟;以及 prompt.autocomplete 事件,便于 mod 钩入添加自定义补全行。
Claude Code 发布 v2.1.290 版本,在插件钩子 API 上做了扩展:mod 的 turn.step 钩子结果中新增 serverToolUses(包含顾问调用的工具 id、name、input、起止时间);plugin hooks 的 tool.check 事件新增 agentId 以区分子代理与主会话的权限检查;tool.check 钩子可读取组织要求的审批上限;插件钩子类型中新增 ThemeKey 和 Color 类型,便于编辑器列出主题配色。
Claude Code 发布 v2.1.289 版本,修复了复合 shell 命令嵌套部分拒绝规则被 mod 授权覆盖的问题、含大量未闭合标签或深层 ${ 替换的短代码块导致终端冻结的问题,以及 IDE 中通过 symlink @提及或选中的文件未触发读拒绝规则的问题(VSCode);同时回退了 v2.1.288 中导致频繁登出的 claude auth status 变更,并改进了插件中大文件的打开速度。
Anthropic 旗下 Claude Code 发布 v2.1.288 版本,新增 mods 可调用的 $.ui.selection() 接口以返回全屏模式下选中的文本,集成无 GitHub CLI 环境的 gh api,并为 Ctrl+C 清空提示符后通过上箭头恢复草稿(含粘贴文本和图片)增加了恢复逻辑,同时修复文件名、jq 过滤器和 GitHub 错误中的控制字符发送到终端等问题。
Claude Code 发布 v2.1.287 版本,新增 Claude Mods 机制,允许插件修改更深层行为;内置推出「You should know」模组,通过侧代理监听并标记用户或 Claude 可能遗漏的问题,可在 telemetry 开启的一方会话中用 `/plugin enable` 启用。代理视图新增 `n:` 过滤项匹配会话名与任务,并在折叠区域内展示匹配结果。OpenTelemetry 的 user_prompt 事件也补充了 prompt_text 字段。
新增权限请求堆叠时的计数提示(如“2 of 5”);在列表全屏模式下支持鼠标点击/悬停“N more”行跳转;修复 GCP/AWS 认证过期时多进程重复弹出登录浏览器的问题;修复并行工具调用场景下 claude --resume 与 --continue 偶发丢失会话轮次的问题。属于稳定性和交互细节改进。
Claude Code 发布 v2.1.285 版本,主要新增四项能力:CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量用于关闭 WebFetch 工具、claude --desktop 命令可在当前目录或通过 --continue/--resume 打开 Claude 桌面应用、claude plugin configure 可查看与设置插件选项,以及在 claude plugin install --config 中支持 .= 语法以便安装时直接配置捆绑的 .mcpb MCP 服务器。属于面向开发者的常规功能迭代,提升了工作流集成与插件配置效率。
Claude Code 发布 v2.1.283 版本,新增 x-claude-code-prompt-id 网关提示请求头,配合 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 可让 LLM 网关按用户提示聚合请求;新增 availableModelsMatch(exact 模式)与 deniedModels 两个托管设置,用于精细控制可用模型列表与阻断特定模型。
Claude Code 发布 v2.1.282 版本,新增 maxProseWidth 设置以限制宽终端中文本宽度(表格与代码块保持原宽),并在启动提示、/status 和 claude doctor 中列出项目设置文件中被忽略或关闭遥测的变量;新增 allowClaudeInChromeWithManagedMcp 受管设置,允许 claude --chrome 与 exclusive managed-mcp.json 共存,Chrome 被阻断时错误信息会明确指明原因。
ACEMAGIC在国内电商上架F9A迷你主机工作站,采用AMD锐龙AI Max+ PRO 495处理器,搭配192GB内存与2TB存储配置。 该配置标价50,999元,新品首发特惠价49,998元。 F9A PRO 495可将160GB统一内存配置为显存,支持300B参数LLM本地运行。 机身一体成型铝制,体积约2L,支持140W峰值/120W稳定性能,重量约1.6kg 存储与网络:2个M.2 PCIe Gen4×4 SSD盘位,搭载Wi-Fi 7与BT 5.4 音频与外观:内置2个2W扬声器、4颗阵列数字麦克风,底部嵌入智能ARGB灯带 正面接口:1个USB-C 40Gbps、2个USB-A 10Gbps、1个SD读卡器、1个3.5mm音频插孔 反面接口:1个HDMI 2.1、1个DisplayPort 2.1、1个OCuLink、1个USB-C 40Gbps、1个USB-A 10Gbps、1个USB-A 480Mbps、2个2.5GbE RJ-45、1个3.5mm音
服务器端新增代理云用量与余额接口 修复 Windows 上 llama 越过 2GiB 读取 Clef 头的问题 命令行引导中移除账户步骤 清单在 Windows 上避免使用符号链接 社区集成列表中修复 6 个失效链接 应用 README 中修复下载链接 移除已上游合并的 MLX Metal 驻留补丁
服务器端新增代理云用量与余额接口 修复 Windows 上 llama 越过 2GiB 读取 Clef 头的问题 命令行引导中移除账户步骤 清单在 Windows 上避免使用符号链接 社区集成列表中修复 6 个失效链接 应用 README 中修复下载链接 移除已上游合并的 MLX Metal 驻留补丁
Ollama 发布 v0.40.1-rc0 预发布版本。 该版本移除了此前针对 MLX 后端携带的 Metal residency 补丁,因为该补丁已合并到上游。
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认使用 MLX 运行时运行支持的模型架构。新增 qwen3.8、qwen3.6、qwen3.5、gemma4 等模型以及 Nimble、tev1、clef、clef-flash 决策模型,MLX 还新增对 embeddinggemma-2 嵌入模型的支持,显著扩展了 Apple Silicon 上的模型生态。
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认使用 MLX 运行时运行支持的模型架构,新增 gemma4、qwen3.5/3.6/3.8 等模型,并上线多款 MLX 决策模型。对于 Mac 用户而言,这能显著提升本地模型推理性能与能效比,是一次面向 Apple Silicon 的重要底层优化。
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认通过 MLX 运行时运行受支持的模型架构,并新增 gemma4、qwen3.6、qwen3.5 等模型以及 Nimble、tev1、clef 等决策类模型。MLX 路径可利用 Apple Silicon 神经引擎与 GPU,提升端侧大模型推理性能与能效,对本地 LLM 用户意义明显。
Ollama 0.35.1 版本新增对 Cloudflare 开源决策模型 Clef(27B)和 Clef Flash(9B)的支持,通过 /v1/systemone 端点调用。这两个模型均为多模态,可在请求中同时附带图像与文本状态信息,并对多问联合评分。
Ollama 发布 v0.35.1 版本,主要更新包括:单次响应允许最多十次网页搜索、MLX 与 llama.cpp 后端版本升级(llama.cpp 至 b11232)、create 命令支持显式声明模型能力。属于小版本补丁,对本地大模型运行工具的搜索能力与后端依赖做了增强与维护。
Ollama 推出 /v1/decision 端点,支持决策模型(Decision Models)调用,模型返回选项、概率和分数而非生成文本,适用于工单分流、模型路由、内容分类等场景。目前已支持 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1 两种模型,用户可通过 ollama pull 安装。
Ollama 发布 v0.40.0 版本,支持 MLX 的模型架构在 Apple Silicon 设备上默认通过 MLX 后端运行,无需额外配置。RC 阶段将逐步启用更多模型,用户可通过 ollama pull 与 ollama run 直接调用如 qwen3:8 等模型。这是 Ollama 在 macOS 本地推理性能优化上的重要进展。
Ollama 发布 v0.34.4 版本,主要更新 MLX Runner 中用于结构化输出的 XGrammar 库至 0.2.7。该版本修复了类型化字典值与短数组的 schema 解析问题,提升了 Apple Silicon 设备上结构化输出的兼容性。属于一次小版本补丁,无新增功能。
GPT-6 自今日起免费使用 GPT-6 拒答变少,话变多了 ChatGPT 聊天框内出现界面形态的内容
Ollama 发布 v0.40.1-rc0 预发布版本。 该版本移除了此前针对 MLX 后端携带的 Metal residency 补丁,因为该补丁已合并到上游。
服务器端新增代理云用量与余额接口 修复 Windows 上 llama 越过 2GiB 读取 Clef 头的问题 命令行引导中移除账户步骤 清单在 Windows 上避免使用符号链接 社区集成列表中修复 6 个失效链接 应用 README 中修复下载链接 移除已上游合并的 MLX Metal 驻留补丁
Ollama 发布 v0.40.1-rc0 预发布版本。 该版本移除了此前针对 MLX 后端携带的 Metal residency 补丁,因为该补丁已合并到上游。
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认使用 MLX 运行时运行支持的模型架构。新增 qwen3.8、qwen3.6、qwen3.5、gemma4 等模型以及 Nimble、tev1、clef、clef-flash 决策模型,MLX 还新增对 embeddinggemma-2 嵌入模型的支持,显著扩展了 Apple Silicon 上的模型生态。
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认使用 MLX 运行时运行支持的模型架构,新增 gemma4、qwen3.5/3.6/3.8 等模型,并上线多款 MLX 决策模型。对于 Mac 用户而言,这能显著提升本地模型推理性能与能效比,是一次面向 Apple Silicon 的重要底层优化。
Ollama 发布 v0.40.0 版本,在 Apple Silicon 设备上默认通过 MLX 运行时运行受支持的模型架构,并新增 gemma4、qwen3.6、qwen3.5 等模型以及 Nimble、tev1、clef 等决策类模型。MLX 路径可利用 Apple Silicon 神经引擎与 GPU,提升端侧大模型推理性能与能效,对本地 LLM 用户意义明显。
Ollama 0.35.1 版本新增对 Cloudflare 开源决策模型 Clef(27B)和 Clef Flash(9B)的支持,通过 /v1/systemone 端点调用。这两个模型均为多模态,可在请求中同时附带图像与文本状态信息,并对多问联合评分。
Ollama 发布 v0.35.1 版本,主要更新包括:单次响应允许最多十次网页搜索、MLX 与 llama.cpp 后端版本升级(llama.cpp 至 b11232)、create 命令支持显式声明模型能力。属于小版本补丁,对本地大模型运行工具的搜索能力与后端依赖做了增强与维护。
Ollama 推出 /v1/decision 端点,支持决策模型(Decision Models)调用,模型返回选项、概率和分数而非生成文本,适用于工单分流、模型路由、内容分类等场景。目前已支持 Bespoke Labs 的 Nimble 和 Together AI 的 Tev1 两种模型,用户可通过 ollama pull 安装。
Ollama 发布 v0.40.0 版本,支持 MLX 的模型架构在 Apple Silicon 设备上默认通过 MLX 后端运行,无需额外配置。RC 阶段将逐步启用更多模型,用户可通过 ollama pull 与 ollama run 直接调用如 qwen3:8 等模型。这是 Ollama 在 macOS 本地推理性能优化上的重要进展。
Ollama 发布 v0.34.4 版本,主要更新 MLX Runner 中用于结构化输出的 XGrammar 库至 0.2.7。该版本修复了类型化字典值与短数组的 schema 解析问题,提升了 Apple Silicon 设备上结构化输出的兼容性。属于一次小版本补丁,无新增功能。
ComfyUI 发布了 v0.39.2 版本。
ComfyUI 发布了 v0.39.2 版本。
ComfyUI 推出 v0.39.1 版本。作为 Stable Diffusion 等扩散模型主流的可视化节点式工作流工具,此版本属于常规维护更新,主要修复已知问题并提升运行稳定性。
ComfyUI 发布 v0.39.0 版本,新增对 LynnReal 光照 Minimax-H3 VAE 的支持,文档同步至 v0.5.13,并默认使用更高质量的视频编码参数。新增 DynamicGroup 小组件输入能力,同时修复了模型扫描中断、硬盘哈希关闭后资源记录丢失,以及选择 int8/int4 缓存时崩溃等多项问题。
ComfyUI 推出 v0.38.2 更新。作为主流的 Stable Diffusion 节点式工作流前端工具,本次更新主要针对已知问题修复与稳定性改进,建议用户关注更新日志中的兼容性提示并及时升级。
ComfyUI 推出 v0.38.1 版本,作为 Stable Diffusion 生态中主流的可视化工作流编排工具,本次更新继续修复已知问题并优化节点与后端兼容性,以提升用户在搭建复杂 AI 图像生成流水线时的稳定性与易用性。
ComfyUI 更新至 v0.38.0,主要改进包括:优化 Qwen 2.1 的 KV 缓存定位逻辑并预编译其 Transformer 模块,支持在模型文件中指定各 block 使用的注意力机制;为 ACE Step 1.5 自回归模型引入 CUDA Graphs 与内存编译器以提升推理性能;JsonExtractString 节点支持带前后缀的 JSON 解析;移除 torchaudio 依赖并改进 H3 VAE 瓦块混合。作为主流 AI 图像生成工作流框架,其底层性能与模型兼容性优化对本地部署用户有实际价值。
ComfyUI 发布 v0.37.4 版本更新。ComfyUI 是基于节点工作流的 Stable Diffusion 图像生成界面,此次小版本主要修复缺陷并优化稳定性,建议用户升级以获得更顺畅的体验。
ComfyUI 发布 v0.37.2 版本更新。该项目是基于节点工作流的可视化 Stable Diffusion 工具,本次为常规迭代,修复若干问题并优化使用体验。
在Windows与Surface活动上,微软展示了Copilot AI系统的升级,将使其能够访问PC上的本地文件并跨操作系统执行操作。 此次升级是微软所称"混合智能"(Hybrid Intelligence)理念的一部分,应用与工具将依赖多种AI能力的组合运行。
微软发布了配备英伟达芯片、面向AI模型和智能体运行的新款AI PC。
OpenRouter宣布GPT-6 Luna Decisions上线,支持发送文本、JSON或图片并返回带概率的类型化答案 定价为输入0.10美元/M tokens、输出免费,上下文窗口为1M 引用OpenAI开发者账号称其决策速度比通过Responses API的GPT-6 Luna最快10倍
OpenRouter宣布GPT-6 Luna Decisions上线,支持发送文本、JSON或图片并返回带概率的类型化答案 定价为输入0.10美元/M tokens、输出免费,上下文窗口为1M 引用OpenAI开发者账号称其决策速度比通过Responses API的GPT-6 Luna最快10倍
Simon Willison针对OpenAI在DevDay推出的Jev风格Decisions API发布llm-openai-decisions 0.1a0插件,使用GPT-6 Astra阅读文档并参考llm-typesafe插件构建,支持图像和文本输入,输入计费10美分/百万token,输出免费。
langchain-huggingface 1.2.3 发布,修复了流式测试中使用的 Scaleway 模型问题 该版本包含一项修复:流式测试改用受支持的 Scaleway 模型 该版本将依赖 langgraph-sdk 从 0.4.4 升至 0.4.6 依赖变更范围仅限 /libs/partners/huggingface 目录
OpenAI正在ChatGPT中推出名为Intelligent UI的新功能,使聊天机器人能以交互式视觉元素回答问题。 该更新随GPT-6一起向所有用户推出,让ChatGPT能够将文本回复与图表、图表、表单、可点击按钮等元素组合。 该更新面向所有用户推出。 更新与GPT-6同步推出。
Claude Haiku 5.5 现已在 Amazon Bedrock 和 AWS 上的 Claude Platform 上提供。 据 Anthropic 称,它是 Claude 5.5 系列中最快、最高效的模型,专为子智能体及高吞吐量、成本敏感的工作负载而构建。 据 Anthropic 称,对于大多数任务,其成本比 Claude Haiku 4.5 低约 75%。
LangChain 重构 Deep Agents 的 Skills 支持,推出三项更新:工具可绑定到技能、仅在该技能被读取时加载,以及用户可通过 /meeting-prep 之类的显式请求固定技能以在首次模型调用前加载。 长线程可通过将 skills_metadata 设为 None 重载新增或变更的技能。 该更新针对企业技能库增至数千个技能的场景。
Amazon Quick与Amazon Bedrock Knowledge Bases在查询时与权威数据源实时核对权限,对企业知识源实施文档级访问控制。 该方案面向的企业知识源包括SharePoint、Google Drive和Confluence,这些数据源具有复杂权限设置。
Meta的AI智能体Muse已在iPad上推出,距离其移动端首发仅一个月。 Meta正迅速扩展该助手的覆盖范围和集成能力。
Anthropic API 将新增的 Claude Haiku 5.5(claude-haiku-5-5)设为默认 Haiku 模型,上下文窗口为 1M,每百万 token 输入/输出定价为 0.10 美元/0.50 美元,超过 100K token 的提示价格为 0.50 美元/2.50 美元。 subagentStatusLine 负载中新增 agentType 字段,以便脚本区分自定义子代理类型。 $.tool.register 新增 isDeferred 选项,设为 false 时工具模式会从一开始就列在提示中,而非放在工具搜索之后。
修复了以指令形式编写的 prompt 和 agent hooks 误判问题,例如不再错误阻断原本应被阻断的命令 改进了 Stop 与 SubagentStop 上以指令形式编写的 prompt hooks(如 "Carry on if the build is broken")的判断方式 调整后,Claude 在上述 hooks 场景下更不容易过早停止
Anthropic API 将新增的 Claude Haiku 5.5(claude-haiku-5-5)设为默认 Haiku 模型,上下文窗口为 1M,每百万 token 输入/输出定价为 0.10 美元/0.50 美元,超过 100K token 的提示价格为 0.50 美元/2.50 美元。 subagentStatusLine 负载中新增 agentType 字段,以便脚本区分自定义子代理类型。 $.tool.register 新增 isDeferred 选项,设为 false 时工具模式会从一开始就列在提示中,而非放在工具搜索之后。
Claude Code 发布 v2.1.292 版本,更新包括:claude plugin install 新增 --marketplace 参数,可在需要时自动添加 marketplace;Agent 工具新增 effort 参数,允许指定子代理运行的 effort 等级;新增 CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS 环境变量,用于自定义 529 过载重试的退避基准延迟;以及 prompt.autocomplete 事件,便于 mod 钩入添加自定义补全行。
Claude Code 发布 v2.1.290 版本,在插件钩子 API 上做了扩展:mod 的 turn.step 钩子结果中新增 serverToolUses(包含顾问调用的工具 id、name、input、起止时间);plugin hooks 的 tool.check 事件新增 agentId 以区分子代理与主会话的权限检查;tool.check 钩子可读取组织要求的审批上限;插件钩子类型中新增 ThemeKey 和 Color 类型,便于编辑器列出主题配色。
Claude Code 发布 v2.1.289 版本,修复了复合 shell 命令嵌套部分拒绝规则被 mod 授权覆盖的问题、含大量未闭合标签或深层 ${ 替换的短代码块导致终端冻结的问题,以及 IDE 中通过 symlink @提及或选中的文件未触发读拒绝规则的问题(VSCode);同时回退了 v2.1.288 中导致频繁登出的 claude auth status 变更,并改进了插件中大文件的打开速度。
Anthropic 旗下 Claude Code 发布 v2.1.288 版本,新增 mods 可调用的 $.ui.selection() 接口以返回全屏模式下选中的文本,集成无 GitHub CLI 环境的 gh api,并为 Ctrl+C 清空提示符后通过上箭头恢复草稿(含粘贴文本和图片)增加了恢复逻辑,同时修复文件名、jq 过滤器和 GitHub 错误中的控制字符发送到终端等问题。
Claude Code 发布 v2.1.287 版本,新增 Claude Mods 机制,允许插件修改更深层行为;内置推出「You should know」模组,通过侧代理监听并标记用户或 Claude 可能遗漏的问题,可在 telemetry 开启的一方会话中用 `/plugin enable` 启用。代理视图新增 `n:` 过滤项匹配会话名与任务,并在折叠区域内展示匹配结果。OpenTelemetry 的 user_prompt 事件也补充了 prompt_text 字段。
新增权限请求堆叠时的计数提示(如“2 of 5”);在列表全屏模式下支持鼠标点击/悬停“N more”行跳转;修复 GCP/AWS 认证过期时多进程重复弹出登录浏览器的问题;修复并行工具调用场景下 claude --resume 与 --continue 偶发丢失会话轮次的问题。属于稳定性和交互细节改进。
Claude Code 发布 v2.1.285 版本,主要新增四项能力:CLAUDE_CODE_DISABLE_WEB_FETCH 环境变量用于关闭 WebFetch 工具、claude --desktop 命令可在当前目录或通过 --continue/--resume 打开 Claude 桌面应用、claude plugin configure 可查看与设置插件选项,以及在 claude plugin install --config 中支持 .= 语法以便安装时直接配置捆绑的 .mcpb MCP 服务器。属于面向开发者的常规功能迭代,提升了工作流集成与插件配置效率。
Claude Code 发布 v2.1.283 版本,新增 x-claude-code-prompt-id 网关提示请求头,配合 CLAUDE_CODE_GATEWAY_HINT_HEADERS=1 可让 LLM 网关按用户提示聚合请求;新增 availableModelsMatch(exact 模式)与 deniedModels 两个托管设置,用于精细控制可用模型列表与阻断特定模型。
Claude Code 发布 v2.1.282 版本,新增 maxProseWidth 设置以限制宽终端中文本宽度(表格与代码块保持原宽),并在启动提示、/status 和 claude doctor 中列出项目设置文件中被忽略或关闭遥测的变量;新增 allowClaudeInChromeWithManagedMcp 受管设置,允许 claude --chrome 与 exclusive managed-mcp.json 共存,Chrome 被阻断时错误信息会明确指明原因。
Hugging Face 发布了面向边缘设备的多模态开放 d1 决策模型。
College Planner将登陆ChatGPT for Teens,帮助学生管理大学申请。 ChatGPT面向青少年新增闪卡(flashcards)与测验(quizzes)功能。
Radisson 酒店集团与 Accenture 合作,基于 OpenAI 技术构建了一个 ChatGPT 插件。 该插件可帮助旅客在规划行程时查找、对比并预订酒店。
GPT-6 正在 ChatGPT 中面向全球推出,并搭载 Intelligent UI(智能界面) 该版本响应更快,并在界面中提供可视化与可交互的体验 以 ChatGPT 为载体面向全球推出 界面包含可视化与可交互元素
开始和国产Agent抢人,还拿到5亿美元新融资 不过,新团队的办公选址尚未公布(此前Manus在北京的办公场地位于epark海淀花园路社区的共享办公空间,仅有7个工位)。 只是,对于这家一年前曾大幅裁撤中国团队的公司来说,重起国内招聘,也意味着有些旧问题需要重新面对。 回头的浪子,必须面对一个现实隐忧 其国内团队原有约120名员工,其中40余名核心技术人员计划迁往新加坡,其余员工面临裁撤。 毕竟一家公司可以随着战略变化重新选择办公地点和业务重心,员工却需要面对具体的职业安排、生活成本和职业规划。 站在潜在候选人的角度,至少有以下几个问题值得考虑。 因此Manus这次想要聘请并留住核心人才,可能需要拿出比以往更多的诚意。 这些能力能否转化为国内用户愿意长期使用的产品,还需要后续验证。
PaperBenchX为代表的基准或许能更好地衡量AI的科研实力 数学至少还有最后一道防线:Lean。 需要特别注意的一点是,论文本身是公开的,Agent当然能看到论文里的结果数字,但很明显的是,这场考试考的不是「猜答案」,而是考验AI能不能重建一条科学上成立的流程,并自己跑出支撑那个结论的证据。 综上所述,单看貌似跑通的结果或得出的最终输出,是无法区分不同失败原因的。 另一些Agent则是因为缺少可信求解过程或代码有误无法完成重跑。 对结果的评测必须建立在重新生成的证据上,而不是Agent的自述上:删掉输出、断网、重跑、只认重放产物; 面对真实的科学问题,Agent需要自己理解研究目标,判断边界条件怎么设、色散怎么处理、哪些参数会真正影响结论,而不是简单按照README把代码运行一遍; Agent还需要读懂诊断信息,识别数值发散等异常,并判断什么时候需要调整参数、加密网格。 错误的物理模型、尚未收敛的仿真,甚至不合理的后处理,都可能得到一个「看起来正确」的结果。 因此,科学复现不像普通代码任务那样有一个简单的pass/fail标准,Agent还必须能够判断结果背后的科学过程是否可靠。 这三项恰好就是一个AI Scientist必须具备的基本功:读懂科学、执行科学、判断科学。 第一,Agent必须在真实的科学软件里工作,而不是换了一套学科数据的机器学习任务。 第二,Agent提交的产物必须能够完整重新复现。 在这个时间窗口里,Agent需要自己决定如何分配算力:什么时候检查中间结果,计算失败后是否需要重新运行,哪些参数值得调整,以及有限时间内应该把精力放在哪些环节。 一般的代码基准,跑一遍单元测试就知道对不对,但科学复现无法仅靠一个pass/fail判断。 证据能不能溯源:必须能够追溯到对应的计算过程。 比如,Agent声称某次仿真已经收敛,就需要提供相应的收敛记录; 如果报告了某个物理量,就需要能够找到生成这一结果的仿真输出以及后续分析过程。 对于需要结合领域知识进行判断的问题,则交给LLM评审。
Crowdstrike报告称,一名疑似中文使用者于2026年9月底至10月初利用AI驱动的开源渗透测试工具ARTEX攻击多家韩国金融机构,窃取大量数据。 Shinhan Bank超过25,000条包含姓名、联系方式、收入和信用额度的记录泄露。 攻击者使用AI驱动的开源渗透测试工具ARTEX。
2027年底实现“县县通” 当前,新能源汽车快充速度不断提升,但受限于磷酸铁锂电池化学特性,传统大功率快充易造成高温过热、电池损伤、寿命衰减等安全隐患,加上电容不够、补能布局不均等问题,无法满足用户“又快又安全又便捷”的多重补能需求。 一旦预判到电池温度有过热迹象,系统就会智能动态分配功率,确保电池平均温度不超过55℃,最高温度始终保持在65 ℃以下,为用户守住安全底线。 在安全的前提下,吉利智充进一步刷新了补能速度,首次实现了单枪峰值充电功率2.2兆瓦,再次刷新全行业充电功率的上限; 还有370毫米的神盾金砖电池超短刀系列,也把峰值充电倍率提高到6C,并率先搭载于全新吉利银河E5,实测常温下SOC从10%-70%仅需8分25秒,精准匹配不同用户、不同场景的用车需求。 全面的健康充电技术,让电池循环寿命提升20%以上,充分满足用户“既要快充又要电池健康”的补能需求。 全球首款量产20kW家用充电机器人——吉利智充机器人-20kW快充,用单目视觉加AI识别,能精确找到充电口位置,插枪全程不超过30秒; 还有原有的公充方案:吉利智充机器人-兆瓦极充,峰值功率达1.5兆瓦,满足不同用户需求,全程由机器人自动完成充电,无需人为操作。 到2027年底,吉利计划建成超2.2万座充电站,超10万把充电枪,其中吉利智充站超1.5万座,智充枪超5万把,率先在全国实现“县县通”。
Anthropic 发布了其最新模型 Claude Haiku 5.5。 官方将其称为迄今发布过的最便宜、最快速且能力最强的小模型。 官方称其运行成本平均比 Claude Haiku 4.5 低约 75%。
IT之家 10 月 8 日消息,小马智行与 Uber 今日宣布将在欧洲出行需求最旺盛的枢纽城市伦敦即将迎来第七代 Robotaxi,测试将在未来数周内启动。 IT之家注意到,小马智行今年 3 月与 Verne、Uber 达成合作,三方将率先在克罗地亚首都萨格勒布推出欧洲首个商业化 Robotaxi 服务。今年 8 月,该服务于萨格勒布已上线,打开 Uber 即可叫到。 2025 年 5 月,小马智行与 Uber 宣布达成战略合作,小马智行 Robotaxi 服务和车队在下半年接入 Uber 平台,共同加速自动驾驶技术商业化落地。 小马智行核心业务包括自动驾驶出行服务(Robotaxi)、自动驾驶卡车服务(Robotruck)以及智能解决方案三大板块,目前已在中国、美国、欧洲等多个市场推进商业化落地。 公司目标 2026 年底前将自动驾驶出租车车队规模扩大至 3,500 台以上 ,全球运营城市拓展至超过 20 座,预计自动驾驶出行服务收入将达到 2025 年水平的 3.5 倍,商业化进程将进一步加速。
IT之家 10 月 8 日消息,比亚迪今日宣布全尺寸闪充旗舰 SUV 大唐首次 OTA 开启推送,带来 28 项功能新增,19 项功能优化。 IT之家整理如下: 新增路面预瞄功能 新增挂档时前舱盖自动关闭功能 新增灵动掉头功能 新增全地形模式 新增蓝牙、云服务闭锁后下电功能 新增前备箱取物时悬架高度自动调节功能 新增内扣手开关一键开门功能 新增停车助手订单主动提醒功能 新增电话时允许导航播报开关 新增智慧寻车 新增绕行时间和绕行距离信息展示 新增后吸顶屏独立播放功能 新增纯麦户外音箱 S3 接入 IoT 生态 新增老板键功能 新增车机热点共享及部分手车互联功能 新增一键唤醒“KFC”点餐应用及语音助手 新增快捷指令或场景模式调用 新增电动门控制 新增迪迪虾 新增迪迪虾“人设”功能 新增生态智能体服务 新增车控智能体服务 新增迪迪虾“AI 空间”功能 新增迪迪虾“技能”功能 新增迪迪虾“记忆”功能 新增导航智能体服务 新增用车问答智能体服务 据IT之家此前报道, 比亚迪大唐 EV 于 6 月 17 日上市 , 官方指导价 23.99 万元起 ,拥有第二代刀片电池、全域 1000V 高压架构等配置。
工业AI正在进入新阶段,预测分析及专业化应用之后,基础模型、物理AI与智能体AI的进展使得工业环境中更复杂任务的自动化成为可能。 与纯数字领域运行的AI不同,工业AI可直接与物理系统交互。
ts-rust(tsc-rs)将 microsoft/TypeScript(Go 实现)的编译器、类型检查器和语言服务器移植为 Rust,作者称全部代码由 LLM 编写,本人未读过代码。 tsc-rs 内置了 Effect 语言服务诊断(代码 377xxx),因此 Effect 项目不需要第二个编译器。 它们仅在 tsconfig 含有该插件时运行,与 @effect/language-service 一样: 语言服务器的编辑器功能(快速修复、重构、悬停、补全)尚未移植。 要进行比较,请使用 [email protected] ,而不是 7.0.x 或 @typescript/native-preview 。 预览包是在 CI 中构建的,未启用 PGO 和 BOLT,因此比上述实测构建更慢。 在 120 个开源仓库上,命令行输出与 Go 版本的差异仅在于下述问题,以及 Go 自身输出在多次运行间发生变化之处。 当你不需要 Effect 诊断时, bun check 是最快的。 它没有这些诊断,因此 Effect 项目需要第二遍检查。
IT之家 10 月 8 日消息,Manus 母公司蝴蝶效应今日宣布完成 超过 5 亿美元 (IT之家注:现汇率约合 33.56 亿元人民币) 新一轮融资。 本轮融资由博裕投资、IDG 资本领投, 老股东腾讯、红杉中国、真格基金继续加持 。 2025 年 3 月,蝴蝶效应公司推出 Manus,曾在市场一夜爆火。然而,当年 6 月,Manus 企业总部迁至新加坡,大幅裁减国内团队,彻底停止中国境内服务与运营。作为一家依靠中国工程师和基础设施环境发展起来的 AI 公司,Manus 在获得美国投资后突然与中国元素进行“切割”,引发争议。 据IT之家今年 4 月报道,外商投资安全审查工作机制办公室(国家发展改革委)依法依规 对外资收购 Manus 项目作出禁止投资决定 ,要求当事人撤销该收购交易。央视新闻对此解读称, 禁止的是企业“洗澡式出海”的不合规做法 。 据彭博社 7 月报道,在开启新一轮融资之前,Manus 创始团队连同原有投资方腾讯、HSG、真格基金,按照 20 亿美元 (现汇率约合 134.25 亿元人民币) 的估值,向 Meta 回购了全部股份。腾讯接手了原先 Benchmark 所持有的股权,一跃成为 Manus 最大的外部机构投资方;Benchmark 则实现数倍收益后退出。 监管意见是本次回购必须严格还原至收购发
阿里董事会主席蔡崇信在意大利都灵Wave by Vento大会上表示,欧洲要在技术上摆脱对中美的依赖,最佳选择是开源AI。 蔡崇信认为一旦形势变化,对方可能直接切断技术供应,因此欧洲不能完全依赖他国技术。 蔡崇信看好欧洲涌现的一批专门提供云计算服务、运营配备AI芯片数据中心的新型云服务商。 蔡崇信认为欧洲必须建设自己的算力基础设施,把模型训练和推理放在欧洲本地的基础设施上进行。 蔡崇信指出中美实验室争相招揽AI研究人员,但欧洲尚未充分发挥这些人才的作用,应利用专有工业数据训练模型形成优势。 蔡崇信表示中国侧重开源模型和公开研究成果以推动全球采用,而OpenAI、Anthropic等美国企业主要提供专有模型,且不再发表论文。
作者确认 banked reset 已到账所有账户,并转引 Day 3 动态称 Codex 与 ChatGPT Work 合计活跃用户达到 4000 万新高,其中提到 GPT-6 已在 Chat 中上线。 Codex 与 ChatGPT Work 活跃用户达 4000 万新高,付费账户重置已全部到账 Loading a banked reset in everyone's paid accounts.
世嘉高级执行官兼副首席商务官斋藤刚表示,公司将AI用于提高部分业务效率和构思商业方案,但在游戏开发中对使用AI非常谨慎,不会将游戏创意工作交给AI。 世嘉成立了负责开发工具、制定使用规范和审核Steam商店页面的“生成式AI委员会”。 据IT之家了解,今年早些时候,世嘉证实尚未推出的《疯狂出租车:极速环游》开发初期的调研中使用了生成式AI,但游戏美术素材的实际制作完全没有使用AI。
大模型原生智能体手机STEPX Neo将于10月13日正式发布。
Anthropic 发布新模型,在基准跑分上超越 OpenAI 的 GPT-6 Luna。 新模型价格比梁文谷还便宜。
Nous Research以15亿美元估值完成9000万美元B轮融资。 本轮融资由Robot Ventures领投,Nvidia、Union Square Ventures、Menlo Ventures、Samsung和1789 Capital等参与。 据该公司估算,开源Hermes Agent已被克隆超过2400万次,占全球AI token用量的约2.5%。 新资金将支持Nous Research面向企业市场推出Hermes for Businesses,使企业能够部署处理多步工作流并保持数据私密安全的定制化AI智能体。
Claude Code 发布 v2.1.293,新增 Claude Haiku 5.5(claude-haiku-5-5)作为 Anthropic API 默认 Haiku 模型,支持 1M 上下文,价格为 $0.10/$0.50 每百万 token(超 100K 提示为 $0.50/$2.50)。
Hacker News 热议 · 590 分 · 283 条评论
IT之家 10 月 8 日消息,微软设计(Microsoft Design)博客于 10 月 5 日发布博文, 介绍了新版 Copilot 图标的设计过程,将原有静态标识重构为由两个方形组成的动态系统。 新版 Copilot 图标由两个独立方形构成,二者可改变位置并共同形成完整轮廓。关于本次调整原因,微软设计团队表示 Copilot 的使用方式持续变化,原有静态图标难以传递处理状态,因此团队希望让图标参与产品交互。 新版图标以矩形作为基础形态,设计团队测试了不同的比例、角度与间距,最终保留两种既能独立识别、又能组合成整体的形式。IT之家附上相关视频如下: 颜色方面,Copilot 图标继续沿用原有渐变关系。颜色可沿曲线变化,在两个形态之间移动并形成层次。设计团队还在屏幕、印刷品及实体材料上测试了不同配色方案。 动态交互方面,微软建立了统一的动态语言,3 种动作均由两个形态相互移动完成,随后重新组合为一个整体: 第一种动作用于表示“思考”,对应 Copilot 处理用户请求。 第二种动作用于表示“规划”,对应系统整理后续步骤。 第三种动作用于表示“检索”,对应 Copilot 从文件和工作内容中提取相关信息。
IT之家 10 月 8 日消息,太平洋夏令时 10 月 7 日 11 点(北京时间 10 月 8 日凌晨 2 点)举办的活动中,华硕推出 ProArt RTX Spark AI PC 系列, 涵盖 ProArt P16、ProArt P14 笔记本及 ProArt GR1X 迷你主机,均搭载英伟达 RTX Spark 超级芯片。 图源:华硕官网 三款设备均基于 NVIDIA RTX Spark 平台,最高提供 1 PFLOP(FP4)AI 算力与最高 128GB 统一内存,可在本机直接运行大型语言模型、复杂 3D 渲染、内容生成与 AI Agents 工作流,减少对云端订阅与 Token 限制的依赖。 ProArt P16 机身厚 12.9mm、重约 1.77kg,采用 16 英寸屏幕,ΔE<1 色准,支持 4K 120Hz、G‑SYNC,峰值亮度最高 1,600 尼特,适合高动态范围预览与剪辑。 P16 最高配 128GB 统一内存;内置 99.9Wh 大电池,面向大型模型推理、复杂 3D 场景、专业影音工作流,24GB 内存 +512GB 存储售价为 2,799.99 美元 (IT之家注:现汇率约合 18,793 元人民币) 。
IT之家 10 月 8 日消息,Anthropic 昨日(10 月 7 日)发布博文,宣布推出 Claude Haiku 5.5 模型,称其为目前速度最快、最便宜、功能最强的 Haiku 系列小型模型。 定价方面,IT之家援引博文介绍,附上售价信息如下: 每 100 万 Token 的价格 Haiku 5.5(提示词不超过/超过 100k) Haiku 4.5 Sonnet 5.5 缓存读取 0.01 美元 (IT之家注:现汇率约合 0.067 元人民币) /0.05 美元 (现汇率约合 0.34 元人民币) 0.10 美元 (现汇率约合 0.67 元人民币) 0.10 美元 (现汇率约合 0.67 元人民币) 缓存写入 0.125 美元 (现汇率约合 0.84 元人民币) /0.625 美元 (现汇率约合 4.2 元人民币) 1.25 美元 (现汇率约合 8.4 元人民币) 2.50 美元 (现汇率约合 16.8 元人民币) 输入 Token 0.10 美元 (现汇率约合 0.67 元人民币) /0.50 美元 (现汇率约合 3.4 元人民币) 1.00 美元 (现汇率约合 6.7 元人民币) 2.00 美元 (现汇率约合 13.4 元人民币) 输出 Token 0.50 美元 (现汇率约合 3.4 元人民币) /2.50 美元 (现汇率约合 16.8 元人民币) 5.00 美元
Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis 智能指数得 43 分,较上一代 Haiku 一年内提升 26 分。
在旧金山举行的微软活动上,黄仁勋与纳德拉阐述了NVIDIA和微软正在为运行在Windows PC上的AI智能体共同设计硬件和软件。 黄仁勋表示NVIDIA因Windows而创立,现在AI智能体正在进入Windows。
NVIDIA与Microsoft在旧金山Windows AI和Surface活动上宣布为Windows PC引入AI Agent硬件与软件。 发布的产品包括RTX Spark和DGX Station for Windows。
Cursor 公布 Claude Haiku 5.5 定价为每 M 输入 token $0.10、输出 token $0.50,输入超过 100k token 时为 $0.50/M 和 $2.50/M。Claude Sonnet 5.5 缓存读取价格也从 $0.20/M 降至 $0.10/M,用户可在 cursor.com/evals 上通过 CursorBench 对比 Haiku 5.5 的表现。
《怪物史莱克》编剧加入了某AI影视公司。 该公司的视频模型在全球范围内排名第二。
Brandi AI CEO Leah Nurik 将参加中大西洋 MarCom Summit 的专题讨论。
Prime Video 提供30张免费门票,让自由职业者参加 AI 创意峰会(AI Creative Summit)。
PayPal Developer 团队为一场为期 6 周的黑客松在幕后提供支持。 该 PayPal AI 黑客松提供超过 $60K 的现金和奖品。 组织方发布了一段 kickoff 会议视频,指导参与者从零开始搭建 PayPal 的 Sandbox 和 AI Toolkit。
IT之家 10 月 8 日消息,阶跃终端官微今天(8 日)上午宣布,阶跃终端首款大模型原生智能体手机 STEPX Neo 将于 10 月 13 日 19 时正式发布。 就在不久前的 9 月 23 日,阶跃终端 AI 手机端侧生成式 AI 服务 通过网信部门备案 。 值得一提的是,今年 7 月,阶跃终端首款智能体手机 STEPX Neo 亮相 2026 世界人工智能大会,IT之家现场实拍如下图: 这台手机戴着橙黄色的保护壳, 运行智能体原生系统 Step AOS 。其桌面 UI 采用近年来较为流行的圆角矩形图标,部分第三方应用的图标带有重绘版本,顶部的状态栏还可以显示 AI 的工作状态。 据现场工作人员演示, 这款手机的 Amoo 助手可以与飞书等 App 进行深度联动 。例如用户可以对助手说出“帮我处理一下明天汇报的事情”或“制作 PPT”等请求,然后 Amoo 就会读取飞书等应用的日历、群消息并判断修改 PPT 等需求。 随后,该助理会向用户请求文档修改权限, 点击允许后就能按用户风格生成 PPT 、 将汇报改期等事件同步到其他群聊 。当事件处理完成后,用户可点击 Amoo App 的按钮前往飞书,查看具体成果。
诺贝尔化学奖揭晓。 一位95岁的法国教授获得该奖,圆了迟到25年的梦想。
Creatio发布了Bank.AI峰会的会议日程。 峰会嘉宾包括研究分析师Alyson Clarke。
哈萨克斯坦举办的AI黑客松刷新了吉尼斯世界纪录的参赛人数。
2026东北亚(沈阳)人才交流大会暨人工智能赋能产业发展大会即将启幕 神州学人 2026东北亚(沈阳)人才交流大会暨人工智能赋能产业发展大会即将启幕 - 神州学人
2026物理AI与世界模型大会将于10月19日至22日在南京举办 ThePaper.cn 2026物理AI与世界模型大会将于10月19日至22日在南京举办 - ThePaper.cn
48小时极限创想!
Akarsh Kumar尝试用大语言模型来进化互相竞争的小型汇编程序,这套玩法叫做 Core War。 Akarsh Kumar表示,零样本让LLM直接生成Core War汇编效果很差,但加入进化机制和验证器后效果变得很好。
这是一期播客/视频节目,主题为AI时代的超级个体,讨论如何把热爱做成可持续的事业。 节目中晓辉博士与北辰青年创始人兼CEO宋超对谈,回顾其创业十年经历,包括从帮助年轻人探索人生的公益项目,到热闹却不赚钱的生意,再到重新面对经营、收费和交付。 节目强调,有了AI一个人能做的事更多,但找到真实需求、让人付费和把服务交付好,仍需自己去探索。
Fireship 视频介绍 Mistral、Reflection AI 和 Moonshot 在开源权重模型竞赛中的新进展。 视频开头提及一家价值 63 亿美元的开放权重模型在相关对比中被一家法国公司超越。
视频标题为《How to Find Nano Banana 2.1 in Google AI Studio》
视频主题为2026年诺贝尔化学奖,介绍不对称有机合成及分子的"左右手"概念。 视频由"三万代班"代班创作,属于纯AI生成,用于测试AI生成视频效果。 创作者欢迎观众在评论区多提建议,并表示将持续迭代。
视频由 Two Minute Papers 发布,主题为 DeepMind 的新 AI 破解生命密码 AlphaGenome Atlas 已开放,可访问 deepmind.google/blog 页面查看 发布者感谢 Google DeepMind 的邀请
SIGGRAPH 2026技术论文奖揭晓,包含最佳论文、荣誉提名与时间检验奖三类奖项。
在已训练检查点之上用可验证奖励进行强化学习(RLVR)时,加入强新颖性激励以鼓励模型生成超出训练数据的新推理策略,实际效果有限,甚至可能降低模型质量。 可验证奖励仅监督模型一小部分知识与行为,由此造成的质量退化难以恢复。
该研究主张可通过观看视频来学习ARC类抽象推理任务。
论文提出Tetris3D,一种面向单图3D场景重建的生成框架,目标是恢复出物理与几何上彼此协调一致的物体组成场景。 作者指出,现有方法通常独立生成物体,或仅隐式耦合它们,对相邻交互物体之间的细粒度空间兼容性指导有限。 其做法是显式地将每个物体的生成条件化于周围物体的几何及其物理关系,从而引导其形状与位姿保持几何与物理上的合理。
论文提出 GRACE,针对高效视频扩散模型设计生成感知的高压缩率视频自编码器。 高度压缩的视频自编码器通过大幅减少 DiT 所需 token 数来加速视频扩散模型。 高压缩率会降低重建质量,需要更多通道来恢复,而这已知会拖慢 DiT 的收敛,使此类自编码器难以训练。 压缩后的潜在空间与 DiT 原始训练时的不同,预训练 DiT 必须从头重新训练或以较大成本进行适配。
条件记忆架构(如DeepSeek Engram)通过输入n-gram查找已学习的嵌入,以有限的额外计算扩展大语言模型的容量。 该架构在模型扩展之外,已展示出将事实知识存储与通用计算解耦的潜力,可在保持Transformer主干不变的情况下更新事实知识。
该论文提出 Long-WAM,一个面向实时控制约束的因果世界-动作模型上下文扩展框架。 核心发现是:拥有更长历史并不等于真正用好它;只有当视频基础模型以自回归方式预训练时,更长的历史才带来显著收益。 方法上先从机器人视频和第一人称视频中无动作标签地学习因果预测,再在世界-动作阶段保留这种历史到未来的结构。 该发现成立的前提是视频基础模型以自回归方式预训练。
本文研究去中心化随机梯度下降(SGD)在重尾噪声下的收敛性。 重尾噪声在现代机器学习中广泛存在,促使使用梯度裁剪与归一化等方法。 在去中心化设置中,对局部梯度施加非线性变换同时影响优化与一致性,相关理论理解较少。 现有去中心化非凸优化工作中,裁剪所得速率次优,归一化需局部动量或小批量才能收敛。
该文探讨当大型语言模型对问题进行“推理”时,其解决问题的方式可能仍与推理文本所示不同。
Opus 5.5 agents 发现了两种室温磁性半导体候选材料
Google Research 发布研究,探讨模型表现提升是否必然带来代理在多步骤任务中可靠性的同步改善。
Agent Lightning v1.0是一个约3500行的轻量级智能体强化学习框架 Agent Lightning可将已有智能体接入强化学习训练,无需重建即可改进 训练AI智能体使用强化学习面临挑战,因为其工具、上下文和决策由复杂框架管理
NVIDIA的Nemotron模型通过微调在国际信息学奥林匹克竞赛(IOI)和国际数学奥林匹克竞赛(IMO)上达到金牌级成绩。 这是同一模型家族在两项赛事中均取得金牌级别的结果。
新闻AI进行情感包装会改变读者对一则新闻的感受,影响他们是否接近、信任和分享该新闻。 论文呼吁AI研究人员和行为科学研究人员合作,测试情感包装是否有助于准确信息触达读者,以及是否会加剧分歧。
MIT科技评论与Aventine基金会合作发布关于人形机器人的报道。 报道指出人工智能在机器人领域的突破短期内不会改变人们的生活。
本·阿弗莱克表示,他自幼对计算机感兴趣,并在电影从模拟胶片转向数字的过程中对相关技术兴趣加深。 他指出,多年来视觉特效工作流已包含机器学习,并提到使用卷积神经网络(作为 Transformer 的前身)以及“张量”(即视觉图像的数字转换)等概念。
Anthropic 推出了新款快速低成本模型 Claude Haiku 5.5。 Claude Haiku 4.5 大约一年前发布,输入 1 美元/百万 tokens、输出 5 美元/百万 tokens,价格是上个月发布的 OpenAI GPT-6 Luna 的 10 倍。 在最多 100,000 tokens 范围内,新版 Haiku 与 GPT-6 Luna 定价相同,为 0.10 美元/0.50 美元(输入/输出,每百万 tokens)。 超过 100,000 tokens 后,Haiku 价格上调 5 倍至 0.50 美元/2.50 美元;而 Luna 在 272,000 tokens 时才提价,且仅升至 0.20 美元/0.75 美元。
该教程仅需Python基础,从0开始构建具身智能机器人。 教程从0逐步构建VLA、OpenVLA、SmolVLA、Pi0,深入理解具身智能。 该教程的学习门槛是仅需具备Python基础。
文章探讨大语言模型兴起后出现的新型数据科学岗位。 文章聚焦于AI工程师、应用科学家、前置部署工程师三类角色。 文章发布于Towards Data Science。
该项目是一个繁中、英文、简中三语版本的Agentic AI学习路线图,面向agentic AI领域。 内容从LLM基础知识延伸到多智能体系统(multi-agent systems)。 项目收录了240多个经过筛选的学习资源,并配有动手实践示例。
教程详细讲解如何使用QLoRA方法对Gemma 4模型进行微调,以构建自动化客服系统。内容涵盖LoRA与QLoRA原理、开发环境配置、数据准备及基于Bitext客服数据集的监督微调全流程,适合希望掌握大模型参数高效微调技术的开发者学习。
来自DeepLearning.AI的课程,教你将生成式AI原型转化为自动化流水线,基于Apache Airflow实现任务调度与编排。适合已掌握LLM应用基础、希望将原型工程化落地的开发者,学习后可掌握工作流自动化、任务依赖管理与生产级AI应用部署能力。
这是一个面向中国学习者的 Jev 入门教程,从 Jupyter Notebook 实验入手展开教学。 教程覆盖三种问题原语、18 篇实战配方、语音智能家居、模型评测与本地微调等内容。 教程目标是让学习者掌握 System One 判断模型的开发范式。
本文探讨一个构建良好的营销组合模型(MMM)仍可能出错的原因:模型所学习的支出数据本身并不包含它所需的信息。 文章通过测试检验改变支出时间(而非支出金额)能否修复该问题。
该项目是 E2B 使用示例的代码合集,标签涵盖 agent、ai-agents 与 code-interpreter。
本文系统讲解检索增强生成(RAG)与微调(Fine-Tuning)在机制层面的差异,分析两种技术各自的适用场景,并给出在不同需求下选择何种方案作为领域适配工具的判断依据。适合希望为大语言模型接入私有知识库或定制专业能力的开发者与从业者阅读。
这是一门关于 AI 代码审查的实操课程。随着 AI 生成的代码量远超人工审查能力,课程聚焦如何让 AI 审查真正有效:涵盖尽早发起审查、为审查者提供恰当上下文等关键实践,并带领学习者亲手构建一个审查代理,理解上下文如何决定审查的可靠性。适合想要提升代码质量与开发效率的工程师学习。
《Easy Data x AI》是一门面向所有 AI 爱好者的数据与 AI 基础入门课程。 课程采用双轨学习路径,从数据驱动视角学习构建 AI Agent。 课程面向所有 AI 爱好者,属于数据与 AI 基础入门级别。
该项目是一份 Claude Code 使用指南,内容涵盖智能体工作流、hooks、skills、MCP 服务器、测验以及生产可用模板。
教你构建一个 LLM 应用,通过 Box 的 MCP 服务器发现文件并提取文本内容,再将其改造为使用 A2A 协议通信的多智能体系统。课程聚焦 MCP 工具调用与多 Agent 协作两个核心概念,适合想上手 MCP 协议和多 Agent 架构的开发者。