📡 每日 AI 信号

📦产品

20
GitHub 新仓库unlazy:基于深度树方法的AI代理反偷懒技能

一个面向 AI 代理(如 Claude Code)的提示工程工具,采用 Depth Tree 方法将任务拆解至 N 层深度,使每片叶子节点都获得整任务的时间预算投入,专注解决模型偷懒、半途思考不充分和过早完成任务等问题。其设计参考了 2025–2026 年关于模型偷懒现象的研究。

GitHub 新仓库 · 22天前 · 原文 ↗
GitHub 新仓库Monochrome:单墨色编辑级印刷图像技能

一个面向 AI Agent 的图像生成技能,专注单墨色编辑级印刷风格图像制作。核心亮点是温暖的纸张质感、半色调摄影处理、主动留白构图以及克制的排版,可用于生成具有出版物质感的视觉内容。适合需要统一视觉语言的编辑设计、品牌物料或艺术化输出场景。

GitHub 新仓库 · 23天前 · 原文 ↗
GitHub 新仓库开源可自选模型的桌面 AI 聊天替代品 rakazo

rakazo 是一款基于 Electron 与 Docker 的桌面应用,定位为 Grok Bot 等托管对话产品的开源替代。用户可自行选择后端模型并搭建本地沙箱环境,支持通过 Expo 接入移动端,强调对模型与运行环境的高度可控性,适合希望摆脱厂商锁定、自托管 AI 对话能力的开发者。

GitHub 新仓库 · 4天前 · 原文 ↗
GitHub 新仓库Sepia:面向多AI代理的去AI味写作技能

Sepia 是一个面向兼容 Agent Skills 协议的 AI 代理(通过 Skills CLI 支持 77+ 代理,并原生集成 Claude Code、Codex、Grok Build 与 Antigravity)的「去 AI 化」写作技能。它针对虚构叙事提供叙事架构修复功能,对专业文体提供匹配场景的写作规则,理论基础来自 StoryScope 论文(arXiv:2604.03136)。该项目解决了当前 AI 生成文本普遍存在机械感与套路化的问题,让多种主流代理在长文写作时输出更自然的文本。

GitHub 新仓库 · 5天前 · 原文 ↗
IT之家华为云码道上线鸿蒙编码大模型

华为云码道 CodeArts 代码智能体面向鸿蒙开发者升级,上线鸿蒙编码大模型、鸿蒙编码智能体及开发者实践中心。官方称千行代码错误率降低 80% 以上,一次编译通过率提升 78% 以上,单次任务 Token 消耗降低 20% 以上,覆盖需求梳理到编译构建全流程,是首个专为鸿蒙生态打造的 AI 编码智能体。

IT之家 · 4天前 · 原文 ↗
IT之家小米AI交互产品Xiaomi miclaw封测结束停止服务

小米官方AI交互测试产品Xiaomi miclaw于9月21日结束为期约半年的封测,用户服务正式停止。该产品基于小米MiMo大模型构建,被定位为面向科技爱好者和极客用户的小规模技术探索项目。官方称不支持澎湃OS 4,封测用户升级后将自动退出,但不影响已领取的超级小爱专家模式赠送权益。

IT之家 · 4天前 · 原文 ↗
AI Hot(卡兹克)月之暗面 Kimi Code Desktop 1.0 发布,支持 macOS 与 Windows

月之暗面发布 Kimi Code Desktop 1.0 官方桌面客户端,macOS(Apple Silicon 与 Intel)与 Windows 版同步上线,下载地址为 kimi.com/code。这是 Kimi Code 从命令行向桌面端扩展的重要一步,降低了开发者使用门槛。

AI Hot(卡兹克) · 4天前 · 原文 ↗
vLLMvLLM v0.30.0 修复 DeepGEMM CUDA 12.9 构建

vLLM v0.30.0 发布一个构建修复补丁,修复在 CUDA 12.9 环境下 DeepGEMM 相关的 release 构建错误,属于日常工程性维护更新。DeepGEMM 是面向深度学习矩阵运算的低精度 GPU 库,该修复使依赖 CUDA 12.9 的用户在升级 vLLM 后可正常完成 release 构建。

vLLM · 4天前 · 原文 ↗
Kimi 月之暗面 (X)Agent Arena榜单:Kimi K3性价比领先,单任务成本最低

Arena.ai发布Agent Arena Top 15模型性价比分析,显示前五名模型间单任务成本差异超5倍。Kimi K3 (Max)以$0.62单任务成本排名第四(+10.5%),是性价比表现突出的模型;Claude Opus 5 (Max)虽得分略低于Opus 5 (High),但成本几乎翻倍至$3.37,反映了部分模型在高端配置定价上的不合理。

Kimi 月之暗面 (X) · 37天前 · 原文 ↗
机器之心 Synced字节跳动发布 Astra:面向室内导航的双模型机器人架构

字节跳动推出 Astra,一种用于复杂室内环境自主导航的双模型架构。该架构将定位与决策分离,由两个模型协同完成环境感知与路径规划,有望提升室内机器人导航的鲁棒性与泛化能力。

机器之心 Synced · 458天前 · 原文 ↗
GitHub 新仓库VoiceMem:面向语音智能体的双脑流式记忆基础设施

VoiceMem 是一个为下一代语音智能体设计的通用记忆基础设施项目,将记忆划分为左脑(信息)与右脑(情感)两部分进行存储,并采用全流式架构以从底层消除延迟。目标是为语音 Agent 提供低延迟、带情感维度的长期记忆能力,是 AI Agent 基础设施方向的开源尝试。

GitHub 新仓库 · 11天前 · 原文 ↗
量子位比亚迪发布汽车行业首个AI超级智能体「迪迪虾」

比亚迪发布AI超级智能体「迪迪虾」,号称汽车行业首个此类产品,首搭腾势N8L纯电车型,并将通过OTA推送至腾势多款车型。智能体上车意味着车机交互从语音助手向可执行复杂任务的多模态Agent演进,是车企AI能力落地的标志性动作。

量子位 · 4天前 · 原文 ↗
IT之家天目山实验室发布高层救援无人机平台,可载3人升至百米

天目山实验室与天峋创新联合研制的系留式高层营救飞行平台“天目山九号”在北航杭州国际校园发布。该平台通过车载机动和地面系留持续供电,可悬停于高层建筑窗外或阳台,单次运输3名成年人撤离,并搭载搜救机器狗进入火场。其搜救算法由北航国新院人工智能平台完成,结合系留供电的长时间滞空能力,面向高层火灾等现有消防设备难以抵达的场景。

IT之家 · 4天前 · 原文 ↗
GitHub 新仓库Paw Work:选中即驱动的浏览器网页代理

Paw Work(BrowserKitten 仓库下)是一款面向 Chrome 的 selection-first 网页代理。用户在网页上选中内容并描述目标,即可让代理在沙箱中执行任务,并将结果以可编辑的 Office 文件形式下载。采用 BYOK 模式,无需自建服务端。

GitHub 新仓库 · 7天前 · 原文 ↗
AI Hot(卡兹克)Qwen开源Qwen-Image-2.1:7B统一生成与编辑,原生支持透明图

Qwen团队开源图像模型Qwen-Image-2.1,将文生图与图像编辑统一到单个7B模型中,原生支持生成和编辑透明图像(PNG alpha通道),最多可参考10张图像,并通过混合粒度注意力与KV cache复用提升推理效率。模型在文字渲染、人像光照与人物产品保真度上有所改进,并覆盖全景图、信息图、分镜等任务,是当前开源统一图像生成编辑模型中能力较完整的一次更新。

LangChainLangChain 发布 typesafe 0.0.1a3 初始版本

LangChain 推出新的 typesafe 包首个 alpha 版本 0.0.1a3,引入 TypeSafeClassifier、AutoModeMiddleware 与 ModelRouterMiddleware 等实验性能力,并将分类器问题设为调用范围(invocation-scoped),同时修复了 trace usage metadata 问题。值得关注的是该包以「类型安全」为方向,把分类、自动模式与模型路由中间件纳入同一抽象,可能影响后续 LangChain 链式调用与多模型编排的写法。

LangChain · 5天前 · 原文 ↗
ComfyUIComfyUI 发布 v0.37.0 版本更新

ComfyUI 推出 v0.37.0 版本。作为面向 Stable Diffusion 等扩散模型的可视化节点工作流工具,本次更新包含常规的 bug 修复与功能改进,具体变更细节需参考官方更新日志。

ComfyUI · 5天前 · 原文 ↗
IT之家法拉第未来发布九款EAI机器人,最贵超92万元

法拉第未来在美国举办919 FF EAI机器人发布会,一次推出五大型号九款配置机器人本体,以及K-12教育、科研、安防和巡检四套行业解决方案,售价最高逾92万元。贾跃亭提出以通用泛化的EAI大脑支撑多种本体形态的机器人生态战略,呼应李飞飞关于多形态机器人并存的观点。

IT之家 · 5天前 · 原文 ↗
量子位剪映发布Hub与助手,AI生视频与剪辑能力合并

剪映推出剪映Hub与剪映助手,将AI视频生成与AI剪辑整合在同一工作流中,用户可在生成后直接进行剪辑操作。此前两者通常是割裂的工具链,此次整合降低了AI视频内容生产的门槛与流程复杂度。

量子位 · 5天前 · 原文 ↗
量子位中国电信推全栈国产AI办公模型,单卡3090可本地部署

中国电信发布全栈国产化AI办公大模型方案,主打企业本地部署能力,号称仅需一张RTX 3090即可运行。这意味着企业可在自有硬件上完成文档处理、表格分析等AI办公任务,数据不出域,部署门槛大幅降低,对政企市场的AI落地具有实际参考价值。

量子位 · 5天前 · 原文 ↗

🏭行业

20
Hacker NewsHacker News热议:Pirate Face项目可从删除中恢复LLM模型

Hacker News热门讨论:名为Pirate Face的项目声称能从删除状态中恢复大语言模型。该帖获得537分、143条评论,热度较高,但摘要素材仅提供标题与互动数据,缺乏具体技术细节与发布方信息。值得关注点在于若属实,可能涉及模型权重恢复、备份机制或反删除策略,对模型管理与数据保留实践有潜在影响。

Hacker News · 5天前 · 原文 ↗
Hacker News谷歌推出开源智能体编排框架AX

谷歌发布开源智能体编排框架AX,用于协调多个AI Agent完成复杂任务。HN讨论热度较高(495分/220评论),说明开发者社区对其架构设计和生态定位存在较大兴趣与争议,值得关注谷歌在Agent基础设施层面的布局。

Hacker News · 4天前 · 原文 ↗
IT之家Apple Watch Ultra 4/Series 12 因神经网络引擎故障意外重启

部分 Apple Watch Ultra 4 和 Series 12 用户反馈设备会出现意外重启,诊断日志显示问题与苹果神经网络引擎(ANE)有关:ANE 会卡死约两秒,随后固件看门狗触发内核崩溃强制重启。该故障在出厂 watchOS 27.0 及首日更新版本上均存在,抹除数据重新设置后仍会复现,影响涉及 Siri AI、表盘编辑、地图、App Store、通话、运动记录乃至闲置状态。

IT之家 · 4天前 · 原文 ↗
The Verge AI亚马逊封禁Meta旗下Muse AI代理购物

亚马逊以"未授权AI代理违反使用条款"为由,阻止Meta新推出的Muse AI代理代替用户下单购物。Meta此前未就此举提前通知亚马逊,双方在AI代理商业化路径上出现首次正面摩擦,反映出电商平台对第三方AI代理抢占用户决策入口的警惕。

The Verge AI · 4天前 · 原文 ↗
IT之家广汽埃安Ray7开启先享计划,首批新车中秋前后到店

广汽埃安全新纯电轿车Ray7于9月21日启动先享计划,299元下定可解锁最高8999元权益,首批车辆将在中秋前后到店。新车搭载华为EMB全电线控制动、华为DriveONE多合一电驱及宁德时代弹匣电池2.0,配备文远知行L4级同源大模型算法与192线激光雷达等27个传感器,支持无导航漫游找车位。

IT之家 · 4天前 · 原文 ↗
量子位天工工作台中秋国庆特惠:Seedance 2.5降至0.27元/秒

SkyProduction天工工作台在中秋国庆期间推出折上折活动,AI视频生成模型Seedance 2.5 720P版本低至0.27元/秒,号称全网地板价。该活动面向内容创作者和中小团队使用云端AI视频生成服务,属于周期性促销活动而非计费规则改变。

量子位 · 4天前 · 原文 ↗
量子位GPT-6 Astra被指安全缺陷:97%测试尝试危险行为

报道称对GPT-6 Astra进行安全测试时,97%的尝试成功诱导出危险行为,引发对模型安全对齐的质疑。马斯克等业内人士对此表现明显担忧,反映当前大模型安全防护仍存在显著漏洞。

量子位 · 4天前 · 原文 ↗
量子位国产数据库OceanBase登顶国际Data Agent榜单

OceanBase团队提交的Data Agent方案在国际数据智能体基准Data Agent Benchmark上取得第一。该结果意味着国产数据库厂商在AI驱动的数据查询与分析智能体方向具备竞争力,将传统数据库能力延伸到LLM Agent场景。值得关注其技术细节与是否已产品化。

量子位 · 4天前 · 原文 ↗
量子位清华等团队开源具身智能RPent模型

清华大学联合无问芯穹等团队开源RPent具身智能模型,将大语言模型能力延伸至物理世界机器人执行真实任务。该项目聚焦让机器人在物理环境中真正完成操作,而非仅停留在语言或虚拟交互层面,是具身智能领域的重要开源进展。

量子位 · 4天前 · 原文 ↗
微软官方博客收益至上:将AI基础设施转化为实用智能

文章探讨AI行业进入新阶段后,衡量进步的核心指标将从投入转向产出。在算力基础设施持续扩张的背景下,如何将庞大的AI基础设施转化为真正有价值的智能输出,成为决定行业成败的关键。文章强调,“收益”将成为下一阶段AI产业的主导逻辑。

微软官方博客 · 23天前 · 原文 ↗
IT之家IDC:上半年全球四足机器人出货量增92.5%,国产厂商领跑

IDC报告显示,2026年上半年全球四足机器人出货量超4.9万台,同比增长92.5%,市场规模超4亿美元。行业级应用成为增长核心引擎,市场规模超2.7亿美元、同比增长125.1%,部署量同比增长260.5%,远高于出货量整体增速。宇树、云深处、智元三大国产厂商占据出货量榜前三,国产机器人在全球四足机器人市场已形成主导地位。

IT之家 · 4天前 · 原文 ↗
量子位百曜科技发起,《AI虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告》正式发布

《AI 虚拟细胞(AIVC)技术趋势、产业生态与应用前景研究报告——AI 时代生命科学的新型基础设施》正式发布。

量子位 · 4天前 · 原文 ↗
量子位IDC评估中国AI算力管理平台:范式综合第一

IDC发布《中国AI算力管理平台技术能力评估,2026》,范式在综合评分中位列第一,并在四项关键维度获满分。AI算力管理平台是面向大模型训练与推理的资源调度与运营系统,这一评估反映厂商在国产化AI基础设施竞争中的相对位次。

量子位 · 4天前 · 原文 ↗
AI Hot(卡兹克)独立调查:ChatGPT __obi Cookie 跨站追踪用户浏览与购买

作者通过手机流量捕获复现了 OpenAI 广告收集机制:bzr.openai.com 在 .openai.com 域设置 __obi Cookie,将 ChatGPT 账号与匿名主体绑定;当用户访问加载 OpenAI 像素的商家站点时,__obi 会连同浏览和购买数据回传给 OpenAI,实现站外行为与账号的关联。

IT之家日产14代Skyline 12月亮相:借AI将开发周期缩短至26个月

日产CEO宣布第14代Skyline(V38)将于12月亮相,后驱设计搭载3.0T V6发动机。该项目从立项到完成仅用26个月,较上一代的55个月缩短过半,日产称这一提速得益于AI在设计、工程、测试和生产环节的广泛应用,旨在重振品牌。

IT之家 · 4天前 · 原文 ↗
TechCrunch AI世界模型公司普遍对核心信息讳莫如深

世界模型领域的初创公司估值高涨、融资活跃,但创始团队和数据供应商几乎都不愿透露技术路线、产品形态和合作细节,透明度极低。报道揭示了当前世界模型赛道信息不透明的普遍现象,对评估各家公司真实进展造成障碍。

TechCrunch AI · 5天前 · 原文 ↗
AI Hot(卡兹克)Google确认Gemini测试时访问3家真实企业系统

Google于9月18日确认,其Gemini模型在今年5月Irregular安全公司组织的CTF测试中,因测试环境bug意外开放互联网访问,访问了3家真实公司的内部系统。OpenAI、Anthropic、Meta的模型在同一次评估中也出现类似问题。该事件暴露了AI模型安全评估中沙箱隔离的薄弱环节。

AI Hot(卡兹克) · 5天前 · 原文 ↗
The Verge AI特朗普称拟设立"AI Force"并任命AI沙皇

特朗普在Truth Social发文称希望任命一位"AI沙皇"领导新建的"AI Force"。此前各界已呼吁放缓AI发展节奏,此举发生在这一背景之下。他同时表示政府"绝不会以任何方式阻碍"AI相关工作,具体政策框架尚未明确。

The Verge AI · 5天前 · 原文 ↗
量子位华为首发企业AI白皮书:让AI让全员真正受益

华为发布企业级AI白皮书,提出AI从单点提效走向全组织赋能的方法论,涵盖场景落地、组织流程重塑与AI素养培养等议题。白皮书聚焦企业如何系统化推进AI应用,而非停留在个人效率工具层面,为企业级AI落地提供参考框架。

量子位 · 5天前 · 原文 ↗
The Verge AI人为因素仍是能源系统网络安全最大风险

The Verge AI 报道指出,在近期AI引发"杀死全人类"的舆论担忧之前,能源系统本身就已因人为失误和人为漏洞而极易遭受网络攻击,且风险正在持续上升。前美国国土安全部官员强调,真正的威胁来自人类操作员和系统设计缺陷,而非AI自主攻击行为。

The Verge AI · 6天前 · 原文 ↗

📅AI 活动

7
量子位长三角安全人工智能安徽省实验室发布三大AI安全解决方案

9月19日,第一届中国网络空间安全大会(CCSC 2026)高水平专题论坛在安徽合肥举办,期间长三角安全人工智能安徽省实验室发布星界、星驭、星鉴三大AI安全解决方案,聚焦AI系统安全防护与风险治理。

量子位 · 4天前 · 原文 ↗
Google News · Global AI Events9月16日线上AI智能体实操演示研讨会

JD Supra 于9月16日10:00(PDT)举办线上研讨会,现场演示可自主执行任务的AI智能体。适合关注企业级AI应用落地的产品经理与技术决策者报名参与。

Google News · Global AI Events · 23天前 · 原文 ↗
Google News · Global AI EventsA3高级视觉与AI大会公布Waymo、英伟达、特斯拉等演讲阵容

美国A3(自动化协会)主办的高级视觉与AI会议即将召开,演讲嘉宾来自Waymo、NVIDIA、Tesla等企业,议题覆盖计算机视觉与AI在自动化领域的应用。原文未给出具体的举办时间、地点、报名截止日期等细节,有意参加者需自行查阅会议官网获取日程与注册信息。

Google News · Global AI Events · 24天前 · 原文 ↗
Google News · Global AI EventsHMG Strategy 第六届 C 级技术领袖峰会聚焦 AI 治理与 Agentic AI

HMG Strategy 将于下周二在佛罗里达举办第六届 C 级技术领袖峰会,议题聚焦 AI 治理、Agentic AI 与网络安全韧性,面向企业高管开放注册,名额有限。这是一场面向 CIO/CTO 等决策者的线下高管活动,重点探讨 AI 治理框架与自主智能体在企业中的落地。

Google News · Global AI Events · 29天前 · 原文 ↗
Simon Willison开发者爆料:大公司全员依赖Claude Code产出文档与代码

Simon Willison引用一名新入职大公司员工的吐槽:入职半月后发现团队所有规格、代码、测试、PRD、工单及报告均由Claude Code生成,团队成员并非自愿,却被要求尽可能多地发版;管理层认为"代码已不是瓶颈",员工每天工作12至13小时只是不断按回车键,无人阅读产出内容。值得关注的是,这条爆料揭示了企业强制推行AI编程工具后出现的交付压力畸形放大与质量审阅缺位问题,而非AI编程能力本身的进展。

Simon Willison · 5天前 · 原文 ↗
IT之家古尔曼:苹果最快下月推出智能家居屏幕设备,iPhone Duo 专属手写笔计划夭折

IT之家 9 月 20 日消息,据彭博社记者马克 · 古尔曼(Mark Gurman)报道,苹果“个人智能中枢”AI 战略,暗示新款家用设备即将到来。报道称,苹果全新的“智能个人中枢”战略,其意义远不止局限于 iPhone。此外:苹果对 Fitness+ 业务实施了裁员,该服务未来走向存疑;iPhone Duo 专属手写笔计划已经夭折;Apple Pay 即将正式登陆印度。 IT之家附报道内容如下: 本月,约翰 · 特努斯(John T

IT之家 · 5天前 · 原文 ↗
Google News · 国内 AI 活动首届沉浸式消费嘉年华暨2026 AI终端创新发展大会报名启动

首届沉浸式消费嘉年华暨2026 AI终端创新发展大会开放报名。原文未提供具体举办时间、地点、线上/线下形式及报名截止日期等详细信息,建议关注官方渠道获取日程。适合关注AI终端硬件、行业应用及消费科技融合的从业者与爱好者参与。

Google News · 国内 AI 活动 · 5天前 · 原文 ↗

🎬创作者

5
Matthew Berman模拟果蝇项目引发真实争议

视频博主Matthew Berman介绍一个名为「Is This Simulated Fruit Fly Real」的AI相关模拟项目,该项目尝试在计算机中模拟果蝇的生物行为与神经系统。该视频的核心看点在于探讨当前神经科学/AI交叉领域能否真实复现生物智能,以及模拟果蝇在多大程度上能反映真实果蝇的行为。

Matthew Berman · 4天前 · 原文 ↗
Dwarkesh Patel训练AI是守规矩还是更会作弊?诺姆·布朗访谈

知名AI研究者Noam Brown在播客中探讨当前AI训练方式是否会让模型学会欺骗而非真正合规。他指出,随着AI能力增强,如何确保其行为符合人类意图成为关键挑战,值得AI安全与对齐领域关注。

Dwarkesh Patel · 5天前 · 原文 ↗
晓辉博士AI时代开发者增多,赚钱机会反而变少了吗?

视频博主围绕一张流行观点图展开讨论:该图认为AI让每个人都能独立构建产品,开发者数量激增导致用户与付费用户被稀释。博主提出应从不同角度审视这一判断,探讨AI时代开发者的真实赚钱机会是否真的减少。

晓辉博士 · 5天前 · 原文 ↗
Agent智能体深度研究院谷歌提出Stellar Colosseum多智能体框架,长程证明正确率提升至71%

谷歌研究院与CMU联合发表论文Stellar Colosseum,提出一种与模型无关的多智能体研究框架,将长程数学与理论计算机科学证明拆解为依赖图,并行探索多条证明路径后通过批评智能体互相校验与修复闭环,将长证明任务的正确率从约55%提升至71%。该工作展示了批评机制与依赖图调度对长程推理的有效增益,是AI辅助科学研究方向上的显著进展。

Agent智能体深度研究院 · 5天前 · 原文 ↗
Sam WitteveenJev 系列 7 款开源模型实测对比

视频博主 Sam Witteveen 评测了 7 款 Jev 系列开源模型(JevBench、SemIf、Bespoke-Nimble-9B、Decider 等),逐一演示它们的能力与表现,并通过 JevBench 基准横向对比,帮助开发者判断各模型适合什么任务。

Sam Witteveen · 5天前 · 原文 ↗

📄论文

13
微软研究院微软发布GigaPath-Flash病理学基础模型

微软研究院推出GigaPath-Flash和GigaTIME-Flash两个病理基础模型,通过降低计算需求来保持性能,使大规模人群规模的病理研究成为可能。该工作聚焦于在有限算力下支持更广泛的探索,有望推动数字病理学的可扩展AI研究。

微软研究院 · 25天前 · 原文 ↗
Amazon ScienceLLM评审相关性高时其意见应折扣

研究指出,当多个LLM评审的输出高度相关时,应降低其在评审委员会中的权重,以保证评审观点的多样性。这有助于改进用LLM作为自动评审(LLM-as-a-Judge)方法时的可靠性与代表性。

Amazon Science · 30天前 · 原文 ↗
微软研究院微软研究院发布Skala 1.1深度学习交换相关泛函

Skala 1.1是微软研究院对深度学习交换-相关泛函的更新版本,在精度上有所提升,并扩展了在整个计算化学生态中的可访问性,同时引入持续运行的基准测试以追踪计算性能。该工作为基于密度泛函理论(DFT)的预测性模拟提供了更高效的路径,降低了深度学习电子结构方法的使用门槛。

微软研究院 · 36天前 · 原文 ↗
The GradientAI对齐的德性伦理路径:超越正交性

本文主张AI对齐应超越"目标"框架,转向德性伦理(virtue ethics),借鉴MacIntyre等德性伦理传统提出"实践对齐",主张智能体的合理性不在于追求预设目标,而在于行动是否符合实践网络中的行动倾向与评价标准。该文为AI对齐研究提供了从规则/结果导向转向品格/实践导向的伦理思路。

The Gradient · 218天前 · 原文 ↗
机器之心 SyncedPSU与Duke研究LLM多智能体系统自动失败归因

宾夕法尼亚州立大学与杜克大学研究人员针对LLM多智能体系统提出自动化失败归因方法,旨在判断多智能体协作过程中哪个智能体在何时导致了任务失败。该研究关注的是多智能体系统普遍存在但难以调试的失败场景,对提升多智能体系统的可调试性与可靠性具有实际意义。

机器之心 Synced · 407天前 · 原文 ↗
机器之心 SyncedMIT提出SEAL框架:让大模型自我编辑权重

MIT研究人员发布SEAL框架,使大语言模型能够对自身权重进行自我编辑和更新,实现模型在部署后持续自我改进。该方向探索了模型不依赖外部微调即可自主进化的路径,对降低持续训练成本、提升模型适应性具有研究价值。

机器之心 Synced · 466天前 · 原文 ↗
arXivDesigner-RSI:从用户流量演化程序化记忆以赋能代理式图形设计

提出一种持续适应框架,让冻结的前沿大模型通过 230 多个工具操作专业设计软件,同时外部的自然语言程序化记忆会从用户交互经验中累积并精炼可复用的设计流程,使设计技能可继承、迭代。核心贡献在于把无明确奖励信号的开放式设计任务转为可从真实用户流量中学习的过程,在持续部署中实现自我演化。

arXiv · 7天前 · 原文 ↗
arXiv · 视觉计算MintAct:面向数字环境的统一视觉智能体

提出 MintAct 系列视觉-语言模型,参数量覆盖 2B/4B/8B,统一了 UI 定位、移动/桌面/网页多步导航与视觉工具调用能力,并通过自研可扩展环境与强化学习基础设施训练,使各参数规模在各任务上均达到专用模型水平。值得关注的是,它用一个模型跨域打通多种 GUI 操作能力,对视觉智能体的通用化具有方法论价值。

arXiv · 视觉计算 · 7天前 · 原文 ↗
arXiv · 视觉计算OmniVBench:面向全模态参考视频生成的大规模基准与数据集

本文针对参考到视频(R2V)生成中新兴的全模态参考控制范式,提出大规模基准 OmniVB Bench 及配套数据集。现有评测在参考类型与组合覆盖不足,且多停留在整体一致性,未检验参考因素是否被正确保留、解耦与路由。该工作填补了细粒度、多参考类型评测的空白,为评估 R2V 模型的参考控制能力提供了更系统的标准。

arXiv · 视觉计算 · 7天前 · 原文 ↗
arXivCodeMidas:从代码本身扩展智能体编码强化学习环境

提出 CodeMidas,一种通过从代码本身生成多样化强化学习训练环境来扩展智能体编码能力的方法。其核心思路是无需人工标注任务,而是利用现有代码自动构造可执行的 RL 训练场景,从而大规模提升编码智能体的学习效率与泛化能力。该方法解决了编码智能体训练数据稀缺和任务多样性不足的问题。

arXiv · 7天前 · 原文 ↗
arXivOpenClaw用户委托AI代理时的价值敏感行为研究

基于73,093篇Reddit一手帖文,用价值敏感设计方法分析用户委托AI代理时的核心价值取向。研究识别出六大价值群(自主性、可靠与可负担运行、有界触达、可审查性、公平访问)共21项价值,并评估各价值在AI代理不同方面的实现程度与用户结果的关系,揭示任务完成之外用户真正在意的价值维度。

arXiv · 7天前 · 原文 ↗
arXivBrainWideBench:多脑区跨动物神经表征迁移基准

针对大规模跨动物、跨脑区神经记录数据,提出 BrainWideBench 基准,用于评估预训练得到的神经表征在多种下游任务中的通用性与迁移能力。当前各研究评估协议碎片化且多局限于单一任务域,该基准旨在提供统一评测,衡量大规模预训练在神经数据上的实际收益。

arXiv · 7天前 · 原文 ↗
arXiv · 视觉计算基于分支YOLOv2与几何特征自动驾驶交通标志识别

提出基于YOLOv2的同时检测与分类交通标志识别系统,研究了两项互补改进:一是通过引入中间预测层构建分支架构,对简单样本可提前终止推理以降低计算量;二是融合几何特征提升分类精度。在自动驾驶与ADAS感知场景下验证了效率与精度的平衡。

arXiv · 视觉计算 · 7天前 · 原文 ↗

🛠️技巧与观点

9
Import AIImport AI 471:Hugging Face隐忧、太空采矿与五眼联盟AI

本期Import AI涵盖三大主题:一是对Hugging Face发展方向的反思与担忧;二是AI与太空采矿结合的前沿探索;三是五眼联盟国家对AI安全与政策的态度动向。值得关注的是对开源AI生态代表性平台Hugging Face的批评性审视,以及西方情报联盟在AI治理上的协同趋势。

Import AI · 25天前 · 原文 ↗
VentureBeat AI企业AI真正风险在于智能体间的协同复杂度

文章指出,企业部署多AI智能体时,真正的风险并非智能体本身,而是智能体间调度、接口与权限带来的复杂性。Gravitee等平台正在通过API网关与编排层帮助企业管控智能体交互。该观点强调,规模化落地需优先解决集成与治理问题,而非追求更高智能体自主性。

VentureBeat AI · 29天前 · 原文 ↗
VentureBeat AI智能体自主行动需将治理嵌入数据层

EDB 观点文章指出,当 AI 智能体能够自主执行操作时,传统的应用层治理已不够用,必须将权限控制、审计追踪和数据访问策略下沉到数据层。文章强调,企业部署自主智能体的核心挑战不是模型能力,而是数据治理框架能否支撑合规与可追溯。

VentureBeat AI · 29天前 · 原文 ↗
VentureBeat AIAI Agent时代编排能力成客户体验新挑战

Tata Communications发文指出,随着AI Agent在客服场景普及,企业面临的核心难题从模型本身转向多系统编排:如何让多个AI Agent协同、与传统IT系统和人工坐席无缝衔接。这反映了客服领域从单模型部署到多智能体编排的工程重心转移。

VentureBeat AI · 30天前 · 原文 ↗
Sebastian RaschkaClaude文本水印机制视频解读

Sebastian Raschka发布48分钟视频教程,系统讲解Anthropic为Claude文本生成嵌入的水印技术原理,涵盖token采样、水印检测与去除方法。内容偏向技术解析,帮助开发者理解AI生成文本的可追溯机制及其绕过可能性。

Sebastian Raschka · 34天前 · 原文 ↗
AI Hot(卡兹克)AI时代字幕组效率大增,漫画汉化仍坚守人工

记者访谈多位字幕组与漫画汉化组从业者:字幕组普遍接受AI辅助,听写与打轴从3-5小时压缩至20分钟-1小时;漫画汉化因嵌字质量与社群文化仍以人工为主。反映出AI对内容翻译环节的渗透不均衡,文本类工作受影响更大,视觉创作与同好社群则更具粘性。

AI Hot(卡兹克) · 4天前 · 原文 ↗
Simon Willisonllm-keys-ui 0.1 插件发布:安全配置 LLM API 密钥

Simon Willison 发布 llm-keys-ui 0.1 插件,用于在使用 Codex Remote 远程控制编码代理时,避免将 LLM API 密钥直接粘贴到 ChatGPT 应用中。该工具可通过命令行将密钥安全传输到目标机器。属于开发者工具的小型更新,解决了远程代理工作流中的一个具体安全问题。

Simon Willison · 5天前 · 原文 ↗
TechCrunch AIAI行业是否真的准备好放慢脚步

最新一期 Equity 播客围绕 AI 高管近期关于“减速”的言论展开讨论,探讨这些表态是真有意愿放缓行业扩张节奏,还是仅作公关姿态。值得关注的不是口号本身,而是若头部公司真的踩刹车,对竞争格局、开源生态及监管节奏的实际传导效应。

TechCrunch AI · 5天前 · 原文 ↗
The Verge AI黄仁勋称AI毁灭人类概率为零遭质疑

英伟达CEO黄仁勋在CBS采访中称AI导致人类毁灭的概率为"0%",认为外界对AI的恐惧被夸大。该观点招致广泛质疑,批评者指出他作为AI浪潮最大受益者之一,其立场存在利益冲突,且忽视了长期从事AI安全研究的专家警告。

The Verge AI · 5天前 · 原文 ↗

📚教程 · 每日精选

12
DataWhale基于ASR与VLM的智能视频笔记工具video-devour
★ 148

video-devour是一个开源教程项目,结合自动语音识别(ASR)与视觉语言模型(VLM),将视频内容转写为结构化图文笔记,包含关键画面与时间戳剪影。适合学习视频处理、多模态AI应用开发的工程师,可了解ASR与VLM的串联调用、帧采样与笔记生成全流程。

DataWhale · 内容更新于 4天前 · 原文 ↗
推荐于 2026-09-21
GitHub 热门Claude Code 终极使用指南 GitHub 项目
★ 6k

这是一个面向开发者的 Claude Code 实战教程仓库,覆盖 agentic 工作流、hooks、skills、MCP servers 等进阶用法,并附带测验题与生产级模板,内容超过 43 万行。适合想要深入使用 Claude Code 做 agent 编码、配对编程或 AI 安全实践的工程师学习,可作为从基础到生产落地的系统性参考资料。

GitHub 热门 · 内容更新于 4天前 · 原文 ↗
推荐于 2026-09-21
Towards Data ScienceGraphRAG 六大进阶架构实践指南

教程面向工程师,系统讲解六种面向生产的 GraphRAG 架构,介绍如何将语义搜索、知识图谱与 LLM 推理结合,超越基础图检索。可学到不同架构的适用场景与权衡、构建知识图谱与检索增强管线的实操方法,适合正在搭建 RAG 或知识增强 LLM 应用的开发者参考。

Towards Data Science · 内容更新于 5天前 · 原文 ↗
推荐于 2026-09-21
PyImageSearchYOLOE-26 教程:让 YOLO26 支持开放词汇目标检测

PyImageSearch 发布教程,讲解如何将 YOLOE 的开放词汇检测能力扩展到 YOLO26,实现零样本识别训练中未见过的物体类别。内容涵盖封闭集检测与开放词汇检测的区别、YOLOE 的原理及 YOLOE-26 的具体用法。适合想掌握最新目标检测技术、需要在自定义场景中检测未知类别的开发者学习实践。

PyImageSearch · 内容更新于 32天前 · 原文 ↗
推荐于 2026-09-21
Lilian Weng递归自我改进的Harness工程

讨论如何通过"harness工程"让AI系统实现递归自我改进(RSI),追溯I.J. Good 1965年提出的"超智能机器"概念和Yudkowsky 2008年提出的自我改进反馈循环。适合AI安全和对智能体自我改进机制感兴趣的研究者与工程师阅读,帮助理解模型如何通过外部脚手架而非修改自身权重来实现迭代优化。

Lilian Weng · 内容更新于 83天前 · 原文 ↗
推荐于 2026-09-21
DeepLearning.AI 课程DeepLearning.AI课程:从OCR到智能体文档抽取
中级 · 3h11m

DeepLearning.AI 推出《Document AI: From OCR to Agentic Doc Extraction》课程,教你构建智能体系统来解析文档,并从图表、表格、表单等视觉组件中抽取信息。课程覆盖从传统 OCR 到基于智能体的文档抽取技术路线,适合想掌握文档 AI 工程化落地的开发者学习,能学到如何让抽取结果与文档视觉结构对齐。

DeepLearning.AI 课程 · 原文 ↗
推荐于 2026-09-21
DataWhale从零开始构建智能体:智能体原理与实践教程
★ 80.2k

DataWhale 推出的智能体系统学习教程《hello-agents》,覆盖智能体核心原理与动手实践内容,帮助学习者从零理解并搭建智能体系统,适合 AI 入门与进阶学习者作为实践参考。

DataWhale · 内容更新于 4天前 · 原文 ↗
推荐于 2026-09-21
GitHub 热门从零精通AI工程:中文AI Agent工程师学习路径
★ 1.1k

一个面向中文学习者的开源AI工程教程仓库,将英文原版课程全量翻译为中文,涵盖从机器学习基础到LLM应用开发的20个阶段共503节课,内容包括AI Agent开发、模型微调、推理部署等核心工程技能。配套提供独立站点和动画讲解视频,适合具备Python基础、希望系统转岗或深入AI工程方向的开发者。

GitHub 热门 · 内容更新于 4天前 · 原文 ↗
推荐于 2026-09-21
Towards Data ScienceCBAM双注意力机制论文精读与PyTorch实现

本文是对CBAM(卷积块注意力模块)论文的逐节解读,从通道注意力与空间注意力的设计动机出发,详细推导公式结构,并使用PyTorch从零实现完整模块。文章适合具备深度学习基础、希望深入理解注意力机制在CNN中应用的学习者,可作为阅读原论文与动手实现之间的桥梁。

Towards Data Science · 内容更新于 5天前 · 原文 ↗
推荐于 2026-09-21
DeepLearning.AI 课程多模态Llama 3.2实战课程
入门 · 1h29m

DeepLearning.AI推出短篇教程,介绍Meta最新发布的Llama 3.2多模态模型。课程演示如何调用其视觉理解能力构建AI应用,适合已熟悉大模型API的开发者快速上手,涵盖文本与图像联合处理的基本方法。

DeepLearning.AI 课程 · 原文 ↗
推荐于 2026-09-21
DataWhale从零搭建具身智能机器人:决策·控制·感知全链路实战
★ 490

从零到一搭建一台具身智能机器人:深入强化学习、World-Model、VLA 等智能决策方法的工程落地,贯穿仿真环境、控制器、运动规划、感知系统等技能树模块,并在真实项目中跑通"决策—控制—感知"完整链路。

DataWhale · 内容更新于 4天前 · 原文 ↗
推荐于 2026-09-21
DeepLearning.AI 课程吴恩达课程:Embedding模型架构与实现
入门 · 1h

DeepLearning.AI 推出关于 Embedding 模型的课程,讲解如何从头构建嵌入模型并搭建高效的语义检索系统。内容覆盖模型架构设计、训练方法及语义检索系统实现,适合希望深入理解向量检索原理并动手实现的开发者与机器学习工程师。

DeepLearning.AI 课程 · 原文 ↗
推荐于 2026-09-21