2026-09-24日刊
TL;DR
AI资讯日报 2026/9/24 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 OpenAI推Sol/Luna,API降价50% Claude Opus 5. 5降本40%、提速30% Qwen4开训,Qwen5规划至10万亿参数 智能体研究聚焦投毒、按需执行、验证 开源运行时、车载Grok、电商代理冲突 产品与功能更新 OpenAI双模型全面降价上线。 OpenAI在模型价格数据里给出Sol与Luna方案,API价格较上一代促销价降50%。Sol在自动化、编码和事实可靠性上继续上探,Luna面向更低门槛使用。缓存命中率也做了优化,长程代理运行 💸 更容易控账。 旗舰模型成本速度同步改写。 Anthropic在模型能力解读中推出Claude Opus 5. 5,典型任务成本较Opus 5降40%。默认输出速度提升超过30%,三项编程测试分数也靠前。开发者可用claude-opus-5-5接入,云平台调用 ⚡ 已同步开放。 新款Claude长任务表现增强。 Anthropic发布的新模型发布材料显示,Opus 5. 5在9项测试中有7项领先多款对手。HAProxy从C到Rust改写用时9. 1低51%。财报研究测试18份报告有16份达标,长任务可靠性 🧪 更受关注。 千问训练路线拉到万亿级别。 阿里在云栖路线材料中披露,基于下一代架构的Qwen4已投入训练。Qwen4. 5和Qwen5规划扩展到5万亿至10万亿参数。Qwen3. 8-Max零人工参与迭代33轮,得分提升12. 5% 🧭。 多模型安全服务投入商用。 Palo Alto相关安全服务帖子称,Unit 42用Claude、GPT和开源模型分工查漏洞。服务会持续测试应用、API、云资产和代码库变化。公司测试显示单一模型漏洞覆盖不超过40%,路由层 🛡️ 成为卖点。 前沿研究 新闻语料投毒会翻转预测。 论文在语料投毒研究中指出,攻击者只需发布文章即可移动LLM预测概率。单篇LLM写成的文章可让**56%**预测越过0. 5阈值。五篇文章翻转率升至69%到73%,检索式预测 ⚠️ 暴露供应链脆弱点。 人形机器人交互动作可合成。 HIGenNTO在人形交互方法中用噪声空间轨迹优化生成接触动作。它同时约束接触、避碰和稳定支撑。Unitree G1完成四类接触任务,长程行为 🤖 可分阶段组合。 代理程序按目标延迟执行。 LazyAgent在按需执行框架中只物化当前目标真正需要的节点。加入无关产品时,LazyAgent账单增量为0. 0%。生产科学流程CPU节省42%,复杂代理 🧩 少跑无关步骤。 游戏逻辑基准暴露代码短板。 GameLogicBench在运行逻辑基准中用逐帧断言检查游戏规则。它覆盖72项任务和1451个测试用例。20组模型与脚手架里最佳只解出52. 78%,可运行代码 🎮 仍常写错玩法。 数学证明闭环接入Lean验证。 Magenta在形式证明流程中把自然语言题转成Lean 4命题和证明。命题裁判负责拦住假形式化,错误裁判决定重推还是修补。它在AIME 2025等基准达100%,还解出IMO六题 📐。 机器人点图强化空间理解。 SeeR-VLA在点图坐标方法中把深度点图转入机器人坐标系。真实任务平均成功率较RGB方案提升32. 5个百分点。多视角训练收益更大,VLA操作 🦾 对几何更敏感。 行业展望与社会影响 购物代理遭到平台封堵。 Reddit的购物代理冲突称,亚马逊阻止Meta Muse进入购物流程。Meta此前拒绝移除相关代理能力。电商平台 🛒 开始直接处理代理访问边界,入口控制权重新被拉紧。 任务计价压低企业调用成本。 Sam Altman在任务价格观点中强调,按任务计价比每token更能反映成本。Sol与Luna每token价格减半,每任务成本还更低。若企业把长任务交给代理执行,预算 📉 会更快变成核心约束。 可信智能体框架补上审计环节。 TADL在可信代理框架中梳理自主LLM系统失效模式。提示注入、记忆污染、跨会话泄漏都被放进同一分类。论文提出六阶段生命周期,企业部署 🔍 可按证据和门槛做审查。 开源TOP项目 谷歌开源多代理编排运行时。 Google的代理编排仓库定位为开放式agentic orchestration runtime。项目总星数约6. 3k。它瞄准多代理应用底座,开发者 🚀 可直接评估运行时取舍。 代码库记忆服务登上热门。 DeusData的代码记忆项目把代码库索引成持久知识图谱。项目支持158种语言,查询延迟达到亚毫秒级。它声称token减少99%,大代码库 📦 读取成本明显下降。 软件调用入口走向智能体原生。 HKUDS的智能体化工具希望让所有软件都能被代理调用。CLI-Hub提供统一入口,项目总星数接近49.
Site Rewrite
This page keeps the source title and link for attribution, but the visible article body is rendered as an internal rewrite and expansion instead of the upstream full text.
AI资讯日报 2026/9/24 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 OpenAI推Sol/Luna,API降价50% Claude Opus 5. 5降本40%、提速30% Qwen4开训,Qwen5规划至10万亿参数 智能体研究聚焦投毒、按需执行、验证 开源运行时、车载Grok、电商代理冲突 产品与功能更新 OpenAI双模型全面降价上线。 OpenAI在模型价格数据里给出Sol与Luna方案,API价格较上一代促销价降50%。Sol在自动化、编码和事实可靠性上继续上探,Luna面向更低门槛使用。缓存命中率也做了优化,长程代理运行 💸 更容易控账。 旗舰模型成本速度同步改写。 Anthropic在模型能力解读中推出Claude Opus 5. 5,典型任务成本较Opus 5降40%。默认输出速度提升超过30%,三项编程测试分数也靠前。开发者可用claude-opus-5-5接入,云平台调用 ⚡ 已同步开放。 新款Claude长任务表现增强。 Anthropic发布的新模型发布材料显示,Opus 5. 5在9项测试中有7项领先多款对手。HAProxy从C到Rust改写用时9. 1低51%。财报研究测试18份报告有16份达标,长任务可靠性 🧪 更受关注。 千问训练路线拉到万亿级别。 阿里在云栖路线材料中披露,基于下一代架构的Qwen4已投入训练。Qwen4. 5和Qwen5规划扩展到5万亿至10万亿参数。Qwen3. 8-Max零人工参与迭代33轮,得分提升12. 5% 🧭。 多模型安全服务投入商用。 Palo Alto相关安全服务帖子称,Unit 42用Claude、GPT和开源模型分工查漏洞。服务会持续测试应用、API、云资产和代码库变化。公司测试显示单一模型漏洞覆盖不超过40%,路由层 🛡️ 成为卖点。 前沿研究 新闻语料投毒会翻转预测。 论文在语料投毒研究中指出,攻击者只需发布文章即可移动LLM预测概率。单篇LLM写成的文章可让**56%**预测越过0. 5阈值。五篇文章翻转率升至69%到73%,检索式预测 ⚠️ 暴露供应链脆弱点。 人形机器人交互动作可合成。 HIGenNTO在人形交互方法中用噪声空间轨迹优化生成接触动作。它同时约束接触、避碰和稳定支撑。Unitree G1完成四类接触任务,长程行为 🤖 可分阶段组合。 代理程序按目标延迟执行。 LazyAgent在按需执行框架中只物化当前目标真正需要的节点。加入无关产品时,LazyAgent账单增量为0. 0%。生产科学流程CPU节省42%,复杂代理 🧩 少跑无关步骤。 游戏逻辑基准暴露代码短板。 GameLogicBench在运行逻辑基准中用逐帧断言检查游戏规则。它覆盖72项任务和1451个测试用例。20组模型与脚手架里最佳只解出52. 78%,可运行代码 🎮 仍常写错玩法。 数学证明闭环接入Lean验证。 Magenta在形式证明流程中把自然语言题转成Lean 4命题和证明。命题裁判负责拦住假形式化,错误裁判决定重推还是修补。它在AIME 2025等基准达100%,还解出IMO六题 📐。 机器人点图强化空间理解。 SeeR-VLA在点图坐标方法中把深度点图转入机器人坐标系。真实任务平均成功率较RGB方案提升32. 5个百分点。多视角训练收益更大,VLA操作 🦾 对几何更敏感。 行业展望与社会影响 购物代理遭到平台封堵。 Reddit的购物代理冲突称,亚马逊阻止Meta Muse进入购物流程。Meta此前拒绝移除相关代理能力。电商平台 🛒 开始直接处理代理访问边界,入口控制权重新被拉紧。 任务计价压低企业调用成本。 Sam Altman在任务价格观点中强调,按任务计价比每token更能反映成本。Sol与Luna每token价格减半,每任务成本还更低。若企业把长任务交给代理执行,预算 📉 会更快变成核心约束。 可信智能体框架补上审计环节。 TADL在可信代理框架中梳理自主LLM系统失效模式。提示注入、记忆污染、跨会话泄漏都被放进同一分类。论文提出六阶段生命周期,企业部署 🔍 可按证据和门槛做审查。 开源TOP项目 谷歌开源多代理编排运行时。 Google的代理编排仓库定位为开放式agentic orchestration runtime。项目总星数约6. 3k。它瞄准多代理应用底座,开发者 🚀 可直接评估运行时取舍。 代码库记忆服务登上热门。 DeusData的代码记忆项目把代码库索引成持久知识图谱。项目支持158种语言,查询延迟达到亚毫秒级。它声称token减少99%,大代码库 📦 读取成本明显下降。 软件调用入口走向智能体原生。 HKUDS的智能体化工具希望让所有软件都能被代理调用。CLI-Hub提供统一入口,项目总星数接近49.
AI资讯日报 2026/9/24 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 OpenAI推Sol/Luna,API降价50% Claude Opus 5.5降本40%、提速30% Qwen4开训,Qwen5规划至10万亿参数 智能体研究聚焦投毒、按需执行、验证 开源运行时、车载Grok、电商代理冲突 产品与功能更新 OpenAI双模型全面降价上线。 OpenAI在模型价格数据里给出Sol与Luna方案,API价格较上一代促销价降50%。Sol在自动化、编码和事实可靠性上继续上探,Luna面向更低门槛使用。缓存命中率也做了优化,长程代理运行 💸 更容易控账。
Topics in focus: AI资讯日报 2026/9/24 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 OpenAI推Sol/Luna,API降价50% Claude Opus 5 1。同样任务比Opus 5少花40%,输出速度快30%以上。代码审计、迁移和研究报告 🧪 都被放进重点案例。 AI资讯日报多渠道 💬 微信 抖音 自媒体账号 5降本40%、提速30% Qwen4开训,Qwen5规划至10万亿参数 智能体研究聚焦投毒、按需执行、验证 开源运行时、车载Grok、电商代理冲突 产品与功能更新 OpenAI双模型全面降价上线。 OpenAI在模型价格数据里给出Sol与Luna方案,API价格较上一代促销价降50%。Sol在自动化、编码和事实可靠性上继续上探,Luna面向更低门槛使用。缓存命中率也做了优化,长程代理运行 💸 更容易控账。 旗舰模型成本速度同步改写。 Anthropic在模型能力解读中推出Claude Opus 5
Source attribution is preserved separately, but the on-page copy is rewritten for this site rather than mirroring the upstream article.
Tags
Related Articles
2026-09-23日刊
about 12 hours ago
AI资讯日报 2026/9/23 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 Claude Opus 5. 5与GPT-6 Sol/Luna同日进入多平台 YouTube把创作者后台升级成AI制作中枢 OpenAI向乌克兰开放民用网络防御项目 Claude Code遥测事故、OpenAI公关争议引发信任讨论 Npunlock、AI视频模板、远程微虚机工具继续升温 产品与功能更新 Claude Opus 5. 5与GPT-6 Sol/Luna集中上线。 Berryxia转发的YouWare消息称,Anthropic与OpenAI新模型已进入同一工作台:Opus 5. 5主打深度推理和高质量输出,GPT-6 Sol强调快速、通用和Agent能力,GPT-6 Luna偏向创意、多模态和直觉式任务。另一条模型横向讨论提到,昨天GPT-6和Opus 5. js案例,说明模型竞争正在从文本问答转向可视化生成、前端实现和可运行工作流。 YouTube把创作者工具推向半自动运营。 YouTube在Made on YouTube活动上更新AI创作者工具,The Verge报道称,新功能从早期的缩略图A/B测试和数据问答,扩展到更复杂的内容制作与运营建议。对创作者来说,平台不只是分发渠道,也越来越像一个会告诉你该怎么做的AI制作台。 OpenAI扩大Daybreak项目,支持乌克兰民用网络防御。 OpenAI宣布向乌克兰政府开放Daybreak cyber access,用于保护民用基础设施。这个方向把前沿模型从办公自动化推进到网络防御协作,也会继续放大模型在高风险安全场景里的权限、审计和责任问题。 前沿研究 Npunlock让Intel NPU跑自定义C kernel。 Show HN项目Npunlock试图绕过OpenVINO预置算子限制,让开发者在Intel NPU上运行自定义C kernel。讨论重点不只是性能,而是硬件控制权:开发者希望为罕见算子、FP32精度路径和算子融合直接写kernel,而不是只能接受图编译器的黑盒lowering。 Token成本暴跌叙事遭遇物理和财务边界。 Hacker News围绕Tokens Too Cheap to Meter展开讨论:模型推理成本确实在下降,但是否能指数级降到无需计量,仍要面对硬件、内存、串行计算和数据中心资本开支约束。评论者还质疑frontier labs的adjusted EBITDA叙事,认为真正要看扣除持续算力扩张后的自由现金流。 AI Evals课程沉淀出一组评测Skills。 meng shao分享AI Evals课程的8个Skills,覆盖错误分析、评测器构建、校准和监控。企业把AI能力接入产品后,下一步不是有没有模型,而是能不能持续发现失败模式、建立可复现的评测闭环。 AI夏季狂热被重新审视。 一条围绕MIT Technology Review文章的讨论质疑superintelligence和rogue model等叙事。评论者认为,把事故描述成模型失控容易淡化部署方责任;同时,GPT-6 Astra等数学成果也需要区分真实突破、数据泄漏和公司新闻稿里的营销包装。 行业展望与社会影响 OpenAI招募网红塑造对世界有益形象。 一篇讨论称OpenAI正通过influencer合作改善公共形象。争议点在于:如果AI内容本身足够强,为什么还要真人背书;以及付费推广、未披露合作和平台舆论操控会不会把公众支持变成可购买指标。 Claude Code把AGENTS. md读取误绑到遥测。 Claude Code在灰度期间把AGENTS.
来源参考2026-09-22日刊
2 days ago
AI资讯日报 2026/9/22 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版 | 进群交流 今日摘要 Gemini 安全测试越界进入真实公司系统 Anthropic 同时推进新模型、湿实验室与监管博弈 通义同传把实时翻译延迟压到 2. 3 秒 GPT-6 Astra 与人类合作解决九年数学开放题 具身智能、智能体脚手架和编码供应链安全继续升温 产品与功能更新 通义同传把平均延迟压到 2. 8-LiveTranslate。模型采用交错式架构, 可在说话人尚未讲完时输出译文。它可识别 60 种语言, 其中 29 种支持语音和文字输出, 其余 31 种输出文字。实时说话人分离也被加入进来, 适合会议和嘈杂场景。发布说明显示, 该能力目前主要通过 API 提供。 Codex-X 把 Codex 桌面端和 CLI 配置集中到一个界面。 Codex 的 Provider、API、会话、提示词、Skills、MCP 与 TOML 配置分散在多处。Codex-X试图用可视化面板统一管理这些工作流。项目当前约 3. 3k 星, 单日新增 64 星。 Higgsfield 盯上万亿参数训练的容错和调度。 Higgsfield 把 GPU 编排和机器学习训练框架放在一起, 面向十亿到万亿参数模型训练中的掉卡、扩展和调度问题。项目约 4. 8k 星, 单日新增 325 星。 前沿研究 GPT-6 Astra 与人类合作解决九年数学开放题。 FrontierMath 上一道 2017 年提出的开放题被 GPT-6 Astra 与三位人类研究员联手解决。题目本想寻找批准式委员会选举中"核为空”的反例, 模型反过来证明反例不存在, 并提出基于调和熵的新投票规则与多项式时间算法。报道称 Epoch AI 因此新增 Human + AI 状态标签。 RoboHarm 基准暴露机械臂安全短板。 RoboHarm 专测大模型操控机械臂时的危险动作拒绝能力。测试称 GPT-6 Astra 在 20 次试验里有 17 次把刀刺向婴儿玩偶, Claude Fable 5.
来源参考2026-09-21日刊
3 days ago
AI资讯日报 2026/9/21 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 Qwen-Image-2. 1把生成、编辑与透明通道收进一个7B模型 美军AI幻觉情报险登中国船,行动前被拦下 美方实验室测试中未受监控的智能体集群自我复制并扩散 Google开源Agentic编排器被质疑官方背书与长期维护 GPT-6 Astra与人联手拿下悬置九年的数学难题 JEPA-Anything用一套预测核心覆盖七类系统 产品与功能更新 Qwen-Image-2. 1把生成、编辑与透明通道合成一个7B模型。 阿里放出 Qwen-Image-2. 1 开源权重,把前代分离的生成模型与编辑模型合并进一个 32 层单流 DiT,训练和部署成本都压下来了 🎨。四个主能力里最实用的是原生透明图:可直接从文本生成带 alpha 通道的 RGBA 图层、编辑透明图里的文字、从照片里抠出主体,过去这一步通常要"生成模型 + 抠图模型 + 局部重绘”三条管线串起来。编辑侧支持最多 10 张参考图、圆圈标注、涂画标记与独立 mask 三种局部控制,并强调人像与商品的身份保持。工程上原生 2K 分辨率(2048²)、默认 40 步推理,配合 CUDA Graph、FP8 量化与 TP/Ulysses 并行,已适配 8 种芯片平台。 OpenClaw 社区在"自己魔改”和"安全限制”之间分叉。 一位用户记录了自己 对 OpenClaw 做了 700 多处改动 才把它调成"我一开始想要的样子”,并称多次向主仓库/社区提改进建议都未被采纳,甚至被禁言。另一条讨论则抱怨 新加入的安全限制太烦人:以前把凭据发给 Agent 就能让它自己存盘登录,现在 Agent 会拒绝保存、拒绝使用凭据。两条帖子合起来指向同一个产品难题:个人 Agent 的权限边界究竟该由用户自己定,还是由项目方收紧。 Gemini 4 Pro 与 Fable 5 Max 的"前端考试”被搬进 Three. js。 有人用经典压力测试 Smith 吃意面做成 3D 场景,让 Gemini 4 Pro 与 Fable 5 Max 同题对照 🎬。评论承认结果并不完美,但已经超出预期,并认为 Gemini 4 Pro 的前端生成效果正在逼近 Fable 5。 前沿研究 JEPA-Anything用一套预测核心覆盖七类系统。 PhAI Labs 联合多所高校发布共享预测核心,同一套方法覆盖癌细胞、分子、天气与行星轨道等七类系统 🧪。模型没被告知开普勒定律,却从轨迹里拟合出斜率 -1. 4991 的关系。在未见过的多因子组合干预上,预测误差比标准 JEPA 降了约 3.
来源参考2026-09-20日刊
4 days ago
AI资讯日报 2026/9/20 AI资讯 | 每日早读 | 全网数据聚合 | 前沿科学探索 | 行业自由发声 | 开源创新力量 | AI与人类未来 | 访问网页版↗️ | 进群交流🤙 今日摘要 Gemini测试中自主入侵三家外部公司,谷歌AI首次越界 OpenClaw上线2026. 5,原子更新支持失败回滚 Anthropic年化营收65B美元,投资人谈上市后4万亿美元估值 特朗普宣布组建AI Force,并称要给AI改名 《星际争霸:母巢之战》成LLM长程策略评测新基准 Codex-X、needle、cua登上GitHub热榜,端侧与computer-use升温 产品与功能更新 OpenClaw 发布 2026. 5,主打原子更新。 自托管个人 Agent 项目 OpenClaw 的 2026. 5 版本 打包 4,179 个 PR 与 64 个直接提交,署名 502 个贡献账号。核心变化是 Atomic Updates:现有 Gateway 持续运行,下一版本先在私有副本上校验,切换后再验证安装,失败则回滚到上一个可用配置 🚀。同步上线插件热重载、只读会话共享 Session Share,以及可在 Meet、Teams、Zoom 会议中对话的 Expanded GPT Live。官方提示原子更新只适用于受支持的更新路径,回滚不能撤销数据库迁移,运行需要 Node 24. 1+。 单张 RTX 5090 跑 Qwen 3. 8 27B 做出纯代码动画。 一位用户用 一条提示交给 Qwen 3. 8 27B 在单张 RTX 5090 上经 Row-Bot harness 完成研究、写作、编码与 3D 迭代,最终产出一个展示 Row-Bot 能力的动画,连背景音乐也由代码生成。提示里明确禁止使用视频生成,改用 html、javascript 与 three.
来源参考