Gemini 3.8 Flash上线/ZimaBlue吃下具身视频/司法部支持AI训练合理使用 | AI资讯日报 2026/9/3

# Gemini 3.8 Flash上线/ZimaBlue吃下具身视频/司法部支持AI训练合理使用 | AI资讯日报 2026/9/3

> Gemini 3.8 Flash上线,ZimaBlue吃下具身视频,司法部支持AI训练合理使用。


🚀 产品与功能更新

🔥1. Gemini 3.8 Flash上线。 Google把新款闪电模型推到API。复杂任务会更卖力 🚀 调工具。DeepSWE拿到73.7%。Cyber版只给防守机构用。 查看详情

💥2. Muse Spark 1.3降本。 Meta让Muse新模型进入Muse Code和API。长程编码更省 ⚡ 动作。工具调用少20%。Token用量降25%。 查看详情

⚡3. Claude能后台用电脑。 Anthropic把桌面执行能力放进Claude Cowork和Code。它可点击 🖱️ 打字开应用。用户继续做别的事。Agent感更强。 查看详情

🌟4. Grok Bot到安卓。 xAI让安卓聊天助手开始可用。入口更贴近移动端 ⚡ 问答。演示展示唤起过程。覆盖面继续扩大。 查看详情

💡5. TwinDEX省掉真机示教。 X Square Robot用灵巧手系统采集训练数据。人戴设备 🖐️ 直接演示。机器人端可迁移动作。吞吐最高5.3倍。 查看详情

📌6. Lily主打端侧推理。 Perplexity开源本地推理引擎。它面向Apple芯片 ⚙️ 优化。重点适配Qwen3.6-35B-A3B。混合计算少些堵塞。 查看详情


🔬 前沿研究

🔥1. ZimaBlue吃下具身视频。 研究用世界动作模型学习机器人控制。慢快架构 ⚙️ 支持30Hz动作预测。训练视频超12万小时。零样本成功率到77.8%。 查看详情

💥2. HoH让编码代理多日迭代。 论文把自主开发框架套在现有harness上。规划编码测试 🔁 连续循环。三类基准平均涨52.25%。70多轮做出射击游戏。 查看详情

⚡3. SciGram补科学图理解。 团队用图表指令数据连接课程术语。流程会自动 🧪 抽概念造问答。数据含194K图。视觉模型科学题更稳。 查看详情

🌟4. 廉价验证器有盲区。 论文审计推理级联系统的成本幻觉。小模型答题 🔍 验证器放行。面板只报3%错误。真实错误可到32%。 查看详情

💡5. 多智能体提示更稳。 研究把控数分离方法用于代理流程。路由格式 🧭 交给类型对象。优化器只改语言内容。协议有效率到100%。 查看详情

📌6. GlossoGen看到代理暗语。 论文用语言演化平台测试多代理协作。高压任务 ⚡ 逼出新约定。语言可组合但难读懂。复盘阶段会强化规则。 查看详情


🌐 行业展望与社会影响

🔥1. 司法部支持AI训练合理使用。 美国司法部在训练版权立场中支持OpenAI。它认为训练 📚 可属合理使用。该立场反打版权局报告。纽约时报案影响很大。 查看详情

💥2. Astra推理术引安全担忧。 OpenAI计划让Astra推理模型使用循环深度。模型会反复 🧠 压缩推理。外部监控可能更难。思维链可审计性受压。 查看详情

⚡3. Uber抢先开进伦敦。 Uber与Wayve把自动驾驶叫车带到伦敦。首批仍配安全员 🚕。Waymo被抢在后面。欧洲需求开始实测。 查看详情

🌟4. Wonderful估值冲到50亿美元。 企业AI公司拿到C轮融资。金额是5.5亿美元 💹。半年内估值翻倍。资金投向产品和FDE团队。 查看详情

💡5. 斯坦福重写软件课。 CS146S把现代开发课程押在Agent工作流上。学生要让代理 ⚙️ 写代码。十周覆盖上下文、审查、安全。真实开源PR占30%。 查看详情


💻 开源TOP项目

🔥1. Claude API Skill开源。 Anthropic把接口优化技能放进Claude Code。命令可做 🔧 成本优化。也能审计提示词反模式。支持8种语言SDK。 查看详情

💥2. 持久代理可跨宿主。 新论文给代理迁移架构拆出身份和管线。记忆代码 📦 随代理保留。模型接口可替换。核心测试通过833项。 查看详情

⚡3. HarnessEvolve修自进化失误。 研究用参考轨迹方案校准失败步骤。归因不再只看终点 🧭。双门控防止退化。更新质量更可控。 查看详情


📱 社媒分享

🔥1. 模型周进入连发状态。 Andrew Curran称模型密集更新挤在同一周。Gemini和Muse同日 ⚡ 上新。Fable、Mythos刚到。Muse单任务成本0.55美元。 查看详情

💥2. 神经语争议升温。 Dave Troy在神经语讨论里批评不可审计推理。工具调用 🧰 仍能留下记录。他更看重神经符号路线。边缘开源模型会加剧治理难题。 查看详情

⚡3. 法律AI采购要盯模型。 Mollick转述法律基准观察。高端模型 ⚖️ 表现很好。便宜低推理模型错误更多。采购激励会影响交付质量。 查看详情

🌟4. 快和便宜压过智商。 Mostaque在性能优先观点里提到satisficing。开发者现在 ⚡ 要速度。模型智力已够多数活。下一战是成本。 查看详情

💡5. 长程代理容易丢线索。 Reddit用户在长程代理帖分享实测。长提示会腐化 🧭。Lyzr加Redis保存状态。延迟和Token膨胀下降。 查看详情

📌6. Argus想做持续研究代理。 项目在Argus架构帖展示运行时。它保存技能、验证器和失败轨迹 📦。模型工具都可替换。人只在关键点介入。 查看详情

🎯7. ChatGPT长聊上限被吐槽。 重度用户在长聊限制帖要求连续工作区。Pro也会撞墙 😣。他建议自动压缩上下文。检查点和置顶线索更实用。 查看详情

🔥8. 内测失控风险被重提。 Ajeya Cotra在内部部署片段谈AI接管路径。她担心流氓部署 🔒 借智能爆炸扩散。风险点在实验室内部。发布闸门要更严。 查看详情

💥9. 肖莱怀疑大厂护城河。 François Chollet在护城河短帖谈OpenAI和Anthropic。公开内容很少 🧭。核心指向模型同质化。平台押注需要重估。 查看详情


📰 💡 今日总结与启示

  • 趋势分析:【大模型与产品】Gemini 3.8 Flash上线;Muse Spark 1.3降本。头部厂商围绕推理能力、多模态与 Agent 化持续迭代,API 与定价策略的差异化正在重塑开发者的模型选型逻辑。
  • 趋势分析:【研究与论文】ZimaBlue吃下具身视频;HoH让编码代理多日迭代。前沿论文密集产出,SOTA 刷新与新型范式(如世界模型、推理增强)并行,学术进展正更快地向工业界传导。
  • 趋势分析:【开源与开发者】Claude能后台用电脑;Lily主打端侧推理。开源社区持续涌现”让 AI 自己干活”的工具链——从部署、评测到编排,开发者正以更低门槛把模型能力工程化、产品化。
  • 趋势分析:【AI安全与治理】Astra推理术引安全担忧;Uber抢先开进伦敦。随着长程智能体与自主执行场景落地,模型安全已从”评测话题”变为”生产红线”,红队、行为审计与对齐治理需前置到研发全流程。
  • 行业启示 1:【大模型与产品】在多模型适配架构上提前布局,按负载特征灵活组合模型以平衡效果与成本。
  • 行业启示 2:【研究与论文】建立论文到产品的转化观察清单,对可工程化的新范式做小步快跑验证。
  • 行业启示 3:【开源与开发者】可优先采用成熟度高的开源工具链做内部 PoC,降低试错成本并积累工程资产。
  • 行业启示 4:【AI安全与治理】建议建立常态化的红队评测与行为审计机制,把安全护栏作为上线前置条件而非事后补丁。
  • 行业启示 5:【行业与商业】关注产业链位置变化,识别”卖水人”与高壁垒环节,谨慎评估纯应用层的护城河。

数据来源:何夕2077·AI资讯日报

🤖 本文由晓梅自动采集,每日定时发布

📬 关注 疯狂的豇豆


🙋‍♂️ 疯狂的豇豆是谁?

我是 疯狂的豇豆,一位专注 AI 转型 的教练 🚀

📌 深耕 AI 在商业、营销、内容创作领域的应用

📌 帮助传统企业和个人实现 AI 赋能的数字化转型

📌 定期分享 AI 实战经验、工具评测、行业洞察

疯狂的豇豆联系方式:QQ:22078369

如果你也在思考 “AI 能给我的工作/业务带来什么改变”,欢迎关注我,一起探索 AI 的无限可能!

© 版权声明
THE END
喜欢就支持一下吧
点赞8赞赏 分享
相关推荐
评论 抢沙发

请登录后发表评论

    暂无评论内容