跳到正文

全部动态

今日 0 条
10月2日周五
  1. X:Higgsfield AI (@higgsfield)59

    Higgsfield 上线 Black Forest Labs 的 FLUX 3 Image

    Higgsfield 宣布 FLUX 3 Image 已在其平台上线,该模型来自 Black Forest Labs。支持只改一处细节不动其余部分、用 bounding box 放置物体、最多组合 10 个参考图,以及生成最高 4K 分辨率图像。

  2. X:Boris Cherny (@bcherny)62

    Claude Code 推出 Mods,可通过提示词自定义行为与界面

    Claude Code 推出 Mods 功能,用户只需提示词即可自定义 Claude 的工作方式和界面外观,也可用几行 TypeScript 编写或让 Claude 代为构建。Mods 随插件分发,通过 /plugin 在 CLI 或桌面应用安装,并可作为插件分享给他人。

  3. X:Testing Catalog (@testingcatalog)64

    Claude Code 推出 Mods 功能,用户可修改构建并自定义 UI

    Anthropic 为 Claude Code 推出 Mods 功能,用户可以修改构建。Mods 本质上是 hook,随插件分发,每个是一个小型 JavaScript 或 TypeScript 模块,在会话内运行并能看到每个事件,可重写或替换 Claude Code 的行为,甚至绘制自定义 UI,还可通过 Claude Directory 与他人分享。

  4. Hacker News 热门(buzzing.cc 中文翻译)65

    Earendil 发布 Pi 1.0 稳定版及实验性包 Pi Durable

    Earendil 发布 Pi 1.0,一个稳定、极简、可扩展的智能体编码框架,每周有数十万人使用。1.0 新增 Codemode(原生支持 MCP 及 Jev、图像模型等非 LLM 模型)、虚拟模型扩展支持、延迟工具加载、Anthropic 模型缓存预热、会话中途系统消息、新 TUI 主题和默认全屏模式。

  5. X:Rohan Paul (@rohanpaul_ai)62

    Tavus 发布 Human Interaction Model Griffin,48% 真人误认其为人类

    Tavus 发布首个 Human Interaction Model(HIM)Griffin,称其为首个通过视频图灵测试的模型。48% 与其实时视频对话的人误以为对方是真人,此前系统通过率低于 3%,并位列 NVIDIA 全双工 AI 视频基准第一。作者 Rohan Paul 转引 Tavus 官方发布并补充演示视频中的表现。

  6. X:fal (@fal)62

    fal 上线 FLUX 3 文生图与图像编辑试用入口

    fal 宣布 Black Forest Labs 的 FLUX 3 可在其平台试用,提供文生图与图像编辑两个入口。链接为 https://fal.ai/models/blackforestlabs/flux-3/text-to-image 和 https://fal.ai/models/blackforestlabs/flux-3/edit-image。

  7. X:fal (@fal)63

    FLUX 3 Image 上线 fal 平台

    fal 宣布 FLUX 3 Image 已上线平台,主打精准图像编辑且保留未改动部分。该模型支持原生 2K 和 4K 图像生成、最多组合 10 张参考图、一次完成多个定点编辑,并可对布局和构图做细致控制。

  8. TechCrunch · AI61

    ChatGPT 上线虚拟试穿与收藏购物功能

    OpenAI 宣布 ChatGPT 全球上线两项购物功能,分别是虚拟试穿和收藏(Favorites)。用户在购物结果中点击新的 Try On 按钮并上传自拍或全身照,即可查看服装或配饰的上身效果,也可上传网页截图等商品图让 ChatGPT 代为试穿;Favorites 则把商品存入应用内的 Library 以便之后找回,并与试穿图片一起保存。

  9. X:ARC Prize (@arcprize)11

    ARC-AGI-3 相关 Kaggle 代码分享

    Lohit Siriki https://www.kaggle.com/code/sirikilohit/arc-agi-3-duck-18-1gc-submit https://www.linkedin.com/in/lohitsiriki/

  10. X:ARC Prize (@arcprize)11

    ARC Prize 分享 Kaggle 用户 Notebook

    Lord Han Solo https://www.kaggle.com/lordhansolo Notebook: https://www.kaggle.com/code/lordhansolo/built-on-tufa-labs-duck-harness-milestone-2

  11. X:ARC Prize (@arcprize)45

    ARC-AGI-3 里程碑2获奖者公布

    ARC Prize 2026:ARC-AGI-3 里程碑 #2 获奖者 恭喜三位获奖者开源了他们的高分 ARC-AGI-3 解决方案: 1. Daniel Franzen - 27.9%,$25K 2. Lord Han Solo - 23.8%,$7.5K 3. Lohit Siriki - 22.5%,$5K 了解更多关于每个提交方案的信息:

  12. X:ARC Prize (@arcprize)24

    ARC-AGI-3 里程碑2解法分享

    Daniel Franzen https://da-fr.github.io/ Notebook: https://www.kaggle.com/code/dfranzen/arc-agi-3-milestone-2-solution

  13. X:Rohan Paul (@rohanpaul_ai)51

    Grok 4.7 上线网页端

    Grok 4.7 已在网页端可用。截图显示 Expert 模式提示“Thinks hard Grok 4.7”,界面还提供 Auto、Fast、Build、Heavy 等模式选项。

  14. X:Elvis Saravia (@omarsar0, DAIR.AI)47

    Onepin 为 AI 语音加质检层

    我认为 AI 语音缺少一层质量检查。 在我构建的大多数应用中,语音听起来已经很棒了。但真正让生产环境出问题的,是模型把“Q3”、“v1.2”或品牌名读错。 这对人们感知语音智能体的方式影响巨大。 @OnepinAI 正在解决这个问题。在你听到之前,他们会检查每一行的自然度、清晰度和发音。 当一个词读错时,它会直接修复那个词,而不是重新生成整行。

  15. X:Karina Nguyen(@karinanguyen)30

    Fable 5.1 登顶 PostTrainBench

    一个有趣的结果:Fable 5.1 得分 44.6%,高于 Fable 5 的 37.3%,同时平均少用 33 分钟。这里的进步也意味着从每小时的自主工作中获得更多产出。 大多数智能体运行 8–10 小时,却取得显著不同的分数。下一个有趣的问题是,每多运行一小时,每个智能体能获得多少提升!

  16. X:Thariq (@trq212)35

    Claude 可为你制作 mods

    Claude 能为你制作 mods! 只需提示它,更多内容见 @addyosmani 的博客文章:https://claude.dev/blog/getting-started-with-claude-code-mods/

  17. X:Thariq (@trq212)66

    Claude Code 推出 Mods 功能,支持自定义行为与 UI

    Claude Code 推出 Mods 功能,用户可以修改其行为、自定义 UI 并替换自己的功能。Mod 可用几行 TypeScript 编写或让 Claude 代为构建,随插件分发,可在 CLI 或桌面应用中通过 /plugin 安装;作者称这是为了让软件可扩展成为一等公民。

  18. X:Thariq (@trq212)32

    Claude Code 的 mods 可派生分叉智能体

    mods 的一个特点是,你可以派生分叉智能体来做额外的工作 比如打造你自己的记忆框架,但每一轮都派生一个自定义分类器,如果匹配就写入记忆 我还在把 plan mode 做成一个 mod,后续还有更多!

  19. X:Thariq (@trq212)56

    Thariq 分享常用 Claude Code 插件 next-steps 及安装命令

    Thariq 分享了他常用的 Claude Code mod 'next-steps',该插件会在任务完成后给出下一步建议,包括选择技能和其他命令。安装方式为 claude plugin marketplace add anthropics/claude-plugins-community,再执行 claude plugin install next-steps@claude-community。

  20. X:Rohan Paul (@rohanpaul_ai)55

    Onepin 发布:面向语音生产线的配音校对工具,可修正发音错误

    Podonos 推出 Onepin,定位为文本转语音之后的生产校对步骤,在配音上线前逐行检查。它内置 400 万词发音词典校对人名和产品名,可先拼写价格和日期,为每行音频评分自然度、清晰度和词语准确度,并用同一声音修复错误单词而无需重录,兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费开始且无需信用卡。作者引用示例指出语音模型读 "03/04/27" 时会静默决定是三月还是四月,而输出听起来同样自信。

  21. X:Arena (@arena)69

    MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,分列开源模型第5和第9

    Arena 宣布 Xiaomi MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena。Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,列开源模型第5,较 MiMo-V2.5-Pro(第13,-7.23%)提升9个名次;其 Confirmed Success 得分 +7.35%,列开源模型第2。

    推荐理由:Arena 官方给出 MiMo-V2.6 两款模型在真实智能体会话中的排名、净提升和成本数据,可据此比较其实际表现与性价比。

  22. @typesafeai38

    Jev 大幅提升研究智能体性能

    Jev 对研究智能体来说是一个巨大的增强! @edwardirby 构建了一个 @youdotcom 智能体来监控商业风险,并将 Jev 与普通的 LLM 评判器进行了对比。 • 报告质量相同 • 但 LLM 反复无常:对同一威胁的评分从 0.35 -> 0.68 -> 0.50 • LLM 漏掉了 11 项调查中的 5 项。Jev 一项都没漏。 • Jev 便宜 250 倍,快 3-6 倍 详细文章 👇

  23. X:Anthropic (@AnthropicAI)43

    Anthropic:Claude 与科学计算的阻抗失配

    哈佛物理学家 Matthew Schwartz 在 Anthropic Science Blog 客座文章中提出,AI 与科学之间存在"阻抗失配":LLM 虽能力广泛,但像对待人类合作者那样使用它们并非激发其科学优势的最佳方式。为此他开发了一套用于定量科学精确计算的工具包,Claude 借此在生态学、群体遗传学等十几个领域找到关联,Schwartz 再与领域专家合作将研究方向引向有趣问题。

  24. X:Testing Catalog (@testingcatalog)36

    Grok Bot 新增主动建议功能

    SPACEXAI 🔥:Grok Bot 变得主动,现在可以自行建议有用的东西。 用户将被要求配置一个新的 Primary Bot,或选择一个已有的 Bot 作为 Primary(例如你的 Chief of Stuff)。 Primary Bot 功能正在逐步推送! https://x.com/bot/status/2105713240701538538/video/1

  25. X:fal (@fal)54

    Tavus 发布视频图灵测试模型 Griffin

    Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,属于 Human Interaction Model(HIM)。与 Griffin 实时对话的受访者中 48% 认为它是真人,此前系统通过率低于 3%,并在 NVIDIA 的全双工 AI 视频基准上排名第一。fal 转发该发布并祝贺 Tavus 团队。

  26. X:Elvis Saravia (@omarsar0, DAIR.AI)47

    webAI 开源 3.6B 模型 TwIL-LM3-Pro,BIG-Bench Hard 得分 95.4

    webAI 发布开源模型 TwIL-LM3-Pro,仅 3.6B 参数,可在普通电脑本地量化运行,BIG-Bench Hard 得分 95.4,远超 Qwen3-8B 的 63.7。其训练配方为:在形式逻辑上微调、将权重合并回基座模型,再用程序化验证器做 RL,逻辑分数提升的同时通用推理保持稳定。该模型在 SVAMP 上得 95%、MuSR 上得 64.1%,均为所比较小模型中的最高分。

  27. X:Rohan Paul (@rohanpaul_ai)68

    法官 Amit Mehta 驳回 Chegg 与 Penske Media 针对 Google AI Overviews 的反垄断诉讼

    联邦法院法官 Amit Mehta 驳回了 Chegg 和 Penske Media(旗下拥有 Rolling Stone 与 Variety)针对 Google AI Overviews 的两起反垄断诉讼。法官认定出版方对流量的期待不构成协议,只是搜索引擎的正常运作;两家出版方因订阅和授权费损失发生在其他市场,对 Google 搜索垄断问题也缺乏诉讼资格。

  28. X:Testing Catalog (@testingcatalog)53

    Grok 4.7 开始在 Grok 网页版和移动应用上线

    Grok 4.7 正在 Grok 网页版和移动应用中推出,成为所有模式下的基础模型,包括 Fast、Expert、Build 和 Heavy。作者提到明天的每日 AI 简报预计会因此变得更好。

  29. X:Peter Steinberger (@steipete)19

    模型自认属GPT家族引疑问

    我有很多疑问 @baggiiiie:至少我们知道它认为自己是gpt家族的一员 而且不知怎么的还一度以为是coderabbit 😆

  30. X:Testing Catalog (@testingcatalog)50

    Arceus 融资 1700 万美元推出 AI 智能体律所

    Arceus 宣布推出一家面向初创和成长期公司的律所,结合 AI 智能体和持证律师处理商业合同业务,并获得 1700 万美元融资,由 Greycroft 领投,Craft Ventures、SPC 等参投。该律所可端到端完成 MSA、DPA、NDA、订单表和供应商协议的审查、红线修订、起草和谈判,客户可通过 Slack 发送合同,工作开始前确认一口价,AI 智能体收集上下文,每份输出由持证律师审核。