跳到正文

全部动态

今日 8 条
10月2日周五
  1. IT之家(RSS)46

    索尼 PlayStation 为标准版 PS5 推出 AI 超分辨率技术 QSSR

    索尼 PlayStation 为标准版 PS5 推出基于人工智能的超分辨率技术 QSSR,全称 Quick Spectral Super Resolution,是 PSSR 的快速演进版本,也是与 AMD 合作项目 Project Amethyst 的一部分。该技术采用精简神经网络架构,率先在《漫威金刚狼》《羊蹄山之魂》上获得支持,在 PS5 上显著提升图像细节和稳定性。

  2. X:PixVerse (@PixVerse)28

    PixVerse 上线无限 GPT Image 2.5

    PixVerse 上无限使用 GPT Image 2.5!探索爆款预设 https://app.pixverse.ai/cli/gpt-image2-5?utm_source=X&utm_id=Social

  3. Factory 研究 / 产品(RSS)35

    Factory Analytics 上线:按模型和用户透明呈现每次会话消耗

    Factory 推出重新设计的 Analytics,可按模型和用户查看 credits 消耗、模型占比与成本集中度,并展示日活、月活用户和会话数。Factory Router 自动为每个请求选择高效模型,生产环境总成本较前沿模型费率降低 63%,同时保持前沿级评测表现。

  4. IT之家(RSS)65

    OpenAI 在 ChatGPT 全球上线虚拟试穿与商品收藏功能

    OpenAI 于当地时间 1 日在全球推出 ChatGPT 两项购物新功能:虚拟试穿服装和配饰,以及可保存商品、与试穿图片放在一起的收藏功能。新功能基于 ChatGPT Images 2.5 模型,据称光线更自然、纹理更丰富、编辑指令更稳定且生成更快。用户可上传自拍照或全身照查看试穿效果,也可描述穿衣风格让 ChatGPT 挑单品,或上传名人穿搭照找可购买同款。

  5. X:Cursor (@cursor_ai)35

    GLM 5.3 系列上线 Cursor

    GLM 5.3 和 GLM 5.3 Flash 现已在 Cursor 上线! GLM 5.3 Max 是 CursorBench 4.0 上得分最高的开放权重模型。

  6. X:OpenRouter (@OpenRouter)32

    Seedream 5.0 Flash 上线 OpenRouter

    来自 @ByteDanceSeed_ 的 Seedream 5.0 Flash 现已在 OpenRouter 上线 Seedream 5.0 中快速、高性价比的档位,专为高吞吐量生成和低延迟交互式编辑打造 https://openrouter.ai/bytedance-seed/seedream-5-0-flash

  7. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)59

    Perplexity 开源多模态决策模型 pplx-decider-27b 并推出 Decisions API

    Perplexity CEO Aravind Srinivas 宣布开源多模态决策模型 pplx-decider-27b,并通过新的 Decisions API 提供,输入 token 价格为 4 美分/百万,输出 token 免费,还表示未来几天会进一步降价。该模型(API 版本 pplx-decider-v1-27b)被训练为对固定答案集输出概率分布而非文本,在 7,210 行固定评测集的 11 个决策基准上总体准确率 85.71%,其中 RAGTruth 88.80%、TabFact 90.60%。

  8. X:Krea AI (@krea_ai)69

    FLUX 3 Image 现已登陆 Krea,支持多轮编辑与 4K 生成

    Krea 宣布 FLUX 3 Image 已上线其平台。新能力包括多轮编辑且不改动其他像素、用 bounding box 排版图像、最高 4K 生成,以及组合最多 10 个参考图。

    推荐理由:官方宣布 FLUX 3 Image 上线 Krea,列出了多轮编辑、4K 生成等具体能力,读者可据此评估是否替换现有图像工作流。

  9. X:fal (@fal)51

    Grok Imagine Video 1.5 Lite 上线 fal 平台

    fal 宣布 Grok Imagine Video 1.5 Lite 上线,这是 Grok Imagine 视频家族中的轻量版模型。支持文生视频和图生视频并带原生音频,时长 1 到 15 秒;可输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种画幅。

  10. X:OpenRouter (@OpenRouter)72

    FLUX 3 Image 上线 OpenRouter,支持原生 4K 生成与多参考编辑

    Black Forest Labs 的 FLUX 3 Image 现已上线 OpenRouter,是支持文生图与多参考编辑的旗舰图像模型,原生可渲染至 4K。原文提到可精确多轮编辑不动其他像素、用 bounding box 布局、最多用 10 个参考图合成,商业权重已开放,开放权重版将在未来数周发布。

    推荐理由:原文给出 FLUX 3 Image 的核心能力与开放权重计划,读者可据此评估是否接入工作流。

  11. Suno:Blog(网页)71

    Suno 推出 Speech beta:语音与背景音乐一体生成

    Suno 推出 Speech beta,称其为首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型。用户输入文字并描述想要的声音和音乐风格即可创作,beta 已向所有用户开放,官方提示仍存在口音漂移、停顿过重等问题并将持续改进。

    推荐理由:官方介绍了 Speech 的玩法和 beta 限制,还附了官方博客链接,想试用或了解语音加音乐一体生成的可以看看。

  12. X:fal (@fal)58

    fal 发布 fal Recast,一键替换视频中的角色

    fal 发布 fal Recast,上传已有视频加一张新角色参考照,即可替换画面中的角色,同时保留原始动作、镜头运动、剪辑和音频。可用于制作角色变体、面向不同受众调整广告素材,无需重新拍摄;该功能由 H3 Max 驱动。

  13. X:Higgsfield AI (@higgsfield)59

    Higgsfield 上线 Black Forest Labs 的 FLUX 3 Image

    Higgsfield 宣布 FLUX 3 Image 已在其平台上线,该模型来自 Black Forest Labs。支持只改一处细节不动其余部分、用 bounding box 放置物体、最多组合 10 个参考图,以及生成最高 4K 分辨率图像。

  14. X:Boris Cherny (@bcherny)62

    Claude Code 推出 Mods,可通过提示词自定义行为与界面

    Claude Code 推出 Mods 功能,用户只需提示词即可自定义 Claude 的工作方式和界面外观,也可用几行 TypeScript 编写或让 Claude 代为构建。Mods 随插件分发,通过 /plugin 在 CLI 或桌面应用安装,并可作为插件分享给他人。

  15. X:Testing Catalog (@testingcatalog)64

    Claude Code 推出 Mods 功能,用户可修改构建并自定义 UI

    Anthropic 为 Claude Code 推出 Mods 功能,用户可以修改构建。Mods 本质上是 hook,随插件分发,每个是一个小型 JavaScript 或 TypeScript 模块,在会话内运行并能看到每个事件,可重写或替换 Claude Code 的行为,甚至绘制自定义 UI,还可通过 Claude Directory 与他人分享。

  16. Hacker News 热门(buzzing.cc 中文翻译)65

    Earendil 发布 Pi 1.0 稳定版及实验性包 Pi Durable

    Earendil 发布 Pi 1.0,一个稳定、极简、可扩展的智能体编码框架,每周有数十万人使用。1.0 新增 Codemode(原生支持 MCP 及 Jev、图像模型等非 LLM 模型)、虚拟模型扩展支持、延迟工具加载、Anthropic 模型缓存预热、会话中途系统消息、新 TUI 主题和默认全屏模式。

  17. X:fal (@fal)62

    fal 上线 FLUX 3 文生图与图像编辑试用入口

    fal 宣布 Black Forest Labs 的 FLUX 3 可在其平台试用,提供文生图与图像编辑两个入口。链接为 https://fal.ai/models/blackforestlabs/flux-3/text-to-image 和 https://fal.ai/models/blackforestlabs/flux-3/edit-image。

  18. X:fal (@fal)63

    FLUX 3 Image 上线 fal 平台

    fal 宣布 FLUX 3 Image 已上线平台,主打精准图像编辑且保留未改动部分。该模型支持原生 2K 和 4K 图像生成、最多组合 10 张参考图、一次完成多个定点编辑,并可对布局和构图做细致控制。

  19. TechCrunch · AI61

    ChatGPT 上线虚拟试穿与收藏购物功能

    OpenAI 宣布 ChatGPT 全球上线两项购物功能,分别是虚拟试穿和收藏(Favorites)。用户在购物结果中点击新的 Try On 按钮并上传自拍或全身照,即可查看服装或配饰的上身效果,也可上传网页截图等商品图让 ChatGPT 代为试穿;Favorites 则把商品存入应用内的 Library 以便之后找回,并与试穿图片一起保存。

  20. X:Thariq (@trq212)66

    Claude Code 推出 Mods 功能,支持自定义行为与 UI

    Claude Code 推出 Mods 功能,用户可以修改其行为、自定义 UI 并替换自己的功能。Mod 可用几行 TypeScript 编写或让 Claude 代为构建,随插件分发,可在 CLI 或桌面应用中通过 /plugin 安装;作者称这是为了让软件可扩展成为一等公民。

  21. X:Rohan Paul (@rohanpaul_ai)55

    Onepin 发布:面向语音生产线的配音校对工具,可修正发音错误

    Podonos 推出 Onepin,定位为文本转语音之后的生产校对步骤,在配音上线前逐行检查。它内置 400 万词发音词典校对人名和产品名,可先拼写价格和日期,为每行音频评分自然度、清晰度和词语准确度,并用同一声音修复错误单词而无需重录,兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费开始且无需信用卡。作者引用示例指出语音模型读 "03/04/27" 时会静默决定是三月还是四月,而输出听起来同样自信。

  22. X:Testing Catalog (@testingcatalog)36

    Grok Bot 新增主动建议功能

    SPACEXAI 🔥:Grok Bot 变得主动,现在可以自行建议有用的东西。 用户将被要求配置一个新的 Primary Bot,或选择一个已有的 Bot 作为 Primary(例如你的 Chief of Stuff)。 Primary Bot 功能正在逐步推送! https://x.com/bot/status/2105713240701538538/video/1

  23. X:OpenRouter (@OpenRouter)45

    Liquid AI D1 上线 OpenRouter

    来自 @liquidai 的 D1 已在 OpenRouter 上线。 这是一个有竞争力的决策模型:发送你应用的状态以及 yes/no、选择或评分问题,就能得到带类型的答案,每个选项都附带概率。零数据保留。 $0.04/M 输入,$0 输出,65K 上下文 https://openrouter.ai/liquid/d1