
AI VFX PODCAST:AI领域每周要闻
AI VFX NEWS从视觉制作的角度观察整个人工智能产业。两位主持人面对同一组事件,得出不同判断,并在争论中找出当天或本周最关键的矛盾,而不是照着新闻逐条复述。节目把模型发布与三维图形、合成、渲染和制作流程联系起来,也追踪算力基础设施、资金、能源、安全与机器人技术。每一期都追问,实验室之间的竞争和技术路线的变化,最终会怎样进入真实生产。合成声音,内容自动整理并有编辑参与
Episodes
Reading the feed…

AI VFX NEWS从视觉制作的角度观察整个人工智能产业。两位主持人面对同一组事件,得出不同判断,并在争论中找出当天或本周最关键的矛盾,而不是照着新闻逐条复述。节目把模型发布与三维图形、合成、渲染和制作流程联系起来,也追踪算力基础设施、资金、能源、安全与机器人技术。每一期都追问,实验室之间的竞争和技术路线的变化,最终会怎样进入真实生产。合成声音,内容自动整理并有编辑参与
Reading the feed…
本周的感觉更像是对整个生成式技术栈的压力测试,而非渐进式演进。DeepSeek 为 V4-Flash 赋予了视觉能力;Black Forest Labs 证明 FLUX 3 Upscale 能够超越 Topaz;与此同时,阿里巴巴达摩院凭借 4DAnyone 仅凭单段视频构建人物的能力令人震惊。OpenAI Luna-Lisa Alpha 的泄露以及 Stealth 在 OpenRouter 上免费发布的 Ox Alpha 表明,前沿技术的扩散速度比任何人预期的都要快。Scantic 针对 iPhone 的本地高斯溅射(Gaussian Splats)方案以及 Binance 的 Agent OS 交易执行系统,是这一以全面曝光为特征的一周中仅有的平静角落。
行业终于将开放权重视为竞争利器,而非慈善式的附属品。阿里巴巴发布了Qwen 3.8 Max的权重,Z.ai则通过激进的后期训练推进了GLM-5.3,与此同时,GitHub Spec Kit试图对混乱的AI编码工作流施加规范。另一方面,Suno Studio 2.0集成了完整的MIDI支持,Higgsfield推出了具备精确相机控制功能的Cinema Studio。Topaz Labs发布了Wonder 3.5以改善降噪效果,而Spotify则悄然部署了AI人格徽章,以遏制合成艺术家的推广。
行业正面临原始规模与实用价值之间的抉择,这一分野主导了本周的发布节奏。阿里巴巴的Qwen 3.8-Max宣称拥有2.4万亿参数,而Wan 3.0则正式进入公开测试阶段;但真正的焦点在于MiniMax H3如何集成至ComfyUI,以及Kling O1推出的全新文本驱动编辑工具。字节跳动发布了SeedRealtime以实现即时音视频交互,Suno则通过添加水印和限制下载来打击垃圾内容。东京黑客松在一天内产出了25部影片,引发人们思考:这究竟代表了创作效率的提升,还是仅仅是这场速度竞赛中的又一个数据点?
行业正积极优化成本与开放访问,同时却在对创意所有权方面收紧控制。OpenAI在发布三周后大幅下调了GPT-5.6 Luna和Terra的价格,而Moonshot AI则终于向公众发布了Kimi K3的权重参数。与此同时,DeepSeek V4 Flash beta在智能体任务上的表现超越了其Pro版本,阿里巴巴的Qwen3.8-Max则瞄准了完整的编程工作流。在视觉领域,xAI为Grok Imagine Video 1.5增加了1080p视频支持,Seedance 2.5展示了在三十秒序列中的空间一致性,尽管MiniMax H3推迟了其许可条款的公布。
Venice 新出台的 AI 披露规定到来之际,整个行业正同时裁减人员并加码生成式工具。Moonshot AI 将 Kimi K3 的价格减半,Alibaba 推出 Qwen3.8,而 OpenAI 的 GPT-5.6 Sol 则攻破了 Hugging Face。Maxon 为 Red Giant 加入 AI 深度图,Chaos 发布面向 Blender 的 V-Ray 7.4,并引入 AI 焦散功能;与此同时,Sony 因 3 万首曲目起诉 Udio。Netflix 以 5.87 亿美元收购 InterPositive,而 Pixar 尽管凭借 Toy Story 5 获得成功,仍然进行了裁员。
整个行业正在积极拆除围绕模型筑起的壁垒,本周基础设施和创意工具的开放清楚体现了这一转变。Moonshot AI 发布开放权重的 Kimi K3,ByteDance 则开放 Seedance 2.5 的交互式布光能力。Decart 将 Lucy 2.5 推向实时直播编辑,xAI 则取消其开源 Grok Build 后端的所有限制。与此同时,OpenAI 通过 Codex Micro 键盘将热潮落到实体硬件上,Alibaba 则预览了规模庞大的 Qwen3.8 模型。
本周与其说像一场军备竞赛,不如说是一场仓促的争夺:当所有主要参与者突然亮出最强底牌时,各方都急于证明纯粹的算力依然重要。OpenAI 将 GPT-5.6 引入 ChatGPT Work,同时发布全双工语音模型 GPT-Live-1;xAI 则以专门针对编码和自主智能体调优的 Grok 4.5 回应。Meta 推出 Muse Image 和 Muse video 加入竞争,并声称两者立即登上排行榜首位;ByteDance 则通过发布 Seedream 5 Pro 悄然巩固自身地位。与此同时,Motion Previs Studio v4 集成 MCP 支持,以简化 AI 电影工作流,Vidu S1 则推出实时交互式数字人,进一步模糊模拟与真实存在之间的界线。
这一周与其说是一场争夺巅峰的竞赛,不如说是各方在嘈杂环境中争相寻找最高效的前进路线。Google开放了Gemini Omni Flash API,同时推出价格更亲民的Nano Banana 2 Lite,Adobe则将Firefly Graph引入企业级节点工作流。Anthropic悄然恢复了Claude Fable 5的全球访问,Alibaba却在公司内部禁用Claude Code,鲜明地反映出企业信任态度的差异。与此同时,Slava Sexton发布了本地版ComfyUI Agent Kit,让用户能够通过语音命令控制工作流。
本周的主题是访问权限的重新界定:那些推出最激进工具的研发团队,同时也为其筑起了最严密的壁垒。OpenAI在政府压力下锁定了GPT-5.6 Sol;Adobe收购了Topaz Labs;Figma则通过引入代码层和WebGPU着色器,将其画布打造为全栈开发环境。Google撤销了Gemini的开放API密钥;Anthropic将Claude嵌入Slack;Sakana AI推出了Fugu以协调多个模型。字节跳动在视频领域发力最猛,发布了支持30秒片段及原生4K分辨率的Seedance 2.5。
本周的主题是工具与资金。Epic发布了搭载Mesh Terrain和MetaHuman人群功能的Unreal Engine 5.8;Adobe在Photoshop和Premiere中内置了AI助手;开源领域进展迅速:Boogu推出100亿参数图像模型,LTX 2.3提供无需终端的LoRA训练器,GLM-5.2将上下文窗口扩展至百万token。字节跳动将Seedance 2.0按相机控制能力划分为不同层级,而派拉蒙以53亿美元投资AI视频领域,为这一转变提供强力支持。
本周人工智能领域呈现出两极分化的态势:一方面迎来重大发布,另一方面则出现突然关停。Anthropic推出了其迄今最强大的模型Claude Fable 5,但几天后由于新的出口管制措施,该模型在美国以外地区被迫下线。与此同时,创意工具栈持续扩展:苹果将支持对话的Siri整合至其设备中,Krea新增了实时滑块功能,而Luma发布的Ray 3.2更新效果则不及视觉特效艺术家所预期的那样显著。