
EasyVibeCoding Podcast
輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。
Episodes
Reading the feed…

輕鬆Vibe Coding — 每日策展的 X 技術社群精選、AI 趨勢分析與 Claude 實作心得的中文音訊版。
Reading the feed…
Claude Code 的臨時 +50% 每週額度提升將結束,9 月 14 日起改為永久 +25%,比目前少 17%。 額度怎麼變 ClaudeDevs 表示,目前的臨時 +50% 額度提升會維持到 9 月 14 日,之後改為比舊基準永久提高 25%。也就是從目前的 1.5 倍降為 1.25 倍;官方稱,相較今天會少 17%。不要把「永久 +25%」誤解成在目前額度上再增加 25%。詳情見 ClaudeDevs 公告。 適用方案 這次調整涵蓋下列 Claude Code 方案: Pro Max Team seat-based Enterprise 使用量怎麼計算 官方沒有公布所有使用者共用的固定 token 數。根據官方文件,實際用量會受到對話長度與複雜度、使用的功能、模型、推理強度與訂閱方案影響;不同方案的額度也不一樣。應以帳戶畫面顯示的方案額度為準,不要假設存在一套通用的絕對配額。詳細規則可參考 Claude 使用量與長度限制說明。 重設時間 每週額度會在帳戶指定的固定時間重設。無論何時開始使用 Claude 或訂閱生效,重設日與時間都不會改變;每個週期會恢復完整的每週額度。使用者可前往 Settings > Usage 查看下一次重設時間,但目前公開資訊沒有揭露 9 月 14 日切換的確切時刻、時區,或個別帳戶可能存在的例外。相關規則見 Pro 方案說明。 後續規劃 Clau
Z.ai 釋出 GLM-5.3 開放權重,官方稱 Z.ai Code Bench 較 GLM-5.2 提升 50%。 核心更新 Cyan 轉述 Z.ai 發布 GLM-5.3,模型沿用 GLM-5.2 的 base model,官方表示所有增益都來自 post-training。使用者可從官方 GLM-5.3 repository 取得模型配置、tokenizer 模板、safetensors 權重、使用說明與授權條款,並下載、修改及在本地使用。 能力宣稱 repository 指出 GLM-5.3 強化複雜 coding 與長跨度任務,並列出以下 vendor benchmark claims: 相較 GLM-5.2,Z.ai Code Bench 提升 50%。 在 Terminal Bench 3.0 與 Agents' Last Exam 達到 open-source state-of-the-art 結果。 CyberGym 的 vulnerability-discovery 結果達到 state-of-the-art;官方還稱 cyber 能力在 post-training 期間成長速度超出預期,且越接近 exploitation chain 後段,增益越大。 限制與風險 上述 benchmark、state-of-the-art 與 50% improvement 都
Uber agent software factory 請求量增 9.4 倍,單次 session 成本降 52%。 規模與成效 Uber Engineering 的官方文章指出,超過 70% 的 pull requests 可歸因於本機或雲端 Agent;工程師已建立超過 3,600 個可重複使用的 skills,每日執行超過 30,000 次。2026 年 2 月至 8 月中旬,weekly active users 成長為 7 倍,requests 成長為 9.4 倍,但整體支出維持穩定。 Uber agent software factory 自 2026 年 2 月至 8 月期間每週活躍使用者成長 7 倍、Agent requests 成長 9.4 倍,而整體 Cost 支出逐漸趨於穩定。 成本控制機制 Uber 透過多項架構與排程策略控制 agent 成本: Uber 在固定模型條件下,每 1,000 次請求成本與每 session 成本均自高點顯著下降 在不同 model 之間採用 managed routing,並預設 Medium reasoning。 約在 400,000 token 觸及 compaction,壓縮過長的 context。 依需求設定 prompt-cache TTL,降低重複處理成本。 將 MCP 形態的能力移到 CLI、tool-searc
Tibo 宣布 Codex 與 ChatGPT Work 所有付費使用者重置使用量,預期多用 10% 至 50%。 重置按鈕已於今天按下,慶祝活動則延至明天,但官方沒有說明此次重置影響哪些使用量週期或額度計數器。 重置時間與範圍 這是 Tibo 在 2026 年 8 月 29 日發布的第一方公告,對象是 Codex 與 ChatGPT Work 的所有付費使用者。後續貼文表示,原定的慶祝活動改到明天,原因是重置按鈕今天已經按下;這只提供執行時間線,沒有新增 5 小時額度、每週額度或其他重置範圍的資訊。因此,使用者應以帳號畫面顯示的實際可用額度為準,不宜自行推定特定刷新週期。 消耗異常與修復 Tibo 表示,團隊分析了數千份回報,逐項檢查造成使用量異常增加的細節,並稱下列問題都已修復: Compaction 會保留舊圖片,甚至再次觸發 compaction;修復後,重度使用圖片的使用者消耗量約下降 10%。 Background worker 可能繼承 Stop hooks,持續在背景執行;這影響少於 1% 的使用者,其中一個案例曾檢查是否能停止達 15,000 次。 設定 /goal 後,任務完成仍可能繼續執行,或重試已失效的工具;部分案例消耗了每週額度的 15% 至 70%。 部分 custom automations 的執行頻率高於使用者設定。 較小型的 model,例如 Lu
OpenAI 擬於 2026 年 11 月 12 日終止 SpaceX 收購 Cursor 後的模型合約。 合約理由 OpenAI 於 2026 年 8 月 28 日通知 SpaceX,將依合約中的控制權變更條款,在可行的最晚時間取消合約。OpenAI 表示,基於其過去與 Elon Musk 旗下公司合作時出現違約的經驗,無法確信 SpaceX 會依照服務條款使用技術;面對即將推出的模型 Astra,OpenAI 也認為自己必須提高對安全與合規的責任。雙方合作接近四年,OpenAI 同時表示重視 Cursor 團隊、產品及開發者社群。 時間與不確定性 OpenAI 提供最長的合約通知期,規劃約三個月的過渡期;在此期間,Cursor 仍可使用目前提供的 OpenAI models,但 Cursor 可能選擇更早停止存取。11 月 12 日目前只是提議的 transition date,最終 termination date 尚未由兩家公司確認。 Cursor 回應 Michael Truell 表示,Cursor 對 OpenAI 公開計畫在三個月後阻止使用者存取 OpenAI models 感到遺憾。他指出,OpenAI models 約占 Cursor 使用者流量的 5%,但原文未提供這項比例的統計期間或計算方法;Cursor 正與 OpenAI 團隊協商,希望解決爭議。Curs
OpenAI 網路防禦公開信提出三項進展指標,呼籲建立集體防禦。 OpenAI 發布集體網路防禦公開信,Greg Brockman 也在 X 轉載全文。公開信由超過 100 個組織連署,警告醫院、供水、網路基礎設施等關鍵服務仍受舊弱點、過度權限、弱驗證與設定錯誤影響,而 AI 支援的攻擊在未來幾個月可能變得更普遍。 行動被分成四個角色:一般組織要修復高風險弱點,落實最小權限與縱深防禦;資安公司與技術夥伴要測試前沿攻擊能力、支援關鍵基礎設施並協調事件回應;政府要推動可採取行動的威脅情報與授權測試;前沿 AI 公司則要普及防禦 AI,並讓 Agent 身分可追蹤、能追究責任。 公開信建議用三項數字追蹤進度:受保護的組織數、事件遏止時間,以及經驗證有效的修正措施。這是一份動員議程,不代表連署者已完成部署,也沒有給出共同量測協定、負責人或實作時程。 原文:https://easyvibecoding.app/curated/3169-greg-brockman-openai-cyber-defense-action-protected
fal 推出 H3 Max:3 秒生成 5 秒 768p 影片。 fal 宣稱 5 秒、768p 影片可在 3 秒內完成,但相關速度與偏好結果均來自 fal 自行評估。 模型定位 H3 Max 保留 MiniMax H3 的核心能力,新增強化 prompt adherence 與視覺品質的 post-training data,並以較快速度與較低價格為產品定位。它並非 base MiniMax H3 的全面替代品;需要 2K 輸出、reference input 或 editing endpoint 的使用者,仍應選擇 base MiniMax H3。 效能與評估 根據 fal 官方文章〈Introducing H3 Max by fal〉,H3 Max 的吞吐量成長為官方 MiniMax H3 endpoint 的約 35 倍,速度約為品質相近模型的 15 倍。fal 也比較了 12 個具名影片模型,評估整體品質、prompt understanding 與 aesthetics;不過研究由 fal 設計並執行,未提供完整的 12 模型結果表或 Confidence intervals,因此不能視為獨立驗證。 最佳化方法 fal 表示,團隊會淘汰降低內部品質排名的最佳化方案;只有在偏好排名維持不變時,才採用 lower precision、較少 sampling steps 或
ClaudeDevs 與 VercelDev 整合 Claude Managed Agents 與 Vercel Chat SDK,串接逾 15 個聊天通路。 整合方式 官方 cookbook 與 quickstart 以瀏覽器研究分析師為範例:Vercel Chat SDK 負責聊天介面,Claude Managed Agents 則為每段對話建立一個持久 session,處理研究、token 串流與工具呼叫。相同 handler 可跨 Slack、Teams、Discord、WhatsApp 等 more than 15 個 adapter;VercelDev 的貼文則稱可連接 more than 30 個其他 app,兩者可能是不同統計範圍,不應直接合併。 對話與狀態 伺服器不另存一份對話逐字稿,而是把 conversation ID 當作 Managed Agents session ID,從 session event log 重播歷史;狀態管理、內容壓縮與 prompt caching 也留在託管 session 中。示範畫面可看到使用者訊息、agent thinking、web_search 工具執行結果,以及透過 thread.post() 回傳的串流內容,顯示固態電池研究從搜尋到回覆的完整事件流程。 示範透過 Chat SDK 連線 Claude Managed
Anthropic 啟動 Model Hardware Standard 首階段預覽,統一 Agent 控制實驗室設備。 核心概述 MHS 是 不綁定模型 的儀器標準,目標是讓 Agent 以一致的控制方式協調顯微鏡、液體處理機與機械手臂,不必為每台設備打造 客製整合。Anthropic 宣稱,整合時間可由數週或數月縮短至數小時或數分鐘,但這些效益目前仍是官方公告中的說法,尚無獨立驗證。 控制方式 對具可程式化介面的設備,MHS 提供三種操作管道: 透過 MCP 連接設備與 Agent。 使用 CLI 執行控制操作。 透過 程式碼檔案控制 撰寫或執行設備控制內容。 公告也提到,研究 preview 包含安全檢查;不過目前仍有 概念驗證 限制,未列出所有不支援的儀器或部署條件,因此不能視為已適用於生產環境的完整方案。 實例與結果 Anthropic 提供以下案例,說明 MHS 如何處理跨設備工作: Genentech:自動化 BCA assay。 University of Washington:遠端監控 qPCR,並完成不碰撞的孔盤交接。 Carnegie Mellon:在約 8 小時內建立 連續稀釋配置。 畫面展示 介紹影片以「Before MHS」與「After MHS」對照:原先顯微鏡、相機、感測器、培養箱、真空幫浦、離心機、光譜儀、移液機器人與機械手臂等設備,分別透過自訂軟
NVIDIA 與 AWS 規劃在 2027 至 2028 年再部署 200 萬部 GPU,並擴大 CPU 與 AI 基礎設施合作。 這次擴大全堆疊基礎設施,反映企業、前沿研究實驗室、政府與新創正把代理型 AI、科學研究、企業自動化及實體 AI 從試點推向正式生產。 運算容量 AWS 表示,2026 年 GTC 公布自 2026 年起增加超過 100 萬部 NVIDIA GPU 後,實際需求已超出原先預期,因此再規劃部署 NVIDIA Blackwell Ultra、Rubin 與 Rubin Ultra GPU。AWS 也會擴大 Blackwell 供應,將 NVIDIA RTX PRO 4500 Blackwell Server Edition GPU 導入 Amazon EC2 G7 執行個體;相較前一代 G6,G7 的 AI 推論效能為 4.6 倍、圖形效能為 2.1 倍。AWS 稱自己是首家提供 RTX PRO 4500 加速運算執行個體的大型雲端服務商,並將與 NVIDIA Spectrum 網路合作,改善大型 GPU 叢集的 AI 訓練效能。 CPU 與異質架構 雙方正合作把 NVIDIA Vera CPU 基礎設施 帶到 AWS,提供需要高效能 CPU 與加速運算並用的 agentic AI 工作負載更多選擇。AWS 也將擴大 NVIDIA NVLink Fusion
Claude Code 新增 SendFeedback 工具,自動起草錯誤回饋,讓使用者審閱後再送出。 核心功能 2026 年 8 月 26 日,官方 @ClaudeDevs 表示,當 Claude Code 執行失敗、察覺自己犯錯,或使用者指出問題時,Claude 會自行撰寫回饋報告。使用者可先檢視、修改並核准內容,再提交給開發團隊。 黑色介面中央顯示 Claude Code 自動草擬 bug report 的畫面,內容包含問題原因說明、運作耗時 31 秒,以及提供審查、傳送與忽略的操作選項。 實作細節 Thariq 表示這項變更由他完成並推出;使用者不必再輸入 /feedback 手動撰寫報告,只要讓 Claude 起草並核准即可。這套流程讓團隊直接收到使用者確認過的錯誤脈絡,協助釐清問題並改進 Claude。 原文:https://easyvibecoding.app/curated/3146-claude-code-sendfeedback-tool-drafts-error-feedback-user
Z.ai 發布 GLM-5.3-Flash:以 18B 啟用參數支援原生多模態與 1M-token 長上下文。 Z.ai 在 2026 年 8 月 26 日的貼文中強調,這款模型以較低成本提供 coding 與長跨度 Agent 任務能力,並完全在中國 AI 晶片上執行。 正式發布與定位 GLM-5.3-Flash 是 GLM-5 系列首個原生 multimodal model,採用 320B-A18B 架構,也就是總參數 320B、啟用參數 18B,並以 MIT License 發布。它支援 1M-token context window,最大輸出長度為 131K token,預設使用 max reasoning。Z.ai 表示,模型先前曾以 Ox Alpha 名稱預覽,且整個執行過程都由 Chinese AI chips 提供支援。 模型已可在多個官方平台使用: Weights:Hugging Face 模型頁面 API:GLM-5.3-Flash API 文件 Coding Plan:訂閱頁面 ZCode:ZCode Chat:Z.ai Chat AutoClaw:AutoClaw 產品文章:Z.ai 官方 blog 技術報告:Technical report 引用資料另以 2026 年 2 月 17 日記載發布時間,與 Z.ai 貼文標示的 2026 年 8 月 26 日不
OpenAI Developers 發布 $visualize,把 ChatGPT Work 與 Codex 資訊轉成可互動視覺介面。 功能定位 Katia Gil Guzman 於 2026-08-25 表示,視覺學習者可以在 ChatGPT Work/Codex 中輸入 $visualize,將「任何資訊」整理成易於理解的視覺呈現。OpenAI Developers 隔日發布同一功能提示;社群也有人寫成 @visualize,Katia 回應兩種用法都能運作,另有一個 plugin,但其中只包含這個 skill。 將長篇文件或會議記錄整理成結構化摘要。 把決策內容、交付時程、待決事項與任務狀態集中呈現在介面中。 透過分頁、按鈕與檢視切換,讓使用者直接在聊天中互動,甚至送出 prompt。 將完成的視覺化結果匯出成圖片,或發布成網站並分享連結。 示範內容 影片以活動規劃會議記錄為例,畫面展示一個名為 Builder Week 的活動摘要。demo 中顯示,活動規劃日期為九月 8 日,活動日期為九月 24–25 日;任務分配包含 VB 4 項、Pauline 4 項、Katia 3 項,另有 11 項已指派與 1 項未指派。介面也列出以互動地球儀開場、三場 35 分鐘工作坊、錄製示範與離線備援等決議。 示範在 ChatGPT 中透過 visualize skill 將會議記錄轉換為
OpenAI 發布 Jalapeño:每瓦 AI 工作量提升 1.5 至 1.9 倍,預計 2026 年底部署。 核心進展 OpenAI 在 2026 年 8 月 26 日分享首款自研推論晶片 Jalapeño 的實驗室結果,強調同一套架構同時提高吞吐量、降低延遲,不必在兩者之間取捨。官方表示,這將帶來更快的 ChatGPT 回應、更靈敏的 Codex session 與 Agent,以及需求持續成長時更可靠的服務存取。Jalapeño 預計在 2026 年底開始部署到 OpenAI 的運算基礎架構;Gen 2 已深入開發,Gen 3 也正在成形。 實測數據 OpenAI 以公開 benchmark InferenceX,在相同使用者體驗與功耗條件下,比較 Jalapeño 和商用 AI 系統,涵蓋 GPT‑OSS 120B、DeepSeek R1 670B 與 Kimi K2.5 1T: 三個模型的峰值每瓦 AI 工作量成長為 1.5 至 1.9 倍。 端到端延遲降低為原本的 1/1.7 至 1/3.6。 面向高度互動的工作負載,效能成長為 2.1 至 4.1 倍。 在最大的公開模型 Kimi K2.5 1T 上,每瓦峰值效能約成長為 1.5 倍,端到端延遲降低為 1/3.4。 晶片額定功耗為 700W,但測試工作負載的持續實測功耗維持在 550W 以下。 Jalapeño 在
Alibaba 開放 Qwen3.8-Flash-Next 權重,以 6B active parameters 探索 Qwen4 成本效率架構。 Qwen 的 Qwen3.8-Flash 發表宣傳圖,深色背景搭配藍色幾何光暈與幾何立體造型,正中以大字顯示產品名稱與「Now Available」字樣,下方標註「Qwen3.8-Flash-Next:Now Open Weights」。 Qwen3.8-Flash 的 production version 預計很快透過 QwenCloud API 提供,輸入價格為每 1M tokens 0.16 美元、輸出價格為每 1M tokens 0.47 美元。 發布內容 Qwen3.8-Flash-Next 是 multimodal MoE 模型,也是 Qwen4 架構的 early preview。這次先開放權重,讓社群能在 Qwen4 完整模型建立前獨立評估新設計;至於名稱不同的 Qwen3.8-Flash production version,Qwen 表示將稍後透過 QwenCloud API 上線。模型主體有 125B parameters,另配置 51B N-gram Embedding parameters,但每個 token 只啟用 6B parameters。 架構更新 新模型從注意力、殘差、嵌入與最佳化器四個方向改造,重點如
Shopify tobi lutke 考慮暫禁 Claude Code,因其僅讀取 CLAUDE.md 造成團隊規範不一致。 Claude Code 團隊則表示,正研究提高可客製化程度,但仍認為不同 model family 不可直接互換。 核心爭議 tobi lutke 指出,Agent 設定與 CLAUDE.md、AGENTS.md、.agents/skills 會沿著目錄樹遞迴套用;在擁有數千名開發者的 monorepo 中,只要某個目錄漏掉其中一份檔案,就可能讓部分開發者使用「被切除部分能力」的 Agent。Shopify 雖以自動化修正,卻因此承擔原本不該存在的複雜度成本。 官方回應 Thariq 表示,Claude Code 正朝更容易 hackable 的方向開發,未來將能更簡單地使用 Agents.MD,或修改其他 system prompt。團隊當初限制格式,是因為 system prompt 會大幅影響效能,而且 Claude Code 會依不同 model 使用不同 system prompt;他也承認這種維護負擔對部分團隊不值得。 暫時方案 在正式支援推出前,使用者可以在 CLAUDE.MD 中以 @Agents.MD 引用 Agents.MD。Thariq 另分享了 Claude model 對技能、system prompt 與 Claude.MD 格式
Skild AI 發布 S1,單一示範影片即可免微調完成陌生長時程機器人任務。 核心主張 Skild AI 將 S1 定位為新一代 robotics foundation model,讓機器人像語言模型學習一樣,從一段 video prompt 理解任務,直接輸出動作完成操作。這些任務可以完全不在預訓練資料中,也不必改動模型權重;S1 能在不同環境與機器人形態上執行。Skild AI 表示,S1 已能組合預訓練時學會的 skills,或在現場建立新的 skills,完成煮咖啡、移植盆栽、煎鬆餅與組裝套件等任務。 以紙本學術論文開場並帶出 in-context learning 概念與其後模型演進曲線、接著透過多角度視角展示以影片 prompt 讓機器人執行植物盆栽操作的影片 陌生任務與長時程操作 S1 的重點不只是模仿短動作,而是處理從未看過、且需要連續數十個操作步驟的 long-horizon tasks。影片展示了雙臂機器人自主執行煎鬆餅、手沖咖啡與盆栽移植;其中植物移植的實驗從晚上 8:54 開始準備,從示範到自主執行只花 11 分鐘。Skild AI 特別指出,團隊曾以完整預訓練資料搜尋,確認資料中沒有翻鬆餅的例子,因此 S1 翻鬆餅的能力被視為從單一 video prompt 推論出的 out-of-distribution 行為。 雙臂機器人操作平底鍋煎鬆餅、手沖咖啡與
ChatGPT Work 擴充排程任務,支援 Slack、Gmail 與 GitHub 變化觸發並開放 Free 使用者建立 3 個任務。 使用範圍 Plus 與 Pro 使用者可設定以外部服務變化為觸發條件的任務。 Free 使用者現在也能建立排程任務,但上限為 3 個。 使用者可分享自己喜愛的任務,讓其他人自行客製化後使用。 網頁介面浮現對話框,內文顯示 Gmail 圖示與「Email my vet asking for the codes my insurer needs then file the claim when they reply.」的文字指令,下方帶有附加檔案按鈕、模型版本選單(5.6 Sol Medium)、麥克風圖示與送出按鈕。 示範任務 ChatGPT 同步分享多個可直接參考的範例,涵蓋工作追蹤、娛樂推薦、收件匣分析與待辦提醒: 檢視 Slack、GitHub、email 與 Linear,整理上週完成的所有發布項目:工作發布摘要 。 每週五彙整各大串流服務推出的新影片與節目,推薦值得觀看的內容:串流內容推薦 。 檢查近期 email 收件匣,找出可能節省開支的機會:省錢機會檢視 。 每個工作日下午,找出尚未回覆的問題、待核准請求,以及明確有人等待本人處理的承諾事項:待回應事項整理 。 排程任務設定介面,上方標籤顯示 Chat 與 Work,對話框內以自然
ChatGPT Work 推出網站登入代辦,付款與最終提交前仍須使用者確認。 功能定位 ChatGPT Work 的核心是代替使用者操作網站與線上服務。官方說明,凡是平常需要自行開啟瀏覽器並逐步點擊的事情,都可以嘗試交給 ChatGPT Work 處理;登入功能自 2026 年 8 月 26 日起陸續開放給 Plus、Pro 與 Business 使用者,支援網頁及行動裝置。 可處理的任務 官方列出的使用情境涵蓋日常生活、工作與小型企業營運: 為新住處設定公用事業服務、預約 DMV 或護照辦理時段。 透過保險服務查詢理賠費用,依使用者可配合的時間尋找並預約網路內醫師。 查詢汽車註冊到期日並準備續期文件,或為退貨安排包裹取件。 比對租屋保險與寄給房東的問題,搜尋符合條件的租屋物件並儲存清單。 上傳照片後補貨、預約獸醫、取消改期行程的票券,以及提交醫療處置的理賠文件。 搜尋轉售網站的新商品上架資訊並儲存可能感興趣的品項。 尋找具備特定經驗的候選人並草擬聯絡內容,從 email 擷取發票後送交會計軟體。 草擬租屋詢問回覆、填寫小型企業許可證申請,依近期客戶通話內容在供應商入口網站新增待辦事項。 分析小型企業最新的廣告活動。 登入與驗證流程 輔助影片展示了 ChatGPT Work 在手機介面處理加州 DMV 補發駕照申請的流程,但這些畫面屬於 demo 觀察,不應視為額外的正式規格。畫面
M6 Mac mini 登場:899 美元起,Apple 主打本機 AI 產品定位 Apple 在 Newsroom 公告 推出搭載 M6 與 M5 Pro 的新款 Mac mini,外觀仍維持緊湊的圓角方形鋁製機身。Tim Cook 將它定位為兼顧日常生產力與 AI 工作的桌機;官方宣傳影片以晶片變形為肌肉、賽車、機器人與火箭的黏土動畫呈現產品,但這是行銷素材,不是獨立效能測試。 硬體規格 M6 Mac mini 配備 12 核心 CPU、12 核心 GPU,每個 GPU 核心都加入 Neural Accelerator,並搭載兩組 16 核心 Neural Engine。標準統一記憶體為 16GB,可設定至 32GB,記憶體頻寬最高 170GB/s。M5 Pro 則可擴充至 18 核心 CPU、20 核心 GPU、64GB 統一記憶體與 307GB/s 頻寬,峰值 CPU 與 GPU 吞吐量可能高於 M6,儘管產品名稱使用較早的晶片世代。 AI 與連線能力 Apple 宣稱 M6 的 AI 效能最高成長為 M4 的四倍、圖形效能最高成長為兩倍,CPU 效能則比 M4 快 40%;這些倍數是 Apple 的官方說法,不能視為獨立基準測試結果。針對本機 AI,Apple 在其測試條件下測得 LM Studio 的 prompt 處理速度最多達到 M4 的 4.8 倍、M1 的 13
ChatGPT Work 與 Codex Plus 明日恢復 5 小時使用上限,Pro $100 與 Pro $200 暫不受限。 明日恢復 5 小時上限 這項限制原本曾宣布,後來延期,如今預計重新啟用。 Tibo 認為,5 小時上限能平滑運算資源負載,讓 Plus 方案維持相對寬鬆的每週使用量。 使用體驗考量 Plus 使用者多半是較偶爾使用服務的人,以及剛加入的新使用者;他們可能不小心用完整週額度,之後因無法使用而感到困惑,整體體驗並不理想。 Pro 方案例外 未來幾個月內,Pro $100 與 Pro $200 訂閱仍不會啟用 5 小時限制。 原文:https://easyvibecoding.app/curated/3127-openai-chatgpt-work-codex-plus-restore-five-hour-limits-pro
Matthew Berman 訪談 Tibo:Astra 與新模型如何改變開發者工作流程。 訪談也觸及使用限制反覆重設、自我遞迴改進、AI 風險與環境影響,呈現產業加速發展下的期待與爭議。 訪談重點 影片章節顯示,Tibo 分享了在 Google DeepMind 的學習(0:45),並說明 OpenAI 如何建立「relentless culture」(4:22)。其他主題包括: Astra 與新一代模型(7:23) AI 加速改變開發者工作流程(11:18) ChatGPT 與 Codex 的整合方向(14:27) OpenAI 與 Anthropic 的比較(20:25) OpenAI 為何持續重設使用限制(23:37) Recursive Self-Improvement(30:25) 導致「The Pause」的危險(32:00) Ultra Fast 是否會成為預設模式(34:13) 為何每個人都應該嘗試 AI(43:20) 「Reset」形象 社群回應集中在 Tibo 經常重設使用者限制的形象。Emmanuel Crown 稱這是首次看見「大重設按鈕」背後的人;其他留言則以「reset lord」和「替我拯救使用限制的人」戲稱他。Matthew Berman 回應,Tibo 在 OpenAI 實際負責的工作不只是按下重設按鈕,顯示這個網路稱號只反映其公開形象的一部分,
x.ai 推出 Grok Voice Think Fast 2.0,登上語音對語音評測第一名並支援語音代理。 核心發布 @SpaceXAI 在 2026 年 8 月 25 日表示,該模型評估的不只是語音生成,而是能否理解聽到的語音、推理、解決真實客戶問題,並透過 Agent tools 正確完成任務。Grok Voice Think Fast 2.0 已可透過 API 或 Agent Builder 使用,開發者可在 console.x.ai 建立、調整與部署 voice agents。 實際應用 Starlink 使用 Grok Voice 處理客服與銷售來電;官方稱它能診斷硬體問題、寄送替換品,並透過語音通話與聊天功能,每週完成超過 3,000 筆訂單。這些數字是 @SpaceXAI 對實際部署成果的說法。 評測表現 7 月 29 日發布的官方公告引用 Artificial Analysis 資料,列出 Grok Voice Think Fast 2.0 的多項結果: AA Speech-to-Speech Quality Index 為 82.9%,高於 Grok Voice Think Fast 1.0 的 75.7% 與 GPT-Realtime-2.1 (High) 的 79.1%。 Big Bench Audio 語音推理分數為 97.2%,Full Duplex B
ClaudeDevs 重建 Claude 網頁版與桌面版串流 renderer,長回覆停滯次數降至約九分之一。 核心更新 ClaudeDevs 於 2026 年 8 月 25 日說明,團隊重建串流 renderer,只更新仍在變動的內容,因此: 在較慢的筆電上,長回覆的停滯次數降至約九分之一。 最嚴重的凍結時間縮短至約四點五分之一。 在 120Hz MacBook 上,串流全程維持 120fps。 畫面觀察 輔助影片以「Before」與「Now」對比同一段建立 Python 命令列支出追蹤器的長回覆。畫面顯示,舊版在約 3 秒後出現 210ms 凍結;新版則維持約 119–120fps,凍結時間為 0ms。影片底部註明,這是同一台 120Hz 筆電上的實測重建,對比 7 月 15 日建置版本與 8 月 24 日版本;這些數值屬於畫面展示,不另視為官方規格。 Claude 在網頁與桌面端串流大型長回覆時的效能對比,左側舊版在長文本輸出時頻繁遇到畫面停滯與資源耗盡,右側新版則能維持流暢且穩定的幀率。 社群回饋 Lydia Hallie 將這次更新形容為更多「生活品質」改善。 原文:https://easyvibecoding.app/curated/3123-claudedevs-rebuild-claude-streaming-renderer-reduce-stalls
Apodex 1.1 與 FrontierAgent 開源:Agent Team 可平行執行長時間研究任務 發布內容 Apodex 於 2026 年 8 月 24 日介紹 Apodex 1.1,定位涵蓋複雜專業工作、科學研究、金融分析與深度搜尋。此次同步推出三項內容: Apodex 1.1:目前能力最完整的 frontier model,可透過 Apodex 線上 workspace 使用。 Apodex 1.1 mini:35B、採 open weights,設計為可在本機部署的模型。 FrontierAgent:開源、可本機部署的研究工作台與 agent runtime,原始程式碼位於 GitHub,模型權重則整理於 Hugging Face。 使用者也能從 Apodex 線上工作台、API platform 或 技術報告 了解與使用這套系統。 Agent Team 與執行方式 Apodex 1.1 的核心功能是 Asynchronous Agent Team。系統會先拆解複雜任務,再讓多個 Agent 平行處理不同工作,持續整合各自結果;使用者可在執行途中介入、引導或重新調整方向,而不必捨棄仍然有效的既有成果。 Apodex 將這種能力歸納為兩個擴展面向,並以持久化任務狀態串起整個流程: Environment Scaling:擴大模型能學習與操作的檔案、搜尋、程式碼及其他可