同題,各自完成
全部模型取得相同第一輪提示,獨立完成離線 HTML 動畫。允許內嵌 SVG、Canvas、CSS 與 JavaScript;不使用圖片、外部套件或網路資源。Codex 只處理啟動、檢查、封存及本比較頁,沒有代寫或修改參賽插畫。
一隻鵜鶘、一台腳踏車,一段持續前進的動畫。
讓五組 AI 各自創作,再看看第二次回頭修改,會帶來什麼改變。
先封存首份,再交付不同的改進版本。每份標明實際來源;後補成功不會改寫原始兩輪的失敗紀錄。GLM 重新評測,兩輪統一 1M context/128K output,舊作僅保留歷史、不計入新交付。IQ4 也以 40K 新上下文重跑兩輪,修正 thinking 取樣設定;逐份公開實際交付與檢查結果。
先看實際快照,再打開動畫。只展示已封存的原作;未產出與失敗也保留位置。
正式兩輪原樣保留。40K 追加仍未交付,與 16K/32K 失敗一併保留;目前成功交付目標已改為取樣修正後的全新兩輪。
可比較不同模型的成功版本,或切回同一模型的原始兩輪。選單與預覽標籤會顯示實際來源。動畫按下播放才載入;桌機模式以 1280px 縮放呈現,手機模式使用 390px 原始寬度。
| 模型 / 執行平台 | 思考設定 | 第一輪 | 第二輪 |
|---|
時間為整個任務經過時間,包含啟動、思考、工具、自檢及服務等待,不代表純推論速度。最高 effort 是請求設定,不保證固定或相同思考長度。
全部模型取得相同第一輪提示,獨立完成離線 HTML 動畫。允許內嵌 SVG、Canvas、CSS 與 JavaScript;不使用圖片、外部套件或網路資源。Codex 只處理啟動、檢查、封存及本比較頁,沒有代寫或修改參賽插畫。
全部第一輪完成或失敗並封存後,才開始第二輪。第二輪延續各自對話,提供自己的第一輪快照與瀏覽器檢查,不提供其他模型的作品。每輪任務內允許模型自行檢查、修改。
本輪 OpenCode 的讀圖條件受到主持端工具設定順序錯誤影響:停用全部工具的規則排在部分開啟規則後,雲端 Qwen 實際只見 bash、grep;Muse 回報無法讀取 PNG。這是執行工具限制,不能判定模型無視覺能力。2026-09-06 14:47 UTC 已修正設定順序,但未中斷既有程序,仍可能沿用舊工具表;原作保留,未另開第三輪。
每組每輪只有一份產出,並非多次抽樣統計。平台、工具及上下文配置不同;雲端 Qwen Flash 與本機 Qwen 27B 也不是同一模型,差異不能單獨歸因於量化。第二輪也調整了執行容量:OpenCode 單次輸出上限由 32,000 提高至 131,072 token,本機上下文由 16K 提高至 32K。因此改善不能全歸因於自我修訂。本機先前三次 runner 帶入 presence_penalty 1.5,與官方 thinking 建議 0.0 不符;目前保持 IQ4/40K/xhigh 並修正取樣重新開始。這是主持端設定錯配,不能斷言是失敗的唯一原因,對品質與穩定性的改善仍需更多驗證。沒有預設分數或勝負。
快照比較可確認畫面有變動;暫停前後測試可確認整張畫面是否凍結。這些檢查不等於足部與踏板連動正確,也不代替美術判斷。手機檢查是 Chrome 窄視窗,並非實體手機實測。無橫向溢出 ≠ 視覺比例正確;仍需對照快照檢查角色、車輪及場景有沒有被拉伸。
OpenCode Zen · OpenRouter reasoning · Qwen Flash · Qwen 27B · GLM Flash
精確模型 ID 與 effort 列於上表。agy 模型設定另以 CLI models / help 實際輸出核對。