CREATIVE CODING STUDY / 2026.09.06

同一段提示,
五種兜風方式。

一隻鵜鶘、一台腳踏車,一段持續前進的動畫。
讓五組 AI 各自創作,再看看第二次回頭修改,會帶來什麼改變。

開始看作品
05參賽模型
02每組交付版本
成功交付 / 10 份
原作完整保留
沒有代畫 · 沒有預設排名
01 / SUCCESSFUL DELIVERIES

每個模型,都要有兩份作品。

先封存首份,再交付不同的改進版本。每份標明實際來源;後補成功不會改寫原始兩輪的失敗紀錄。GLM 重新評測,兩輪統一 1M context/128K output,舊作僅保留歷史、不計入新交付。本機組按實際選用的量化版本重新交付兩輪;IQ4 歷史作品不抵作 IQ3_S 首版。

EXTRA / LOCAL CONTEXT RETRY

40K,另一次本機嘗試。

正式兩輪原樣保留。40K 追加仍未交付,與 16K/32K 失敗一併保留;IQ4 官方取樣重跑第1輪曾成功、第2輪仍因容量停止;若切換 IQ3_S,兩份交付必須由 IQ3_S 從頭完成。

IQ4 官方取樣重跑歷史(與目前量化版本交付分開)
其他後補任務與取消紀錄
02 / SIDE BY SIDE

把差異放在一起看。

可比較不同模型的成功版本,或切回同一模型的原始兩輪。選單與預覽標籤會顯示實際來源。動畫按下播放才載入;桌機模式以 1280px 縮放呈現,手機模式使用 390px 原始寬度。

03 / THE RECORD

作品之外,也把條件攤開。

模型 / 執行平台思考設定第一輪第二輪

時間為整個任務經過時間,包含啟動、思考、工具、自檢及服務等待,不代表純推論速度。最高 effort 是請求設定,不保證固定或相同思考長度。

04 / HOW TO READ THIS

看作品,
也看實驗的邊界。

下載整包作品 ZIP ↘

下載原作 SHA-256 清單 ↗
01

同題,各自完成

全部模型取得相同第一輪提示,獨立完成離線 HTML 動畫。允許內嵌 SVG、Canvas、CSS 與 JavaScript;不使用圖片、外部套件或網路資源。Codex 只處理啟動、檢查、封存及本比較頁,沒有代寫或修改參賽插畫。

02

先封存,再改善

全部第一輪完成或失敗並封存後,才開始第二輪。第二輪延續各自對話,提供自己的第一輪快照與瀏覽器檢查,不提供其他模型的作品。每輪任務內允許模型自行檢查、修改。

本輪 OpenCode 的讀圖條件受到主持端工具設定順序錯誤影響:停用全部工具的規則排在部分開啟規則後,雲端 Qwen 實際只見 bash、grep;Muse 回報無法讀取 PNG。這是執行工具限制,不能判定模型無視覺能力。2026-09-06 14:47 UTC 已修正設定順序,但未中斷既有程序,仍可能沿用舊工具表;原作保留,未另開第三輪。

03

這是一次創作觀察

每組每輪只有一份產出,並非多次抽樣統計。平台、工具及上下文配置不同;雲端 Qwen Flash 與本機 Qwen 27B 也不是同一模型,差異不能單獨歸因於量化。第二輪也調整了執行容量:OpenCode 單次輸出上限由 32,000 提高至 131,072 token,本機上下文由 16K 提高至 32K。因此改善不能全歸因於自我修訂。本機先前三次 runner 帶入 presence_penalty 1.5,與官方 thinking 建議 0.0 不符;目前保持 IQ4/40K/xhigh 並修正取樣重新開始。這是主持端設定錯配,不能斷言是失敗的唯一原因,IQ4 官方取樣 40K 首輪已產出 HTML,但第二輪仍以 length 結束,故依授權啟用 IQ3_S 備案。IQ3_S 的 64K/Q8 配置已完成實測;這確認執行配置可用,不代表角色姿勢、踩踏連動或美術品質合格。沒有預設分數或勝負。

04

檢查能證明什麼

快照比較可確認畫面有變動;暫停前後測試可確認整張畫面是否凍結。這些檢查不等於足部與踏板連動正確,也不代替美術判斷。手機檢查是 Chrome 窄視窗,並非實體手機實測。無橫向溢出 ≠ 視覺比例正確;仍需對照快照檢查角色、車輪及場景有沒有被拉伸。

閱讀完整英文題目
模型與設定參考來源

OpenCode Zen · OpenRouter reasoning · Qwen Flash · Qwen 27B · GLM Flash

精確模型 ID 與 effort 列於上表。agy 模型設定另以 CLI models / help 實際輸出核對。