測試與監控已停止 · 原作保留五模型,兩輪作品的實際結果
共封存 17 / 20 份原作;封存包含有缺陷的作品,不等於全部功能合格。本次綜合交付與第二輪改善,以 Muse 免費版最均衡。
2026-09-07:依使用者要求停止後續測試,三分鐘監控已停用。保留 17 / 20 份正式原作:鵜鶘 9 / 10,飛行遊戲 8 / 10。封存數包含功能有缺陷的模型原作,不能當成全部通過的數量。未完成草稿、原始片段及失敗嘗試另存,不充當完成版本。
若只選一組繼續做這類小型互動作品,我會先選 Muse 免費版:這是本次交付與改進表現的主觀綜合判斷,不是普遍模型排名。若重視本機離線,IQ3_S 已證明能產出,但仍需要人工驗收。
第二輪到底改進了什麼
Muse:飛行 QA 由 25 / 27 到 27 / 27;全畫面暫停與手機射擊修復,射擊、飛彈與方向鍵進入手機首屏。固定操作約 18.67 秒獲勝。仍有兩則 touchcancel Console 訊息。鵜鶘第二輪布局更緊湊,但桌機新增白邊,不能稱全面變好。
Gemini:飛行原先未觀察到飛彈、命中與擊落,第二輪已觀察到,27 項檢查均 true,固定序列約 4.51 秒獲勝。巨大青白尾焰反而更遮機體;未鎖定就可追蹤發射的規則偏差有讀碼線索,但未獨立操作確認。鵜鶘手機車輪比例修正,畫布可暫停,但頁首圖示仍動畫。
GLM:飛行首版固定序列 90 秒未命中/擊落而失敗,第二輪 27 項檢查均 true、約 71.83 秒達 5 擊落獲勝;手機上方生命/時間/暫停仍重疊。鵜鶘全新兩輪均通過動畫、全畫面暫停與恢復,暖色海岸、米白鵜鶘、紅圍巾和紅車架清楚。
本機 IQ3_S:飛行首版 crR 未定義造成畫面失效;第二版修復,26 / 27 項 true。暫停狀態與時鐘停住,但整幅畫面未完全凍結;恢復按鈕受攔截,使用 P 才恢復。固定操作約 21.02 秒以生命 0、擊落 3 架失敗,尚未證明可以贏。鵜鶘由喙朝上改朝前,騎乘姿勢更清楚,手機主角仍偏小。
雲端 Qwen:鵜鶘首版動畫/暫停/恢復正常,線條較簡單、手機留白較多。第二版只留下 28,595 bytes 未完成草稿;飛行留下 7 個原始程式片段,共 45,547 bytes,尚未組成最終 HTML。沒有拿草稿或重複首版補數。
QA 勝利時間只是一次固定正常輸入的結果,不是難度、遊戲手感或模型推論速度排名;27 個 true 也不涵蓋所有規則、視覺與真實手機情境。
各次交付經過時間
下表只列採用版本的任務經過時間。包含思考、工具、等待與自檢;先前失敗另保留,這不是所有嘗試的總成本,也不是 tokens/s 或 runtime 跑分。
Context、IQ4 與雲端 Qwen
本機正式採用 IQ3_S / 65,536 context / Q8 KV / MTP 2。IQ4 在改用官方 thinking 取樣後曾交出首版,但 40K 第二輪仍以 length 結束;換 IQ3 後才完成獨立兩輪。IQ4 的歷史原作與失敗沒有刪除,也沒有改標成 IQ3。IQ3 飛行第二轮也曾用滿 64K,精簡重複 QA 提示後補交,這個條件差異有公開保留。
雲端 Qwen 最後成功 prompt 約 87K / 93K,設定是 1M;沒有 context overflow 證據。微小直接 API 請求也可卡在「資料送出後等待 HTTP 回應標頭」,同時同金鑰的 GLM 可完成。早期 32K output 曾成功,但後續也等待,不能宣稱降到 32K 已可靠修好。最有力的定位是 OpenRouter 的 Qwen/Alibaba 請求路徑,內部哪層原因仍未確證。詳細原始診斷見 diagnostics/cloud-qwen-20260907/DIAGNOSIS.zh-TW.md。
本次維持各工具可設定的最高思考請求,並未設定模型 elapsed timeout;不同工具、提示、context/output、重試與讀圖可用性仍有差異。它比較的是這套實際工作流程的交付結果,無法據此判定哪個 runtime 純推論最快。
保留的作品
鵜鶘動態作品集 · HTML、快照與紀錄 ZIP
飛行遊戲作品集 · HTML、快照與紀錄 ZIP
作品頁保留兩版比較、可播放原作、手機/桌機快照、公開 QA 和來源 hashes。私有模型思考、原始 logs、認證資料與未完成草稿沒有放進公開作品包。停止由使用者提出,並未被記成模型正常交件或 provider timeout。