本文為 Qwen 之繁體中文翻譯整理,原文版權歸原作者所有。
QWEN3.8-OMNI-FLASH-REALTIME API
簡介
今天,我們正式推出 Qwen3.8-Omni-Flash,這是新一代原生全模態模型。它的核心目標是強化真實生產力情境中的 Agent 能力,推動全模態模型從「理解全模態內容」進一步走向「規劃任務、呼叫工具並完成創作」。在程式開發、文字型知識工作與 GUI 操作等通用 Agent 能力之上,Qwen3.8-Omni-Flash 進一步擴展以音訊與影片為中心的 Agent 應用,在影片剪輯、音樂錄影帶製作、電影製作與解說、視聽摘要及即時對話等工作流程中都有強勁表現。
圖 1:Qwen3.8-Omni-Flash 及其生產應用。
- Qwen3.8-Omni-Flash 現已於千問 AI 平台提供:
Qwen3.8-Omni-Flash 在維持與同尺寸純文字模型相當的文字能力之餘,也大幅提升全模態能力。在 29 項評測中,平均分數較 Qwen3.5-Omni-Plus 提升超過 25%;每小時音訊輸入的 API 價格降低超過 98%,每小時視聽輸入價格則降低超過 93%。在視聽 Agent、程式開發與長程任務上,WildClawBench-MM 提升 36.5 分、AgenticVBench 提升 22.3 分,UniClawBench 則達到 69.6 分。長篇音訊與視聽理解、視聽推理、視聽描述及多講者辨識等核心能力也顯著進步。例如,LongAudioSpan 提升 8.3 分、OmniVideoBench 提升 9.6 分;OmniCap-IF 的 CSR 與 ISR 分別提升 8.5 與 14.1 分;AliMeeting 的 DER/cpWER 則從 88.11/89.61 降至 3.35/17.18。透過擴充資料、上下文與 Agent 環境,Qwen3.8-Omni-Flash 的視聽表現已接近 Gemini 3.8 Flash,整體音訊表現更超越 Gemini 3.8 Flash。這也代表音訊與影片正從感知輸入,演變為 Agent 理解環境、推理及執行任務的核心媒介。
- 評測範圍包括音訊推理、視聽推理及視聽 Agent 等多項基準:AliMeeting-test、AISHELL-4、MagicData-RAMC、MLC-SLM、WenetSpeech、FLEURS-60、SpotSoundBench、MMAU、MMAR、MMSU、MuchoMusic-RUL、HumMusQA、MusTBench、Audio-MultiChallenge、WildSpeech、VoiceBench、DailyOmni、WorldSense、AVUT、JointAVBench、OmniCloze、OmniCap-IF、QIVD、OmniVideoBench、StreamingBench、WildClawBench-MM、UniClawBench 與 OmniGAIA。
- 定價方法:每小時音訊或視聽輸入價格,以兩分鐘素材的輸入成本乘以 30 估算;視聽輸入採 720p、每秒 1 幀。Gemini 3.8 Flash 使用
media_resolution=high,Seed 2.0 Lite 使用max_frame_tokens=384,其餘 API 參數採預設值。文字輸入與輸出價格以每百萬 Token 的人民幣計算;Gemini 與 Muse 的美元價格按 1 美元兌 6.7191 人民幣換算。
音訊與影片是讓 Agent 進入真實生產力場景的重要媒介,但也帶來新的系統級挑戰。長篇音訊與影片在多輪推論中儲存、傳輸及處理成本高昂;現有 Agent Harness 缺乏對這些模態的原生支援;而把全模態理解與端到端任務執行串起來的工作流程仍處於早期階段。要解決這些問題,模型、Harness 工具與執行環境必須共同演進。
為此,我們以 Qwen3.8-Omni-Flash 探索如何把素材理解、任務規劃、工具執行與結果交付連成完整管線。它支援影片剪輯、翻譯、電影解說與內容創作等端到端長程工作流程,推動 Omni 從視聽理解走向自主行動及任務完成。
我們也進一步擴充 Qwen-MM-Plugins,加入長篇音訊與影片的隨選感知、工具使用及工作流程執行能力;同時開源 Qwen-Live Harness,作為持續、即時全模態互動的原生執行環境。兩者分別處理長程工作流程與即時互動,並隨模型持續拓展全模態 Agent 的能力。
長篇視聽理解
Qwen3.8-Omni-Flash 大幅升級長篇視聽理解:從可控制的內容描述、Agent 式證據蒐集,到理解會議並推進後續工作,再到產出以影片為中心的深度研究報告。它不只是能處理更長的內容,也能更精準地找出證據、更深入推理,並更有效率地採取行動。
可控制的視聽描述
影片該如何描述,並沒有唯一答案。內容創作重視敘事,素材檢索關注特定片段,資產管理則依賴結構。不同應用需要不同的影片描述。Qwen3.8-Omni-Flash 把影片描述從回答「模型看到了什麼」,升級為理解「使用者想知道什麼」。使用者可以自由指定主題、時間範圍、細節層級與輸出格式。針對同一支影片,模型能提供總覽、定位關鍵片段,或深入分析人物動作、鏡頭、光線與聲音,並按需求輸出結構化結果。你可以自行決定要看什麼、看多細,以及如何呈現。
Agent 式長篇視聽理解
對於長達數小時的影片,傳統方法即使答案只出現在幾分鐘內,也必須從頭到尾處理整段錄影。原生 Qwen3.8-Omni-Flash Agent 會從問題出發,自行決定要看什麼、聽什麼,並透過多輪由粗到細的證據蒐集定位關鍵資訊。它無須處理每一幀,就能把有限運算與 Token 預算集中在相關片段。在 OmniVideoBench 上,Agent 式理解的準確率由 63.4 提升至 67.8,同時把 Token 消耗從 145,736 降至 79,117,約減少 45.7%。
長時間會議:從紀錄走向行動
多人會議是最複雜的視聽理解場景之一:講者輪流或重疊發言,身分、指涉與主題持續變化。Qwen3.8-Omni-Flash 能結合音訊與影片辨識講者,並原生支援最長一小時的視聽輸入。它可端到端完成講者分段、內容轉錄與身分對齊。輸入完整會議影片與需求後,模型可整理參與者關係、產生會議紀錄、找出行動項目及分析專案風險,並利用視覺資訊釐清音訊中的指涉與實體歧義。結合 Agent 與工具後,它還能寄送電子郵件、整理任務,甚至依會議需求開始撰寫程式,真正從理解會議走向採取行動。
以音訊與影片進行深度研究
使用者帶著特定問題觀看影片時,答案往往超出影片本身。Qwen3.8-Omni-Flash 能結合使用者需求與影片內容,找出值得深入調查的問題、整理關鍵素材,並搜尋網路上的圖像、影片及文件等多模態來源,最後產出以影片為核心、圖文並茂的研究報告。例如,當使用者遇到 Photoshop 頭髮去背邊緣的色邊問題時,模型可拆解教學步驟、研究色彩增值與濾色混合模式的原理、比較其他邊緣修復技巧,並說明最適合該情境的方法。
視聽製作與剪輯
Qwen3.8-Omni-Flash 正把視聽 Agent 推向新階段:從理解聲音與圖像,走向自主規劃、呼叫工具並交付完成影片,讓全模態智慧進入專業視聽內容製作流程。
Music2MV
在音樂錄影帶(MV)製作上,Qwen3.8-Omni-Flash 能細緻理解歌曲結構、節奏、情緒、人聲及樂器變化,並據此設計人物、場景與鏡頭。它也能輸出逐行歌詞與時間戳,對齊歌聲、字幕與畫面。搭配 Qwen-MM-Plugins 等創作工具後,可涵蓋從音樂理解、創意規劃到最終品質檢查的完整流程。
短劇翻譯
傳統影片翻譯經常需要在轉錄、翻譯、配音及剪輯平台之間反覆切換,不但增加 API 與工作流程協調的複雜度,也難以維持角色聲線、對話長度及視覺節奏的一致性。以 Qwen3.8-Omni-Flash 建構的 Agent,只需一句話描述需求,就能完成講者感知的對話辨識、口語化翻譯、角色聲音複製與配音、音訊混音及最終品質檢查,把零散的在地化步驟整合為完整流程,自動交付面向國際觀眾的短劇。
長篇電影解說
為兩、三小時的電影製作解說影片,通常要反覆觀看、重建劇情,再進行選鏡、寫稿、配音、配樂與剪輯,流程複雜且耗時。使用 Qwen3.8-Omni-Flash Agent,只需提供電影並以一句話說明創作需求,即可完成長篇影片理解、關鍵劇情擷取、解說規劃、旁白與音樂製作、剪輯、渲染及最終品質檢查。Agent 也能智慧交錯原始對白與解說,自動調整語速和音量,使旁白、原音、背景音樂與畫面自然銜接。
從使用模型到最佳化模型
真實的多模態應用通常複雜且對成本敏感,模型必須兼顧品質、延遲、運算與部署成本。針對特定場景客製較小模型,是大規模部署的重要途徑;但傳統流程涉及資料建構、問題診斷、多輪訓練與評估,耗時且高度依賴人工專業。
這次我們把 Qwen3.8-Omni-Flash 的能力延伸至模型開發本身,探索由大型模型推動研發、小型模型服務業務的新方法。我們交給它一項任務:在 12 小時內提升 Qwen2.5-Omni-3B 的四川話語音辨識能力,並交付可用模型。它自行選擇 WenetSpeech-Chuan 評測集、固定評估標準並建立基準;接著直接聆聽音訊樣本,根據辨識結果診斷問題並建構針對性訓練資料。在連續四輪實驗中,Agent 建立 3,413 筆訓練樣本,依評測回饋調整方法、保留有效改進並回復失敗嘗試。最終,Qwen2.5-Omni-3B 在同一評測集的字元錯誤率由 25.79% 降至 15.30%,相對降低約 40.7%。
這項實驗展示另一種模型演進方式:通用多模態模型理解資料、規劃實驗並推動迭代,而小型模型則取得特定應用的專業能力。Agent 不只能使用模型,也能協助解決實際業務問題。
視聽資訊壓縮
音訊與影片承載豐富資訊,但線性、非結構化的形式使其難以檢索與重用。Qwen3.8-Omni-Flash 能跨聲音、畫面與時間軸理解內容,透過 Agent 工作流程擷取資訊、重組結構並驗證結果,把長影片中的核心知識與實務經驗轉化為密度更高、易於吸收及重用的資訊資產。
Video2Note
為把影片知識轉成結構化資源,我們在 Qwen-MM-Plugins 中開源 Video2Note。它利用 Qwen3.8-Omni-Flash 對語音、畫面與操作流程的聯合理解,自動整理知識、拆解關鍵步驟、挑選代表性畫面,並產生圖文對應的 PDF 筆記。自動審查與迭代修正,能把數小時影片濃縮成清楚、可讀且便於複習的文件。
Omni Skill Creator
影片記錄的不只是「如何操作」,也包含專家累積的實務經驗。因此,我們在 Qwen-MM-Plugins 中推出新的開源能力 Omni Skill Creator。它能從示範中擷取標準作業程序(SOP),形成可重複執行的自動化工作;也能從專家教學中學習工具用法、判斷標準與關鍵洞見。單次示範即可轉化為經驗證與評估的 Agent Skill,方便重用與分享。
即時視聽互動
Qwen3.8-Omni-Flash 適合針對完整視聽內容進行深入理解與創作。若要持續、低延遲互動,我們進一步推出 Qwen3.8-Omni-Flash-Realtime。它能在接收即時視聽串流的同時感知並回應,並利用即時上下文呼叫工具、執行任務,使全模態能力從「理解一段內容」走向「參與互動」。
即時口說練習
口語沒有標準輸入。口音、母音與子音替換、聲調偏差,都可能讓逐字轉錄偏離原意。Qwen3.8-Omni-Flash-Realtime 會聯合建模發音與語意,理解受口音影響的非標準表達、對齊正確詞彙,並即時產生標準發音示範。在多輪練習中,模型會根據新音訊更新判斷,修正影響理解的錯誤,同時保留自然節奏、語氣與情緒。
全模態空間音訊感知
在真實空間中,聲音提供了視覺以外的另一條座標軸。Qwen3.8-Omni-Flash-Realtime 把空間聲音與視覺資訊結合,持續判斷聲源方向與距離,同時感知障礙物、可通行區域及場景變化,成為首個能以聲音定位目標的全模態模型。
面對「到這裡來」或「去看看是什麼發出聲音」等指令,模型可從環境噪音中分離人聲與目標聲音,將其意義對應到周遭空間,並呼叫工具完成定位、搜尋、路徑規劃與導航,從聽見目標一路到抵達目標。
視聽互動的外部知識
即時互動不只需要低延遲,也要能依應用動態載入知識與行為。Qwen3.8-Omni-Flash-Realtime 支援透過 Skills 注入身分設定、表達風格、業務知識與互動規則,再透過工具使用把能力延伸到任務執行。
在客服等場景中,模型可即時載入品牌語言與服務流程,理解使用者的語音、畫面及上下文,產生符合業務規範的回應並執行操作。因此,同一個即時模型能承擔不同的知識、角色與行動方式。
基準測試結果
Omni
- Agentic Omni Intelligence 的評測 Harness:WildClawBench-MM 與 AgenticVBench 使用 Claude Code,UniClawBench 使用 OpenClaw,OmniGAIA 不使用 Harness。WildClawBench-MM 僅評估涉及圖像、影片或音訊的多模態任務。
- FLEURS 的 ASR 與 S2TT 評測涵蓋 60 種語言,包括中文(普通話)、英文、粵語、阿拉伯文、德文、法文、西班牙文、葡萄牙文、印尼文、義大利文、韓文、俄文、泰文、越南文、日文、土耳其文、印地文、馬來文、荷蘭文、烏都文等。
- 空白欄位(–)表示尚無分數或不適用。
Agent 式全模態理解
長篇音訊與影片的關鍵資訊往往散落在不同片段,而複雜問題需要跨聲音與畫面進行多步推理。Agent 式全模態理解讓模型從問題出發、規劃方法、呼叫工具,並逐步定位及驗證證據。把運算集中在相關內容後,可同時提升長篇視聽理解的準確度與效率。為評估此能力,我們在 OmniVideoBench、Video-MME-v2 與 LVOmniBench 上比較 Qwen3.8-Omni-Flash 與 Gemini 3.8 Flash,分別測試模型直接解讀輸入的 Static 模式,以及使用 Qwen Code 的 Agent 模式,以觀察導入 Agent 工作流程對模型表現的影響。
文字
- DeepSWE 1.1:使用 Claude Code 與 mini-SWE-agent Harness,
temp=1.0、top_p=0.95、256K 上下文,取兩者最高分;Qwen3.8-Flash-Next 在 mini-SWE-agent 上表現最佳。
- SWE-bench Pro:除採官方分數的 Claude-Opus-4.6(Max)外,其餘模型使用 Claude Code Harness,參數同上。修正有問題的題目後,所有基準模型皆重新評估。
- SWE-bench Multilingual:使用 mini-SWE-agent Harness,參數同上。
- NL2Repo-Bench:使用 Claude Code Harness;為防止獎勵作弊,禁止透過
pip download、pip install、git clone等指令存取指定儲存庫。
- CoWorkBench:內部長程辦公與生產力 Agent 基準,涵蓋資訊工程、金融、法律、醫療等領域。
- HLE:由 GPT-4o 評審。
- 空白欄位(–)表示尚無分數或不適用。
視覺
- ClawEval-MM 以「pass@3/平均分」呈現;pass@3 表示三次嘗試中至少一次通過的比例。
- RecreationBench 是內部長程應用重建基準,涵蓋 Ubuntu、macOS、Windows、Android 與網頁五種平台。
- OSWorld 2.0 以「binary/partial」呈現;前者為獲得完整任務獎勵的比例,後者彙總部分獎勵。
- Vision2Web 取前端、網頁與網站類別平均分,使用 Claude Code Harness,並由
gpt-5.4-2026-03-05評審。
- MathVision、CharXiv(RQ)以「不使用 CI/使用 CI」呈現。MathVision 少量錯誤標註經人工修正;本模型使用固定提示評測,其他模型則取有無
\\boxed{}格式中較高者。
- 空白欄位(–)表示尚無分數或不適用。
吞吐量與延遲
相關結果呈現 Qwen3.8-Omni-Flash-Realtime API 在不同輸入條件下的實測吞吐量與延遲,反映使用者在正式環境中的體驗。
支援語言
開始使用 Qwen3.8-Omni-Flash
API 使用方式
Qwen3.8-Omni-Flash 正式支援 reasoning_effort,可調整推理深度並控制成本:
xhigh(預設):適合需要深入分析的複雜任務。
medium:兼顧準確度與速度。
low:以速度與成本為優先的高效率推理。
此外,所有場景預設啟用 preserve_thinking,以提供最佳的開箱體驗。Qwen3.8-Omni-Flash 支援業界標準協定,包括相容 OpenAI 的 Chat Completions 與 Responses API。完整程式範例請參閱原文及上方 API 文件。
可控制視聽描述的最佳實務
內容組織與細節層級:將影片描述、OCR 擷取、音訊描述與語音轉錄分成畫面、語音、音樂、音效及環境聲等區塊。保留原始文字、講者身分與對應時間範圍,以方便檢索及驗證。可在提示中指定目標長度控制細節,例如:「請以約 2,000–3,000 字描述影片」,並按影片長度與資訊密度調整。
結構化輸出與 Schema 限制:在提示中放入任務說明與完整 JSON Schema,明確指定欄位意義、型別、必填欄位及限制,方便程式解析及下游使用。時間戳應以影片起點為基準,事件時間不得超出所屬場景;只輸出音訊或影片可直接支持的資訊,不猜測、不虛構,也不要僅因聲音與動作同時發生就推斷因果。
在 Agent Harness 中安裝 Qwen-MM-Plugins
Qwen-MM-Plugins 是為 Agent Harness 設計的多模態外掛套件,讓 Agent 能理解圖像、音訊、影片與文件,也能維護長篇影片記憶及建立內容。它支援 Codex、Claude Code、Qwen Code、Gemini CLI、Qoder、CodeBuddy 與 OpenClaw,並歡迎社群開發者貢獻。
你可以直接在常用的辦公 Agent 中輸入:
Help me install the core, api, and omni-related plugins from https://github.com/QwenLM/Qwen-MM-Plugins.
或從命令列安裝:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash
在選單中依序選擇 Install、你使用的 Agent Harness,以及需要的 Omni 外掛。安裝後重新啟動 Agent Harness 或建立新任務。
範例用途包括:依歌曲節奏與內容製作完整 MV、把短劇翻譯成英文並盡量保留原講者聲線、製作含中文旁白與字幕的電影解說、把週報操作錄影轉成 Skill.md、把教學影片轉成含關鍵截圖與時間戳的 PDF 筆記,以及為紀錄片建立人物、對話、聲音與事件的視聽記憶。
開始使用 Qwen3.8-Omni-Flash-Realtime
API 使用方式
Qwen3.8-Omni-Flash-Realtime 支援 WebSocket 與 WebRTC。執行基本範例後,程式會開啟攝影機與麥克風以進行即時視聽對話,建議配戴耳機。完整 Python 範例請參閱原文與 Realtime API 文件。
Qwen-Live Harness
Qwen-Live Harness 是圍繞 Qwen3.8-Omni-Flash-Realtime API 設計的完整開源 Harness,可用單一指令安裝並整合主流 Agent 工作流程。它支援任務委派、主動互動、長期記憶與上下文管理,也歡迎社群貢獻。
圖 2:Qwen-Live Harness 互動框架。
安裝並開始使用:
npm install -g qwen-live-harness
qwen-live-harness init
qwen-live-harness
引用
@misc{qwen38omniflash,
title = {Qwen3.8-Omni-Flash: Omni Senses. Agentic Delivery.},
url = {https://qwen.ai/blog?id=qwen3.8-omni-flash},
author = {{Qwen Team}},
month = {September},
year = {2026}
}
Hacker News 網友討論整理
Hacker News 討論串在整理時共有約 290 分、102 則留言。整體氣氛是「對價格與全模態能力感到興奮,但對實際可靠性、供應方式與宣傳呈現保持強烈保留」。[1]
1. 模型太多,選型比模型能力本身更令人困擾
最多共鳴的話題不是 Omni 功能,而是「面對大量新模型,該如何選擇」。有人希望有工具能根據任務、成本與語言需求推薦候選模型;其他人的實務建議則是採取「滿足即可」:先選便宜模型,只要能穩定完成任務就不要盲目追新,真的失敗時先改善工具、上下文與工作流程。留言提到 models.dev、Artificial Analysis、Hugging Face CLI、OpenRouter Auto 與成本比較網站,但也有人強調,通用基準無法取代針對自家資料與流程的實測。
2. 價格很吸引人,但不能只比較每 Token 單價
有人以 Gemini 輸入/輸出約 1.5/9 美元,對比 Qwen 3.8 約 0.15/0.47 美元,認為降幅非常大。不過多位網友提醒,真正應比較的是「每個任務的總成本」:模型完成任務所需 Token 數、快取寫入與讀取價格、快取命中率、重試次數及任務成功率,都可能逆轉表面上的單價優勢。也就是說,較昂貴但更精簡、一次成功的模型,實際上可能更便宜。
3. 對音訊能力的期待很高
官方宣稱視聽表現接近 Gemini 3.8 Flash、整體音訊能力超越 Gemini 3.8 Flash,讓不少人感到驚訝。Gemini 的音訊及多語能力原本就是重要賣點;如果 Qwen 的宣稱能在真實工作中重現,再配合更低價格,會很有競爭力。不過討論者仍普遍以「若屬實」看待,等待實際測試與獨立評估。
4. Qwen 3.8/Flash-Next 的推理偶爾出現怪異內容
多名使用者分享,Flash-Next 在工具呼叫之間偶爾會輸出與任務無關的內心獨白、誤以為使用者沒有提出任務,或產生像是上下文記憶錯亂的推理文字;也有人遇到簡單問題突然思考數分鐘,只能取消並重試。部分人認為是量化或 Serving 配方問題,指出 NVIDIA NVFP4 的特定部署較正常;但使用 Q8、MLX、OpenRouter 或不同 NVFP4 配方者也回報類似現象,因此也可能涉及訓練、Harness 互動或工具呼叫後的上下文處理。值得注意的是,多數回報者同時表示,這些怪異推理不一定會破壞最終工具執行結果。
5. 不希望為 Agent 基準「過度 RL」
有人稱讚 Qwen 3.8 Max 語氣自然、行為穩定、不會過度主動,但擔心後續強化學習把它調成「過度積極地幫忙」。討論將此稱為 benchmaxing:為 Agent 程式開發基準最佳化到其他日常使用體驗受損。部分開發者認為,現在的模型在單次任務與基準上很強,卻容易在日常開發中強推不必要的模式、加入過量測試,或在應該先釐清需求時直接行動。
6. 命名與產品定位令人混亂
「Flash、Pro、Ultra、Omni、Lite」等名稱引起吐槽。網友的概括是:Omni 通常代表支援文字、圖像、音訊、影片等多種輸入或輸出;Flash 側重速度與較小規模;Lite 側重成本;Pro/Ultra 則往往代表較完整但較慢的能力。不過各家公司用法不完全一致,仍增加選型負擔。
7. 開放權重、硬體需求與部署現況
討論對 Qwen 開放權重的速度有不同看法。有人擔心 Omni 版本不會開放,或認為 Qwen 的開源節奏放慢;其他人則指出 Qwen3.8 Max 與 Flash-Next 已釋出權重。實際部署方面,約 125B 級別模型需要接近 128GB 記憶體,對多數人並不容易;但也有人回報在舊遊戲主機上以 3-bit 量化、約 25 tokens/s 執行,能力仍很強。較長工作階段的 Prefill 速度則是明顯痛點,重新載入長上下文可能耗時很久。
8. 官方文章與開源連結的品質受到批評
部分網友認為官方文章頁面在 Firefox 捲動不順、主控台充滿警告,影片雖華麗卻未有效傳達資訊,圖表又太小且不能放大。也有人發現 Qwen-Live Harness 的 GitHub 連結一度出現 404 或儲存庫疑似被移除。這使一些讀者對發布成熟度及「展示大於實質」產生疑慮。
9. 討論延伸到中國、歐洲與 AI 產業競爭
留言後段延伸為「為何中國能持續推出模型,而歐洲較少出現同級通用模型」的爭論。觀點包含資本密集度、能源、資料取得、風險偏好、政府產業政策、監管、人才與硬體供應鏈;也有人反駁歐洲並非缺席,列出 Mistral、Flux、LightOn、OpenEuroLLM、EuroLLM、ALIA 與 ASML 等案例。這部分意見分歧大,較像產業與政策立場辯論,並非對 Qwen3.8-Omni-Flash 技術本身的直接驗證。
整體結論
社群對 Qwen3.8-Omni-Flash 的核心價值判斷相當一致:若音訊/視聽能力、長上下文與低價能在真實任務中同時成立,它會是非常有吸引力的生產模型。然而,網友尚未把官方基準視為定論;他們更關注單一任務總成本、部署與量化品質、長上下文 Prefill、工具呼叫穩定性、怪異推理、API 依賴及開源承諾。實務上最常見的建議不是追逐每次新發布,而是用自己的資料建立小型評測集,挑選能穩定達標且總成本合理的模型後固定版本。[1]
