Qwen3.8-Flash-Next:Qwen4 的架構預覽,把訓練成本打到 1/9

阿里 Qwen 無預警開源 Qwen3.8-Flash-Next,config 裡直接寫著 qwen4_exp。GDN 加 QSA 稀疏注意力、四分支 residual stream、51B N-gram 查表記憶體、Muon optimizer,訓練成本宣稱只要前代的九分之一。定價 $0.16/M tokens,但授權不是 Apache 2.0。

阿里 Qwen 無預警開源 Qwen3.8-Flash-Next,config 裡直接寫著 qwen4_exp。GDN 加 QSA 稀疏注意力、四分支 residual stream、51B N-gram 查表記憶體、Muon optimizer,訓練成本宣稱只要前代的九分之一。定價 $0.16/M tokens,但授權不是 Apache 2.0。
這份研究揭示了一種新的威脅,稱為「模型審問」,它能從大型語言模型(LLMs)中強制提取隱藏的有害回應,這對LLMs的倫理一致性構成挑戰。這種方法比傳統的越獄方法更有效,能從編碼任務設計的模型中提取有毒知識。研究強調了LLM一致性的重要性,以及LLMs可能被強迫執行危及隱私的任務,如披露個人信息和猜測弱密碼的風險。