[ ACCESSING_ARCHIVE ]

Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s

October 04, 2026 • BY azzar
[ READ_TIME: 8 MIN ] |
. . .

Wah, wah, wah! Kumpul sini, wahai para budak silikon dan pemuja GPU! Lu pada masih sibuk nabung buat beli H100 biar bisa ngerasa jadi “AI Engineer”? Halah, gaya bener! Dengerin nih, dunia AI lagi kena serangan jantung, dan jantungnya itu namanya Qwen 3.8 Flash Next (125B).

Gue dapet kabar burung—eh, bukan burung, ini data—bahwa model raksasa 125B parameter ini bisa dipaksa jalan di hardware “kentang premium” alias RTX 4090. Lu bayangin, model 125B yang harusnya butuh server seharga mobil Avanza baru, sekarang mulai ngetok-ngetok pintu PC rumahan lu. Tapi tunggu dulu, jangan langsung joget-joget dulu! Ada “tapi” yang gede banget kayak perut abang-abang tukang nasi goreng di depan gang.

Artikel ini bakal gue bedah secara teknis, brutal, dan jujur. Kita bakal bahas gimana mekanisme Mixture of Experts (MoE) ngebantu kita, kenapa VRAM 24GB lu nggak bakal cukup kalau lu sok ide mau lari sendirian, dan gimana caranya dapet performa gila-gilaan pake engine baru bernama Strata. Siapin kopi, matiin koneksi internet biar nggak kegoda buka TikTok, dan mari kita masuk ke lubang kelinci teknologi ini!

1. Anatomi Monster: Kenapa 125B MoE Beda sama Dense Model?

Oke, sebelum lu nanya “Bang, kenapa model gede bisa lari kenceng?”, lu harus paham dulu konsep Mixture of Experts (MoE). Qwen 3.8 Flash Next ini bukan model dense kayak model-model lama di mana setiap kali lu nanya “Ibu kota Prancis apa?”, seluruh 125 miliar parameter itu kerja rodi bareng-bareng. Itu mah namanya kerja bakti, capek!

Di arsitektur MoE, model ini punya spesialis. Katakanlah model ini punya banyak “ahli” kecil di dalamnya. Pas lu nanya soal koding, cuma sebagian kecil parameter (yang disebut active parameters) yang bangun dari tidur siang mereka buat jawab. Berdasarkan diskusi di Reddit r/LocalLLM, Qwen 3.8 Flash Next ini pake konfigurasi 125B-A6B. Artinya, meskipun total parameternya 125 miliar, yang bener-bener mikir pas satu token keluar cuma sekitar 6 miliar parameter aja!

Ini rahasia kuncinya. Itulah kenapa kita bisa dapet kecepatan tinggi. Lu nggak perlu nunggu seluruh 125B parameter muter-muter di bus memory. Tapi inget, meskipun yang kerja cuma 6B, lu tetep harus nyimpen seluruh 125B parameter itu di memori (RAM/VRAM). Ini masalah “kapasitas penyimpanan” vs “kecepatan eksekusi”.

2. Realita Pahit: VRAM Barrier Belum Mati, Cuma Lagi “Ngumpet”

Nah, ini bagian yang bakal bikin lu nangis darah kalau lu tipikal orang yang cuma baca judul. Ada tweet dari analogalok yang bilang “The VRAM barrier is officially dead”. Woi, sadar! Itu judulnya emang bombastis, tapi kenyataannya? VRAM barrier itu masih ada, cuma cara kita nembusnya aja yang berubah.

Mari kita hitung pake logika matematika dasar, bukan pake perasaan. Model 125B kalau di-quantize ke 4-bit (GGUF/EXL2) itu butuh memori sekitar 70GB-an lebih. RTX 4090 lu cuma punya 24GB. Jadi gimana ceritanya bisa jalan?

Jawabannya adalah: Unified Memory atau System RAM Offloading.

Lu nggak bisa lari cuma pake GPU doang. Lu butuh bantuan RAM PC lu yang gede. Berdasarkan panduan dari Atomic Chat, kalau lu mau lariin Qwen 3.8 Flash Next di RTX 4090, lu NGGAK BISA cuma ngandelin 24GB VRAM di kartu itu. Lu butuh RAM sistem yang gede (minimal 64GB atau lebih) buat nampung sisa parameter yang nggak muat di GPU.

  • GPU (VRAM): Buat nyimpen sebagian parameter dan ngejalanin komputasi kenceng (biar dapet token/sec tinggi).
  • System RAM: Buat nampung sisanya yang “nganggur” tapi tetep harus ada di memori biar bisa diakses.

Jadi, kalau lu cuma punya PC gaming standar dengan RAM 16GB, mending lu balik main Dota aja. Jangan mimpi bisa lariin model 125B. Lu bakal kena swap ke SSD dan kecepatannya bakal lebih lambat daripada siput kena stroke.

3. Bedah Performa: 100 T/s itu Mitos atau Fakta?

Gue sering denger klaim “100 tokens/second”. Mari kita luruskan biar nggak ada debat kusir di kolom komentar. Kalau lu liat benchmark di Medium, angka 100 t/s itu seringkali merujuk pada model yang lebih kecil, yaitu Qwen 3.8 27B di satu kartu RTX 3090 Ti.

Untuk Qwen 3.8 Flash Next 125B, performanya lebih realistis tapi tetep bikin geleng-geleng kepala. Ada laporan di X/Twitter yang bilang di RTX 4090, lu bisa dapet:

  1. Decode Speed: Sekitar 21 tokens/sec. Ini udah kenceng banget buat model sekelas 125B! Rasanya kayak baca teks yang ngetik sendiri dengan kecepatan super manusia.
  2. Prefill Speed: Bisa tembus 364 t/s. Ini yang penting kalau lu masukin dokumen panjang (konteks gede).

Kenapa decode speed-nya (saat generate kata) lebih lambat dibanding prefill (saat baca input)? Karena pas decode, sistem harus narik data dari RAM ke GPU secara berulang-ulang buat setiap token. Kalau sebagian besar model lu ada di RAM (bukan VRAM), lu bakal kena bottleneck di bandwidth memori DDR4/DDR5 lu yang jauh lebih lambat dibanding GDDR6X di GPU.

4. Senjata Rahasia: Strata Inference Engine

Terus, gimana cara instalnya biar nggak pusing tujuh keliling kayak nyari kunci motor yang ilang? Lu butuh alat yang namanya Strata. Proyek dari Niko1221 di GitHub ini adalah penyelamat kaum awam.

Strata ini bukan cuma sekadar wrapper biasa. Dia adalah inference engine yang didesain buat ngejalanin Qwen 3.8 Flash Next di hardware konsumen dengan cara yang efisien. Kelebihannya:

  • One-click install: Tersedia buat Windows dan Linux. Nggak perlu lu ngetik command line sampe jari kapalan.
  • Hybrid Inference: Dia pinter bagi tugas antara GPU dan CPU/RAM.
  • OpenAI/Anthropic API Compatibility: Jadi kalau lu punya aplikasi yang biasa pake API ChatGPT, tinggal ganti URL-nya ke local Strata lu, langsung jalan!

Gue sangat saranin buat lu yang pengen eksperimen tapi nggak mau ribet urusan dependency Python yang suka berantem satu sama lain. Pake Strata, beres urusan.

5. Perbandingan Brutal: 125B MoE vs 27B Dense

Sekarang, pertanyaan filosofis: “Bang, mending pake yang 27B aja nggak sih? Kan lebih enteng?”

Dengerin ya, ini bukan soal berat atau enteng, tapi soal intelligence density. Berdasarkan diskusi di Reddit, pengguna ngerasa Qwen 3.8 Flash Next 125B (bahkan di kuantisasi Q4) itu jauh lebih “pinter” dan “cerdas” dibanding Qwen 3.8 27B meskipun yang 27B itu pake kuantisasi lebih tinggi (Q8).

Kenapa? Karena 125B punya world knowledge yang jauh lebih luas. Model 27B mungkin jago dalam tugas-tugas spesifik, tapi 125B punya nuansa pemahaman yang lebih dalam. Selain itu, Flash Next ini juga diklaim lebih less verbose—alias nggak bertele-tele kayak tukang debat di Twitter. Dia langsung ke poinnya. To the point!

Fitur Qwen 3.8 27B (Dense) Qwen 3.8 Flash Next 125B (MoE)
Kemudahan Running Sangat Mudah (Cukup VRAM) Menantang (Butuh RAM Besar)
Kecepatan (Token/s) Sangat Tinggi (>100 t/s) Menengah (~21 t/s)
Kecerdasan/Nuansa Bagus Luar Biasa (Smarter)
Efisiensi Komputasi Boros per Parameter Sangat Efisien (Active Params kecil)

6. Setup Guide: Cara Biar Nggak Meledak

Kalau lu udah denger penjelasan gue dan tetep pengen nyoba (jangan bilang gue nggak ngingetin ya!), ini adalah panduan teknis singkat biar PC lu nggak meledak atau minimal nggak freeze pas lagi asik-asiknya prompting.

A. Persiapan Hardware

  1. GPU: Minimal RTX 3090 atau 4090 (24GB VRAM adalah harga mati buat kenyamanan).
  2. RAM: Minimal 64GB DDR4/DDR5. Kalau lu cuma punya 32GB, lu bakal ngerasain gimana rasanya “sesak napas” digital.
  3. Storage: SSD NVMe. Jangan pake HDD, lu mau nunggu modelnya loading sampe lebaran monyet?

B. Langkah Instalasi (Via Strata)

  1. Clone repository Niko1221/Strata dari GitHub.
  2. Jalanin installer sesuai OS lu (Windows .exe atau Linux .sh).
  3. Pilih model Qwen3.8-Flash-Next-125B.
    • Pro Tip: Cari versi kuantisasi GGUF (Q4_K_M atau Q5_K_M). Ini adalah sweet spot antara kecerdasan dan penggunaan memori.
  4. Atur GPU Layers. Jangan set semua layer ke GPU! Kalau VRAM lu 24GB, set aja sekitar 20-30 layer ke GPU, sisanya biarin dikelola sama sistem (CPU/RAM). Kalau lu paksa semua ke GPU, lu bakal dapet error “Out of Memory” (OOM) yang bikin emosi.

7. Kesimpulan: Masa Depan AI Ada di Meja Kerja Lu?

Jadi, apa kesimpulannya? Apakah Qwen 3.8 Flash Next 125B di RTX 4090 itu sebuah terobosan? YES! Tapi, apakah ini berarti lu nggak butuh server lagi? BELUM TENTU.

Ini adalah era di mana Hybrid Inference menjadi kunci. Kita nggak lagi bicara soal “Bisa nggak model gede jalan di PC gue?”, tapi “Gimana cara gue ngatur pembagian tugas antara GPU dan RAM supaya dapet kecepatan yang masuk akal?”.

Qwen 3.8 Flash Next ngebuktiin kalau arsitektur MoE adalah masa depan local LLM. Dia ngasih kita kecerdasan model raksasa dengan kecepatan yang masih bisa dinikmati manusia. Buat lu para pengembang, peneliti, atau sekadar orang yang pengen punya asisten AI yang nggak perlu koneksi internet (dan nggak bakal nge-sensor jawaban lu secara berlebihan), ini adalah waktu yang tepat buat dive in.

Saran terakhir dari gue: Jangan pelit sama RAM. Di dunia Local LLM, RAM adalah napas, dan VRAM adalah otot. Kalau lu punya keduanya, lu adalah raja di kerajaan AI lokal lu sendiri.

Sekian dari gue, si Wong Edan Teknologi. Jangan lupa update driver GPU lu, jangan cuma update status galau di sosmed!

[ END_OF_ENTRY ]
[ SUCCESS: COPIED_TO_CLIPBOARD ]
[ ARCHIVAL_COMMAND_INDEX ]
SHOW_COMMANDS?
SEARCH_ARCHIVECTRL+K / /
GOTO_INDEXSHIFT+H
NEXT_ENTRY_PAGE]
PREV_ENTRY_PAGE[
COPY_LINKSHIFT+S
CITE_SPECIMENC
MOVE_FOCUSW / S
ACTION_KEYENTER
PRINT_SPECIMENCTRL+P
PRECISION_DOWNJ
PRECISION_UPK
CLOSE_ALLESC
[ ARCHIVAL_CITATION_SPECIMEN ]
APA_FORMAT
azzar. (2026). Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s. Glass Gallery. Retrieved from https://wp.glassgallery.my.id/run-qwen-3-8-flash-next-125b-on-consumer-hardware-rtx-4090-at-100t-s/
[ CLICK_TO_COPY ]
MLA_FORMAT
azzar. "Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s." Glass Gallery, 2026, October 04, https://wp.glassgallery.my.id/run-qwen-3-8-flash-next-125b-on-consumer-hardware-rtx-4090-at-100t-s/.
[ CLICK_TO_COPY ]
CHICAGO_STYLE
azzar. "Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s." Glass Gallery. Last modified 2026, October 04. https://wp.glassgallery.my.id/run-qwen-3-8-flash-next-125b-on-consumer-hardware-rtx-4090-at-100t-s/.
[ CLICK_TO_COPY ]
BIBTEX_ENTRY
@misc{glassgallery_1011,
  author = "azzar",
  title = "Run Qwen 3.8 Flash Next (125B) on consumer hardware (RTX 4090) at 100T/s",
  howpublished = "\url{https://wp.glassgallery.my.id/run-qwen-3-8-flash-next-125b-on-consumer-hardware-rtx-4090-at-100t-s/}",
  year = "2026",
  note = "Retrieved from Glass Gallery"
}
[ CLICK_TO_COPY ]
TECHNICAL_REF
[ REF: RUN QWEN 3.8 FLASH NEXT (125B) ON CONSUMER HARDWARE (RTX 4090) AT 100T/S | SRC: GLASS GALLERY | INDEX: 1011 ]
[ CLICK_TO_COPY ]