Cara Menggunakan MiniMax H3: Panduan Lengkap ComfyUI, Prompt, Referensi, Audio, dan Performa
Yifan Zhao9 menit baca ·

Untuk menggunakan MiniMax H3 secara efektif, pilih T2V untuk generasi berbasis teks, I2V saat gambar yang ada harus menjadi dasar adegan, dan R2V bila perlu mengontrol identitas, gerakan, kamera, gaya, atau suara lebih ketat. Di ComfyUI, mulai dengan uji singkat beresolusi rendah, perbaiki prompt dan referensi, lalu tingkatkan kualitas setelah shot berhasil. Cara ini juga memudahkan pengelolaan alur kerja MiniMax H3 yang terstruktur. Untuk memahami kelebihan dan keterbatasan praktisnya, lihat ulasan MiniMax H3.
Tantangannya bukan membuat H3 menghasilkan video, melainkan memperoleh hasil yang dapat diulang dan layak dipakai dalam produksi. Checkpoint yang salah dapat melemahkan referensi, prompt ambigu dapat memberikan dialog kepada karakter yang salah, dan uji resolusi tinggi membuat setiap ide gagal menjadi mahal. Prompt MiniMax H3 yang baik mengurangi ambiguitas, sementara alur produksi H3 yang disiplin memisahkan konsep, identitas, aksi, kamera, audio, dan kualitas akhir menjadi keputusan yang bisa diuji sendiri-sendiri.
Virse memudahkan pengelolaan proses kreatif yang lebih luas ini. Alih-alih membatasi pekerjaan AI pada percakapan terpisah, Virse memungkinkan desainer menata referensi, aset, dan keputusan di kanvas tanpa batas sementara beberapa agen berbagi konteks proyek. Desain produknya juga berfokus mempelajari preferensi tim, standar merek, dan konteks kreatif sebelumnya, sehingga generasi AI menjadi bagian dari alur desain AI yang konsisten, bukan alat terpisah lainnya. Agen desain AI juga dapat mendukung alur kreatif yang lebih terkoordinasi.

Cara Menggunakan MiniMax H3 di ComfyUI
MiniMax H3 merupakan sistem generasi video omnimodal yang memahami teks, gambar, video, dan audio serta menghasilkan video bersama audio stereo. ComfyUI menyediakan alur T2V, I2V, dan R2V native dengan bobot terbuka; dokumentasinya saat ini mensyaratkan ComfyUI 0.30.0 atau lebih baru, sehingga pustaka templat resmi menjadi titik awal paling mudah. Jika baru pertama menyiapkannya, panduan penggunaan MiniMax H3 ini membahas proses yang lebih luas.
Alur praktis untuk generasi pertama:
- Perbarui ComfyUI.
- Buka Template Library (pustaka templat) → Video → MiniMax H3.
- Pilih T2V, I2V, atau R2V.
- Muat model difusi yang benar beserta encoder/VAE pendukungnya.
- Buat pratinjau singkat.
- Periksa identitas, gerakan, arah kamera, dialog, dan audio.
- Ubah satu variabel utama pada satu waktu.
- Tingkatkan resolusi setelah shot dapat diandalkan.
Model MiniMax H3 Apa yang Diperlukan?
T2V, I2V, serta generasi frame awal/akhir memakai FL2VA, sedangkan R2V berbasis referensi memakai Ref2VA. Keduanya juga memerlukan encoder teks Qwen3-VL serta VAE video dan audio H3. ComfyUI menjelaskan pemisahan checkpoint ini secara tegas, jadi pemeriksaan model difusi sebaiknya menjadi langkah pertama ketika referensi tampak diabaikan.
MiniMax H3: T2V, I2V, dan R2V
Alur kerja | Paling sesuai untuk | Kontrol utama |
|---|---|---|
T2V | Eksplorasi konsep dan adegan baru | Teks |
I2V | Menganimasikan komposisi yang sudah ada | Gambar pertama |
Frame awal/akhir | Transisi terencana | Frame pembuka dan penutup |
R2V | Konsistensi identitas, gerakan, kamera, gaya, atau suara | Referensi multimodal |
Gunakan T2V jika eksplorasi paling penting, I2V jika komposisi penting, dan R2V jika konsistensi penting. Menganggap R2V sekadar I2V yang lebih kuat adalah kesalahan umum karena bobot modelnya berbeda dan strategi referensinya lebih eksplisit.
Cara Menulis Prompt MiniMax H3 yang Lebih Baik
Prompt MiniMax H3 yang baik lebih menyerupai brief produksi audiovisual daripada prompt gambar. Panduan resmi MiniMax menyusun generasi berdasarkan deskripsi shot multimodal, lanskap suara keseluruhan, dan musik nondiegetik; artinya arahan visual dan audio perlu direncanakan bersama. Panduan prompt MiniMax H3 membantu menyusun instruksi tersebut secara lebih sistematis.
Tulis Prompt MiniMax H3 per Shot
Tentukan adegan dan komposisi awal, lalu jelaskan aksi yang terlihat dan pergerakan kamera seiring waktu. Untuk video multi-shot, panduan MiniMax menggunakan Shot 1 tanpa penanda waktu, lalu shot berikutnya dengan waktu perpindahan eksplisit. Rentang waktu tetap berguna untuk storyboard, tetapi bukan format akhir yang didokumentasikan.
Urutan perencanaan yang berguna:
Peran referensi → Shot → Subjek → Aksi → Kamera → Dialog → Efek suara → Lanskap suara → Musik
Jangan hanya meminta “pengungkapan produk sinematik”; jelaskan perubahannya: kamera perlahan mendekati produk, subjek memutarnya ke arah cahaya, terdengar klik mekanis, lalu shot berikutnya beralih ke detail dekat.
Mengontrol Dialog dan Audio MiniMax H3
H3 menghasilkan dialog, suara lingkungan, efek suara, dan musik bersama video. MiniMax menyarankan identitas pembicara yang stabil antarshot, terutama saat ada dua karakter atau lebih.
Tinjauan kami atas pertanyaan pengguna menemukan dialog dari karakter yang salah dan gerakan bibir yang tidak diinginkan sebagai masalah berulang. Hubungkan erat identitas, aksi, dan dialog setiap pembicara. Untuk narasi, nyatakan secara eksplisit bahwa suara berasal dari luar layar dan karakter yang terlihat tidak boleh berbicara.
Menggunakan Referensi R2V MiniMax H3 untuk Konsistensi Lebih Baik
MiniMax H3 R2V mendukung hingga 9 gambar, 3 video, dan 3 klip audio referensi, dengan total maksimum 12 berkas. Dokumentasi model mengonfirmasi batas ini, tetapi menggunakan jumlah maksimum jarang menjadi tujuan utama.

Aturan yang lebih kuat: beri setiap referensi satu tanggung jawab utama.
Contohnya:
- Gambar 1 mengontrol identitas karakter.
- Gambar 2 mengontrol lingkungan atau gaya visual.
- Video 1 mengontrol gerakan dan kamera.
- Audio 1 mengontrol suara.
Panduan referensi lengkap MiniMax membedakan subjek, acuan gambar, struktur video, dan sinyal audio, menegaskan bahwa hubungan antarreferensi harus dinyatakan, bukan hanya tersirat.

ref_image_size MiniMax H3: match atau max
ComfyUI menyediakan dua strategi praktis untuk gambar referensi. match mengutamakan kecepatan dengan menyesuaikan referensi mendekati resolusi generasi, sedangkan max mempertahankan sisi pendek hingga 2048 piksel untuk kesetiaan identitas yang lebih baik, dengan biaya pemrosesan tambahan.
Untuk wajah, produk, atau aset karakter terperinci, max mungkin sepadan dengan iterasi yang lebih lambat. Untuk lingkungan atau gaya umum, match biasanya menjadi awal yang lebih efisien.
Resolusi MiniMax H3: 768p Lokal dan Keluaran 2K
Pernyataan “MiniMax H3 mendukung 2K” memerlukan konteks.
Berapa Resolusi yang Dihasilkan MiniMax H3 Lokal?
Alur terbuka H3-Base menghasilkan keluaran kelas 768p. ComfyUI menyarankan sisi pendek 768 piksel, sekitar 1344×768 pada 16:9 untuk kanvas lokal berkualitas penuh; pengaturan megapiksel lebih rendah lebih cocok untuk iterasi pratinjau.
Bagaimana MiniMax H3 Menghasilkan 2K?
Kartu model resmi menjelaskan bahwa sistem H3 lengkap mencakup H3-Context-IR, H3-Base, dan H3-Regenerate-2K. H3-Base mula-mula menghasilkan 768p; H3-Regenerate-2K memakai hasil itu bersama konteks multimodal asli untuk menghasilkan ulang detail beresolusi lebih tinggi, bukan menerapkan superresolusi biasa.

Context-IR dan Regenerate-2K saat ini merupakan komponen terhosting, bukan bagian dari rilis bobot terbuka. Alur API MiniMax menghasilkan hingga 2K dan klip 5–15 detik, jadi generasi lokal 768p dan keluaran terhosting 2K tidak boleh dianggap sebagai alur yang sama.

Berapa VRAM yang Dibutuhkan MiniMax H3?
Tidak ada satu angka minimum VRAM yang benar-benar berguna karena performa bergantung pada VRAM, RAM sistem, resolusi, durasi, langkah, kuantisasi, offloading, dan implementasi attention.
Dalam tinjauan alur lokal terdokumentasi, satu konfigurasi RTX 4090 Laptop dengan VRAM 16 GB dan RAM 32 GB menghasilkan video lima detik 960×540 beserta audio dalam 182 detik, memakai 20 langkah dan Sage Attention. Ini kasus nyata yang berguna, tetapi bukan benchmark terkontrol.
Penelitian juga mencakup laporan VRAM lebih rendah yang dapat menjalankan H3 melalui offloading intensif. Perbedaan praktisnya penting: GPU mungkin mampu menyelesaikan generasi tanpa cukup cepat untuk iterasi kreatif yang nyaman.

Mempercepat MiniMax H3 dengan Sage Attention
Untuk mempercepat H3, kurangi durasi dan resolusi terlebih dahulu. Keduanya langsung mengurangi jumlah video yang harus dihasilkan model sehingga uji prompt jauh lebih murah.
Setelah itu, Sage Attention merupakan optimasi yang paling jelas didokumentasikan. ComfyUI menyatakan bahwa fitur ini dapat kira-kira menggandakan kecepatan generasi H3 dengan penurunan kualitas minimal, meski peningkatan tepatnya bergantung pada konfigurasi.
Dalam alur profesional, pengaturan kecepatan tetap perlu diuji A/B. Bandingkan prompt dan seed yang sama, lalu periksa wajah, subjek jauh, detail kecil produk, kesinambungan gerak, dan sinkronisasi audio sebelum memakai percepatan agresif.
Masalah Umum MiniMax H3 dan Cara Mengatasinya
Masalah | Perbaikan yang paling mungkin |
|---|---|
R2V mengabaikan referensi | Pastikan Ref2VA dimuat dan beri peran jelas pada setiap referensi |
Karakter yang salah berbicara | Stabilkan identitas pembicara dan kaitkan dialog dengan aksinya |
Bibir bergerak saat narasi | Tentukan narasi di luar layar dan subjek terlihat yang tidak berbicara secara eksplisit |
Identitas berubah | Kurangi referensi yang saling bertentangan atau tambah detail gambar referensi |
Generasi terlalu lambat | Persingkat durasi, turunkan resolusi pratinjau, aktifkan Sage Attention |
Node H3 tidak ada | Perbarui ComfyUI dan muat ulang templat resmi H3 |
Struktur pemecahan masalah ini mencerminkan isu paling sering dalam tinjauan pertanyaan pengguna H3. Dalam praktik, menyederhanakan alur sering lebih efektif daripada menambah instruksi prompt.
Apa Alur MiniMax H3 Terbaik untuk Produksi?
Untuk pekerjaan video dan desain profesional, saya menyarankan alur iterasi berbasis shot:
Pratinjau → A/B prompt → A/B referensi → Hasil terpilih → Render kualitas native → 2K atau finishing jika perlu → Penyuntingan
Pendekatan ini menjadikan H3 sistem kreatif yang terkontrol. T2V mengeksplorasi ide, I2V menetapkan komposisi desain, R2V mempertahankan referensi visual atau audio penting, dan pratinjau singkat mengungkap masalah sebelum generasi akhir yang mahal. Alur produksi MiniMax H3 khusus membantu membakukan urutan tersebut.
Dari sudut pandang desain produk, pendekatan ini juga lebih mudah diperluas daripada meminta satu prompt menyelesaikan konsep, identitas, kamera, gerakan, dialog, dan finishing sekaligus. Tujuannya bukan mengurangi keputusan, melainkan membuat setiap keputusan lebih murah dan mudah dievaluasi. Memahami kapan menggunakan MiniMax H3 juga penting, karena tidak semua tugas kreatif memerlukan tingkat kontrol multimodal yang sama.
Pertanyaan Umum
Bisakah H3 berjalan dengan VRAM 12 GB?
H3 bisa berjalan pada perangkat konsumen terbatas dengan model terkuantisasi dan offloading, tetapi VRAM saja tidak dapat memprediksi kecepatan. Resolusi, durasi, RAM sistem, varian model, langkah, dan optimasi attention turut berpengaruh. Uji perangkat yang lebih baik adalah mengukur waktu pratinjau lima detik yang ditargetkan dengan pengaturan yang benar-benar akan digunakan.
Mengapa referensi R2V H3 saya tidak berfungsi?
Pertama pastikan Anda memakai Ref2VA, bukan FL2VA. Kemudian beri tiap gambar, video, atau audio tanggung jawab tertentu seperti identitas, lingkungan, gerakan, kamera, atau suara. Jika beberapa referensi bersaing menentukan properti yang sama, kurangi referensi sebelum memperumit prompt.
Haruskah prompt H3 memakai Shot 1 atau rentang waktu?
Gunakan rentang waktu untuk perencanaan jika membantu storyboard, tetapi panduan prompt dasar resmi MiniMax menyusun prompt akhir sebagai shot berurutan, dengan waktu perpindahan eksplisit pada shot berikutnya. Perbedaannya penting karena teknik perencanaan kreatif yang berguna belum tentu sama dengan struktur prompt yang didokumentasikan model.
Apakah H3 lokal menghasilkan 2K native?
Tidak jika hanya memakai H3-Base. Alur terbuka H3-Base menghasilkan keluaran kelas 768p. Sistem lengkap MiniMax memakai H3-Regenerate-2K untuk menghasilkan ulang hasil dasar dengan konteks asli, sedangkan API resmi dapat memberikan keluaran hingga 2K.
Kesimpulan
MiniMax H3 paling efektif sebagai alur produksi audiovisual terstruktur, bukan jalan pintas video dengan satu prompt. Pilih T2V, I2V, atau R2V sesuai batasan kreatif, gunakan FL2VA atau Ref2VA dengan benar, beri tanggung jawab jelas pada referensi, jelaskan shot dan aksi kamera yang dapat diamati, arahkan audio bersama visual, lalu uji ide dengan pratinjau murah sebelum menaikkan resolusi. Pertanyaan terpenting bukan sekadar apakah H3 berjalan pada perangkat Anda, melainkan apakah iterasinya cukup cepat untuk membuat keputusan kreatif yang baik. Setelah alur MiniMax H3 stabil, generasi lokal 768p, finishing terhosting 2K, dan Virse dapat menyatu dalam proses desain profesional berbasis AI yang jauh lebih mudah diperluas.
Artikel lainnya dari Blog Virse
Alur kerja

GPT Image 2.5 Noise and Oversharpening: Why Some Images Still Look AI-Generated
9 Oktober 2026 by Yifan Zhao
Alur kerja

GPT Image 2.5 Keeps Changing My Image: How to Use a "Keep List" for Reliable Edits
9 Oktober 2026 by Yifan Zhao
Alur kerja

GPT Image 2.5 Editing Drift: Why Images Get Blurry, Cropped or Worse After Multiple Edits
9 Oktober 2026 by Yifan Zhao