Tim model besar Bailing (Ming) milik Ant Group merilis seri Ming-Image-0.1-Design sebagai open source pada 23 September. Ada dua model, masing-masing berparameter 6 miliar (6B), dengan kode dan bobot model dipublikasikan di Hugging Face di bawah organisasi inclusionAI, menggunakan lisensi MIT.
- Ming-Image-0.1-Design menangani proses "dari teks ke rancangan desain": cukup masukkan deskripsi kebutuhan, model ini menghasilkan desain lengkap yang didominasi tata letak dan teks, seperti layar UI, dashboard data, infografis, dan poster.
- Ming-Image-0.1-Design-Layer menangani proses "dari rancangan desain ke lapisan": memecah satu gambar desain yang sudah menyatu menjadi 2 hingga 9 lapisan transparan yang bisa diedit secara terpisah.
Dirilis bersamaan, ada dua paket skill agen: Ling UI Design Skill, dan Image-to-Editable-PPT Skill yang mengubah gambar menjadi file PPT yang bisa diedit. API model ini dibuka gratis selama dua minggu di OpenRouter.
Jenis gambar apa yang jadi sasaran
Model text-to-image umum biasanya unggul dalam membuat gambar, tapi mudah keteteran pada konten yang menuntut "teks akurat dan posisi rapi" seperti tombol, kartu, atau area informasi multi-kolom — kesalahan ejaan, elemen yang tidak sejajar, dan warna yang tidak konsisten dalam satu gambar sering terjadi. Ming-Image-0.1-Design dirancang khusus untuk mengatasi masalah ini.
Menurut penjelasan resmi, model Design mendukung prompt terstruktur hingga 8K token, sehingga kebutuhan panjang yang mencantumkan judul, teks tombol, isi kartu, hingga skema warna bisa dimasukkan sekaligus dalam satu blok. Rendering teks dan stabilitas tata letak untuk judul, tombol, dan informasi multi-area diperkuat secara khusus, dan VAE-nya mendukung RGBA secara native sehingga elemen berlatar transparan bisa langsung dihasilkan. Resolusi output yang direkomendasikan adalah 2048×2048, dengan opsi 1024×1024 untuk proses yang lebih cepat.
Model Layer menyelesaikan masalah dari sisi lain. Ketika desainer menerima gambar hasil AI dan ingin mengubah warna satu tombol saja, dulu satu-satunya cara adalah membuat ulang gambar atau memotongnya secara manual. Setelah dipecah menjadi lapisan, teks, latar belakang, dan elemen utama bisa dipindah atau diganti masing-masing secara terpisah.
Hasil dan catatan penting
Pada papan peringkat khusus desain UI/UX yang diperbarui lembaga penilai pihak ketiga, Artificial Analysis, pada 18 September, Ming-Image-0.1-Design mencatat skor Elo 1082, menempati posisi pertama di antara model open-weight. Ant Group juga merilis tiga data rincian: stabilitas tata letak 67,4%, komposisi kompleks 67,0%, dan rendering teks 66,7%. Metode perhitungan ketiga persentase ini dan model pembanding yang digunakan tidak dijelaskan dalam materi publik, sehingga peringkat Elo lebih layak dijadikan acuan utama.
Halaman model di Hugging Face tidak mengungkap detail arsitektur dasar, dan juga tidak mencantumkan perbandingan langsung dengan model closed-source. Peringkat papan tersebut hanya mencakup model open-weight, sehingga belum ada data publik soal posisinya dibandingkan alat pembuat desain komersial yang closed-source.
Artinya bagi tim di China
Mulai dari soal ambang batas perangkat keras. Konfigurasi yang sudah diverifikasi resmi adalah satu GPU CUDA dengan VRAM 80GB pada presisi BF16 — setara kartu kelas data center seperti A100 atau H100. Apakah bisa berjalan di GPU konsumen, atau seberapa besar penurunan kualitas setelah kuantisasi, tidak dijelaskan di halaman model, sehingga tim yang ingin deploy secara lokal harus mengujinya sendiri. Bagi yang ingin melihat hasilnya lebih dulu, API OpenRouter gratis selama dua minggu adalah jalan masuk dengan biaya paling rendah.
Dari sisi lisensi, MIT mengizinkan penggunaan komersial dan pengembangan turunan, sehingga hampir tidak ada beban hukum tambahan bagi perusahaan yang ingin menanamkan kemampuan generatif ini ke dalam alat desain atau sistem materi pemasaran mereka sendiri.
Yang paling dekat dengan pekerjaan kantor sehari-hari adalah paket skill PPT tadi. Banyak materi laporan masih dibuat dengan cara "screenshot lalu edit manual". Jika satu gambar bisa dipecah kembali menjadi elemen halaman yang bisa diedit, waktu yang dihemat adalah waktu pengerjaan ulang yang berulang. Seberapa akurat hasilnya — apakah teks yang diekstrak bisa langsung diedit, atau apakah fontnya ikut berubah — belum ada data evaluasi resmi, jadi perlu dicoba sendiri.
Tata letak teks berbahasa Mandarin adalah hal lain yang masih perlu diuji. Materi paket skill dari Ant Group memuat contoh desain berbahasa Mandarin, tapi halaman model tidak mencantumkan hasil pengujian khusus untuk rendering teks Mandarin, sehingga pengguna yang membuat poster atau antarmuka berbahasa Mandarin perlu mencobanya sendiri beberapa kali sebelum mengambil kesimpulan.
Sumber: halaman model Hugging Face, IT Home, CocoLoop, Artificial Analysis; jumlah parameter, lisensi, dan kebutuhan VRAM mengikuti halaman model Hugging Face, sementara peringkat papan dan data rincian mengikuti Artificial Analysis dan rilis resmi.