Xiaomi selama ini dikenal dengan ponsel terjangkau dan perangkat rumah pintar.
Namun, dalam satu setengah tahun terakhir, perusahaan ini diam-diam berubah menjadi salah satu pemain AI paling ambisius di dunia.
Dari model bahasa besar, kloning suara, hingga agen ponsel otonom, Xiaomi bergerak cepat. Berikut adalah semua yang perlu Anda ketahui tentang posisi Xiaomi dalam perlombaan AI dan LLM.
Awal Mula Xiaomi di Dunia LLM
Kisah AI Xiaomi dimulai pada April 2025 dengan merilis MiMo-7B, model bahasa besar open-source pertama mereka. Nama MiMo merupakan singkatan dari Xiaomi Model.
Xiaomi fokus pada penalaran dan pengkodean, bukan sekadar obrolan. Meski hanya memiliki 7 miliar parameter, MiMo-7B diklaim mampu bersaing dengan model yang lebih besar.
Pada tolok ukur matematika seperti MATH-500, versi reinforcement-learning model ini mencapai skor 95,8%.
Model ini bahkan mengungguli o1-mini milik OpenAI dan Qwen-32B-Preview milik Alibaba dalam kompetisi matematika AIME 2024 dan 2025.
MiMo-7B dilatih pada dataset khusus berisi 200 miliar token penalaran, dengan total 25 triliun token dalam tiga fase pelatihan.
Xiaomi merilisnya di bawah lisensi open-source MIT dan tersedia di Hugging Face.
Tim pengembang dipimpin oleh Luo Fuli yang sebelumnya berasal dari DeepSeek.
MiMo-V2-Flash: Model Efisien dengan MoE
Pada Desember 2025, Xiaomi mengumumkan MiMo-V2-Flash, model dengan 309 miliar parameter yang sebagian besar parameternya tidak aktif.
Berkat desain Mixture-of-Experts (MoE), hanya sekitar 15 miliar parameter yang digunakan setiap saat.
Model ini unggul dalam performa dan kecepatan.
Ia menempati peringkat dua teratas di antara model open-source pada tolok ukur penalaran, setara dengan GPT-5 dan Claude 4.5 Sonnet dalam pengujian rekayasa perangkat lunak (SWE-Bench Verified).
MiMo-V2-Flash mampu menghasilkan respons dengan kecepatan 150 token per detik dan diklaim hanya memakan biaya 2,5% dari harga inferensi Claude.
Xiaomi menetapkan harga API sebesar $0,1 per juta token input dan memberikan akses gratis untuk waktu terbatas saat peluncuran.
Model ini juga memperkenalkan teknik Multi-Token Prediction (MTP) yang memungkinkan model menghasilkan dan memverifikasi beberapa token sekaligus.
MiMo-V2-Pro: Flagship Triliunan Parameter
Pada Maret 2026, Xiaomi meluncurkan model paling ambisius mereka, MiMo-V2-Pro. Model ini memiliki total lebih dari satu triliun parameter dengan 42 miliar parameter aktif per langkah.
MiMo-V2-Pro mendukung jendela konteks satu juta token, yang berarti dapat memproses setara beberapa novel panjang dalam satu percakapan.
Xiaomi mengatakan model ini dirancang khusus untuk tugas "agentic" yang kompleks dan memerlukan perencanaan serta eksekusi tanpa input manusia terus-menerus.
Menariknya, model ini pertama kali muncul di OpenRouter secara anonim dengan nama "Hunter Alpha" dan langsung menduduki puncak papan peringkat.
Model ini memproses lebih dari 1,5 triliun token sebelum Xiaomi secara resmi mengakui kepemilikannya.
Bersamaan dengan MiMo-V2-Pro, Xiaomi juga merilis dua model pendamping: MiMo-V2-Omni (multimodal yang dapat memproses teks, gambar, audio, dan video) serta MiMo-V2-TTS (model text-to-speech untuk pipeline agen).
MiMo-V2.5 dan V2.5-Pro: Arsitektur Terpadu
Pada akhir April 2026, Xiaomi menggabungkan yang terbaik dari keluarga V2 ke dalam satu arsitektur.
MiMo-V2.5-Pro adalah model dengan 1,02 triliun parameter yang menangani teks, gambar, audio, dan video dalam satu kesatuan.
Model ini berjalan pada kecepatan 60 hingga 80 token per detik untuk tugas kompleks, sementara MiMo-V2.5 yang lebih ringan mencapai 100 hingga 150 token per detik.
V2.5-Pro juga menduduki peringkat model open-source teratas untuk kemampuan agentic pada tolok ukur Artificial Analysis saat peluncuran.
Xiaomi juga menghapus biaya tambahan untuk penggunaan jendela konteks 1 juta token penuh dan mereset kredit pengguna saat peluncuran, membuatnya lebih ramah pengembang.
Pada awal Juni 2026, Xiaomi meluncurkan MiMo Code, agen pengkodean AI berbasis terminal yang menggunakan MiMo-V2.5.
Berbeda dengan asisten pengkodean lain yang kehilangan konteks saat jendela penuh, MiMo Code memiliki sistem memori persisten yang melacak keputusan di seluruh proyek panjang.
MiMo-VL: Model Visi-Bahasa
Di sisi visual, Xiaomi merilis MiMo-VL (Vision-Language) dan varian khusus rumah, MiMo-VL-Miloco-7B. Model Miloco dirancang untuk memahami lingkungan rumah.
Model ini dapat mengenali gestur sehari-hari seperti jempol, OK, tanda damai, dan telapak tangan terbuka.
Ia juga dapat mengidentifikasi aktivitas rumah tangga umum seperti menonton TV, berolahraga, atau membaca. Model ini dibangun dengan campuran supervised fine-tuning dan reinforcement learning.
MiDashengLM-7B: Model Audio AI
Dirilis pada Agustus 2025, MiDashengLM-7B adalah model audio AI Xiaomi.
Tidak seperti kebanyakan sistem suara AI yang dilatih pada pengenalan ucapan, model ini menggunakan pendekatan "general audio caption".
Model ini dilatih pada dataset besar 38.662 jam dan dapat memahami tidak hanya kata-kata, tetapi juga musik, suara lingkungan, emosi pembicara, dan konteks akustik.
Model ini dibangun di atas Qwen2.5-Omni-7B dari Alibaba dan tertanam di kendaraan listrik serta perangkat rumah pintar Xiaomi.
Xiaomi merilisnya di bawah lisensi Apache 2.0.
MiMo-Audio: Mendengar dalam Skala Besar
Bersamaan dengan pekerjaan visi dan bahasa, Xiaomi juga menerbitkan MiMo-Audio, model bahasa audio terpisah. Encoder audio dari MiMo-Audio kemudian diintegrasikan ke dalam MiMo-V2.5 untuk mendukung pengalaman omnimodal.
OmniVoice: Kloning Suara dalam Berbagai Bahasa
Salah satu rilis paling mengesankan dari Xiaomi adalah OmniVoice, model text-to-speech dari tim Kaldi generasi berikutnya di Lab AI Xiaomi, yang dirilis open-source pada Mei 2026.
OmniVoice mendukung 646 bahasa, termasuk banyak bahasa dengan sumber daya rendah yang memiliki sedikit data pelatihan.
Model ini adalah model kloning suara zero-shot, yang berarti dapat mengkloning suara hanya dari beberapa detik audio referensi dan menghasilkan ucapan yang terdengar alami lintas bahasa sambil mempertahankan karakteristik suara asli.
Keunggulan teknis OmniVoice terletak pada arsitektur transformer tunggal yang menyederhanakan pemetaan teks langsung ke token akustik.
Hal ini memungkinkan pelatihan pada 100.000 jam data audio dalam satu hari dan menjalankan inferensi hingga 40x kecepatan real-time menggunakan PyTorch.
Xiaomi mengatakan OmniVoice adalah model TTS kloning suara pertama yang mencakup ratusan bahasa.
Model ini juga memiliki alat praktis untuk memperbaiki pengucapan rumit, seperti karakter Cina polifonik atau kata benda bahasa Inggris yang tidak umum.
Semua tersedia di bawah lisensi Apache-2.0.
MiMo-V2.5-TTS dan ASR: Pipeline Suara Lengkap
Bersamaan dengan peluncuran V2.5 yang lebih luas, Xiaomi juga merilis MiMo-V2.5-TTS dan sistem ASR (Automatic Speech Recognition).
Model TTS mendukung kloning suara, dan ASR menangani pengenalan bilingual. Bersama-sama, mereka memungkinkan pengembang membangun produk berbasis suara ujung-ke-ujung tanpa harus menggabungkan alat dari penyedia berbeda.
Xiao AI dan HyperAI: Sisi Konsumen
Di sisi konsumen, Xiaomi memiliki dua pengalaman AI utama untuk pengguna biasa. Xiao AI adalah asisten suara lama Xiaomi yang tersedia di ponsel, speaker pintar, dan perangkat wearable.
Dengan HyperOS 2, Xiao AI ditingkatkan menjadi "Super Xiao AI" dengan memori konteks yang lebih baik, kontrol perangkat rumah yang lebih pintar, dan kemampuan menghasilkan gambar dari teks.
Xiao AI terintegrasi dalam sistem tiga pilar HyperOS: HyperCore untuk performa, HyperConnect untuk sinkronisasi perangkat, dan HyperAI untuk fitur pintar.
HyperAI diperkenalkan secara global di MWC 2025 dan mulai hadir di ponsel mulai dari seri Xiaomi 15.
Fitur ini mencakup terjemahan real-time, bantuan penulisan AI, pengenalan ucapan pintar yang merangkum rekaman, dan pengeditan foto AI.
Untuk perangkat global, Xiaomi juga mengintegrasikan Google Gemini sebagai backend. HyperAI telah diperluas ke perangkat kelas menengah, termasuk Redmi Note 14 Pro+ 5G dan seri Poco.
miclaw: Agen AI yang Melakukan Sesuatu untuk Anda
Bagian paling visioner dari teka-teki AI Xiaomi adalah miclaw. Diumumkan pada Maret 2026 dan saat ini dalam beta tertutup, miclaw bukanlah chatbot.
Ini adalah agen AI otonom yang dibangun di atas MiMo.
Alih-alih hanya menjawab pertanyaan, miclaw menafsirkan apa yang Anda inginkan dan kemudian benar-benar melakukannya.
Ia dapat membuka aplikasi, menavigasi antarmuka, mengisi formulir, berinteraksi dengan alat sistem, dan menyelesaikan tugas multi-langkah di ponsel Anda tanpa perlu pengawasan setiap langkah.
miclaw bekerja melalui apa yang disebut Xiaomi sebagai "inference-execution loop": AI mencari tahu apa yang harus dilakukan, melakukannya, memeriksa hasilnya, dan melanjutkan hingga tugas selesai.
miclaw juga memiliki memori kontekstual yang memampatkan interaksi lama sambil tetap mengingat niat asli suatu tugas.
miclaw dapat terhubung ke ekosistem rumah pintar dan mobil Xiaomi yang lebih luas. Dalam hal privasi, Xiaomi mengatakan interaksi pengguna dengan miclaw tidak digunakan untuk melatih model AI.
Data pribadi diproses secara real-time hanya untuk menjalankan perintah, dan informasi sensitif ditangani secara lokal di perangkat melalui apa yang disebut Xiaomi sebagai "edge-cloud privacy computing."
Saat ini, beta tertutup mendukung seri Xiaomi 17. Menurut Xiaomi, HyperOS 4 akan mengintegrasikan miclaw sepenuhnya di tingkat sistem.
miclaw juga telah diuji sebagai asisten jam tangan pintar yang berjalan melalui aplikasi Xiaomi Health.
Investasi Besar di Balik AI Xiaomi
Pada Maret 2026, CEO Xiaomi Lei Jun mengumumkan perusahaan akan berinvestasi setidaknya $8,7 miliar dalam AI selama tiga tahun ke depan.
Jumlah ini di atas anggaran R&D yang sudah meningkat.
Hasilnya mulai terlihat. Pada awal April 2026, model-model Xiaomi telah menguasai sekitar 21% dari seluruh lalu lintas di OpenRouter.
Lei Jun juga mengatakan perusahaan menargetkan "grand convergence" pada 2026, menyatukan chip sendiri, OS sendiri, dan model AI sendiri dalam satu perangkat.
Dua belas bulan lalu, Xiaomi tidak memiliki model AI publik.
Kini, mereka memiliki tumpukan lengkap: model penalaran, model visi-bahasa, model audio, sistem kloning suara, pipeline TTS/ASR, agen AI, dan fitur AI konsumen yang menjangkau jutaan perangkat.
Kecepatan pengembangan dan rilis model-model ini sangat mencolok. Fakta bahwa sebagian besar bersifat open-source membantu Xiaomi membangun momentum pengembang dengan cepat.
Ujian besar berikutnya adalah apakah miclaw dan HyperOS 4 dapat membuat semua AI ini benar-benar berguna dalam kehidupan sehari-hari.
Jika berhasil, Xiaomi tidak hanya akan menjadi perusahaan ponsel yang mengerjakan AI, tetapi menjadi platform AI yang sesungguhnya.