#open-source
14 articles

HiDream-O1-Image-Dev: Model 8B Asli-Pixel yang Mengalahkan FLUX.2 56B
HiDream-O1-Image-Dev adalah model gambar hasil distilasi 8B yang menghilangkan VAE dan encoder teks eksternal, menghasilkan gambar 2K secara native, dan mengungguli model berukuran 7x lebih besar dalam benchmark GenEval, DPG, dan HPSv3.

Apa Itu Google Gemma 4? Arsitektur, Tolok Ukur, dan Mengapa Ini Penting
Google Gemma 4 adalah keluarga model terbuka paling canggih dari DeepMind hingga saat ini, hadir dalam empat ukuran di bawah lisensi Apache 2.0 dengan input multimodal, penalaran bawaan, dan penerapan on-device hingga ke Raspberry Pi.

daVinci-MagiHuman: Model Open-Source yang Mengalahkan Semua Generator Digital Human
daVinci-MagiHuman adalah model open-source 15B yang menghasilkan video kepala berbicara dengan sinkronisasi bibir dalam 2 detik di satu GPU H100. Mengalahkan Ovi 1.1 (tingkat kemenangan 80%) dan LTX 2.3 (60,9%). Berlisensi Apache 2.0, multibahasa, dan sangat cepat.

Memperkenalkan daVinci MagiHuman Image-to-Video di WaveSpeedAI
daVinci MagiHuman Image-to-Video adalah model open-source 15B yang menganimasikan gambar referensi menjadi video sinematik dengan sinkronisasi audio opsional. Setara dengan WAN 2.5. Hingga 1080p, 5-10 detik. REST API, $0,04/detik, tanpa cold start.

Memperkenalkan daVinci MagiHuman Text-to-Video di WaveSpeedAI
daVinci MagiHuman Text-to-Video menghasilkan video sinematik yang berpusat pada manusia dari teks prompt dengan sinkronisasi audio opsional. Model open-source 15B, hingga 1080p, 5-10 detik. REST API, $0,04/detik, tanpa cold start.

Helios: Model Generasi Video Panjang Real-Time yang Menghindari Semua Jalan Pintas
Helios menghasilkan video berdurasi satu menit pada 19,5 FPS di satu H100 — tanpa KV-cache, sparse attention, atau trik akselerasi biasa. Inilah yang membuatnya berbeda.

BitDance 14B: Generasi Gambar AI Autoregresif 30x Lebih Cepat
BitDance 14B menghasilkan gambar 30x lebih cepat dari model autoregresif lainnya menggunakan token biner. Mengungguli FLUX.1 pada tolok ukur. Coba di WaveSpeedAI.

Kimi K2.5: Semua yang Perlu Anda Ketahui tentang Model Visual Agentic Moonshot
Kimi K2.5 adalah model open-source 1T parameter dari Moonshot AI dengan teknologi Agent Swarm, konteks 256K, dan kemampuan multimodal. Berikut penjelasan lengkapnya.

OpenClaw: Asisten AI Pribadi Open Source yang Anda Kontrol
Temukan OpenClaw, asisten AI pribadi inovatif berbasis open source yang berjalan di perangkat Anda sendiri dan terintegrasi dengan berbagai platform pesan sambil memberikan Anda kontrol penuh.

MOVA vs WAN vs Sora 2 vs Seedance: Membandingkan Model AI Video-Audio pada 2026
Bandingkan OpenMOSS MOVA, WAN 2.2 Spicy, WAN 2.6 Flash, Sora 2, dan Seedance 1.5 Pro untuk generasi video dengan audio. Fitur, harga, dan rekomendasi.

DeepSeek V4: Semua yang Kami Ketahui Tentang Model AI Coding Mendatang
DeepSeek V4 akan diluncurkan pada Februari 2026 dengan kemampuan coding yang revolusioner. Berikut adalah apa yang kami ketahui tentang arsitektur, fitur, dan benchmark.

Apple SHARP: Ubah Foto Apa Pun Menjadi 3D dalam Kurang dari Satu Detik
Model AI SHARP milik Apple mengonversi foto 2D tunggal menjadi adegan 3D fotorealistis dalam waktu kurang dari satu detik menggunakan Gaussian splatting. Pelajari cara kerja terobosan open-source ini.