Wilayah Oksipital · Pertanyaan Pembuka

Bagaimana GPU Sampai ke Aplikasi Anda?

Percakapan tentang AI hampir selalu berhenti di lapisan yang paling terlihat: model apa yang dipakai, berapa parameternya, berapa skor benchmark-nya.

Tapi begitu sebuah perusahaan memutuskan menjalankan AI di infrastrukturnya sendiri, pertanyaan pertama yang menentukan proyek itu jalan atau mandek justru jauh lebih membosankan: bagaimana GPU yang terpasang di rak server sampai ke aplikasi yang membutuhkannya?

Jawabannya menentukan berapa banyak tim yang bisa memakai satu kartu, seberapa cepat model Anda merespons, dan berapa besar aset paling mahal di data center Anda menganggur.

Batang Otak · Rantai Fondasi

Tumpukan yang Jarang Digambar Utuh

01 Model Weights turun ke
02 Runtime (Ollama, vLLM) turun ke
03 Sistem Operasi turun ke
04 Mesin (VM atau host) turun ke
05 Silikon (GPU)

Model AI, pada dasarnya, bukan program. Ia kumpulan model weights: file besar berisi angka, yang tidak melakukan apa pun sampai ada perangkat lunak yang memuatnya ke memori.

Setiap sambungan di rantai itu adalah titik keputusan arsitektur. Sambungan terakhir, antara mesin dan silikon, paling sering diabaikan sampai proyeknya terlanjur berjalan.

Lobus Temporal · Ekonomi

Untuk AI, Ekonominya Justru Terbalik

Virtualisasi Klasik

Server CPU terlalu banyak menganggur. Jawabannya konsolidasi. Virtualisasi berperan sebagai alat penghematan.

Workload AI

CPU jarang jadi penghambat. Yang langka dan mahal adalah GPU. Virtualisasi berubah menjadi alat alokasi.

Satu data center-class GPU bisa bernilai setara beberapa server biasa, dan waktu tunggu pengadaannya sering diukur dalam bulan, bukan hari.

GPU yang menganggur semalaman karena dikuasai satu tim adalah pemborosan modal yang jauh lebih mahal daripada server CPU yang idle.

Hemisfer Kiri dan Kanan · Perbandingan

Dua Cara GPU Sampai ke Mesin Virtual

PCI PassthroughvGPU
PembagianSatu kartu, satu VMSatu kartu, banyak VM
PerformaMendekati bare metalSesuai porsi slice
Cocok untukTraining dan fine-tuningInference dan pengembangan
LisensiTidak adaLisensi vGPU vendor

Passthrough melepas kartu dari host dan menyerahkannya utuh ke guest, sehingga VM berbicara langsung ke silikon. Syaratnya IOMMU aktif di BIOS dan parameter kernel.

vGPU memecah satu kartu enterprise menjadi beberapa GPU virtual. Tesla T4 16 GB, misalnya, bisa di-slice menjadi delapan vGPU berukuran 2 GB.

Korpus Kalosum · Batasan

Tiga Batasan yang Sering Ditemukan Terlambat

01 · Tidak Bisa Dua Mode Sekaligus

Ketika sebuah GPU sudah terikat ke driver passthrough, ia tidak bisa menyediakan slice vGPU, dan sebaliknya.

02 · vGPU Tanpa Hot-Plug

Menambah atau melepas slice mengharuskan mesin virtual dimatikan lebih dulu.

03 · Ampere ke Atas Butuh SR-IOV

Virtual function harus diaktifkan di host sebelum profil vGPU muncul sama sekali.
Talamus · Implementasi

Bagaimana Awanio Mengerjakannya

CEP · Cloud Enabler Platform

Menjalankan mesin virtual di atas Kubernetes. Mode pemasangan mengikuti perangkat yang dipilih: kartu yang dapat dibagi disajikan sebagai vGPU, yang tidak dapat dibagi diberikan utuh sebagai passthrough. Karena membawa IAM dan penagihan, alokasi GPU punya pemilik dan biaya.

Vapor · Satu Host, Dikelola Langsung

Bekerja di atas KVM, QEMU, dan libvirt. Passthrough sebagai perangkat PCI, vGPU sebagai mediated device, dengan sembilan pemeriksaan kesiapan dan installer terpandu. Masuk sejak versi 3.0.0, Juli 2026.
Korteks Prefrontal · Aksi

Langkah yang Bisa Dijadwalkan Pekan Ini

  1. Periksa kesiapan perangkat keras: apakah IOMMU sudah aktif, dan apakah GPU Anda termasuk kelas yang mendukung pembagian vGPU.
  2. Kelompokkan workload Anda, karena training dan inference menuntut perlakuan yang berbeda.
  3. Tentukan pilihan: memberikan kartu utuh, atau membaginya menjadi beberapa vGPU.
  4. Jalankan satu workload nyata, bukan benchmark sintetis, lalu ukur berapa persen kapasitas GPU yang benar-benar terpakai.

Angka terakhir itu biasanya yang paling membuka mata, dan hampir selalu menjadi dasar pembicaraan anggaran yang jauh lebih sehat.

Baca artikel lengkapnya →
PETA KORTIKAL
DECK: INFRASTRUKTUR AI
WILAYAH 01/07 · ZOOM 6x
01 / 07
Panah / Spasi / PageUp / PageDown
Geser layar untuk berpindah wilayah
> memuat peta korteks
> citra satelit neuron OK
> menandai 7 wilayah SELESAI
> sinkronisasi orbit kamera STABIL
> MULAI PENJELAJAHAN

Mesin 3D gagal dimuat

Pustaka Three.js tidak tersedia.

Periksa koneksi ke cdnjs.cloudflare.com, lalu muat ulang halaman ini.