Back

Technical Brief: Arsitektur Hybrid Agentic AI melalui Nemotron 3.5 Lightning dan NeMo Switchyard

AIoT Solutions

Arsitektur AI Agen Hibrid melalui Nemotron 3.5 Lightning dan NeMo Switchyard

1. Overview Sistem: Paradigma "Systems of Models"

Agentic AI modern membutuhkan pergeseran dari penyebaran model monolitik ke arsitektur "System of Models". Dalam kerangka ini, agen mengeksekusi alur kerja kompleks yang melibatkan persepsi, perencanaan, tindakan, evaluasi, dan pengulangan. Tidak ada model dasar tunggal yang unggul dalam semua langkah; sebaliknya, efisiensi dan akurasi dimaksimalkan dengan mengarahkan tugas-tugas spesifik ke model khusus dan menyimpan model frontier-level hanya untuk penalaran kompleksitas tinggi.

Benefit Arsitektur Utama:

  • Higher Accuracy: Pemanfaatan kemampuan model optimal untuk setiap langkah alur kerja tertentu.
  • Better Efficiency: Model khusus yang lebih kecil menangani tugas-tugas volume tinggi; model frontier menangani kompleksitas.
  • Lower Latency: Response time yang berkurang di seluruh alur kerja agentic multi-step.
  • Security & Data Sovereignty: Aturan perutean yang dapat dikonfigurasi dapat menetapkan data sensitif secara ketat (misalnya, informasi pelanggan, angka keuangan, atau kode sumber yang dilindungi)

2. NVIDIA Nemotron 3.5 Lightning

NVIDIA Nemotron 3.5 Lightning berfungsi sebagai mesin inferensi lokal yang efisien dalam arsitektur ini, dirancang untuk menangani tugas agen bervolume tinggi tanpa ketergantungan pada cloud.

Arsitektur & Kemampuan Model:

  • Architecture: Mixture-of-Experts (MoE) dengan 30 miliar parameter total dan hanya 3 miliar parameter aktif per token.
  • Lineage: Disuling dari model Nemotron 3 Ultra frontier NVIDIA untuk mempertahankan kemampuan agen dalam ukuran yang lebih kecil.
  • Optimization: Dirancang untuk harness agen populer; menghadirkan akurasi terdepan dalam coding, tool calling, instruction following, dan multi-turn workflows.
  • Customizability: Sepenuhnya open dan customizable, memungkinkan organisasi untuk melatih ulang model pada proprietary data untuk tugas khusus.

Target Penyebaran Hardware:

Dirancang untuk penyebaran lokal untuk memastikan kedaulatan data dan inferensi latensi rendah:


3. NVIDIA NeMo Switchyard

NVIDIA NeMo Switchyard adalah orchestration layer yang memungkinkan arsitektur "System of Models" dengan mengotomatiskan distribusi lalu lintas.

Core Functionality:

  • Automatic Routing: Bertindak sebagai open-source routing library yang memilih model terbaik yang tersedia untuk setiap langkah dari alur kerja agen dari kumpulan yang ditentukan pengguna (campuran model closed dan open).
  • Zero-Configuration Start: Termasuk algoritma built-in starter routing yang bekerja langsung tanpa out-of-the-box training data, fine tuning, atau konfigurasi kompleks yang diperlukan.
  • Autonomous Improvement: Model perutean menjadi lebih pintar seiring waktu; data penggunaan dari jalur agen secara otomatis meningkatkan keputusan perutean tanpa pelatihan ulang manual.

Integration Modes:

Tersedia melalui GitHub Early Access dan kompatibel dengan berbagai titik integrasi:
  • Standalone server
  • Lightweight Python library
  • Tertanam secara native di dalam harness agen (melalui gateway LLM atau ISP).

4. Operational Workflow Logic

Integrasi Nemotron 3.5 Lightning dan NeMo Switchyard mengikuti signal-driven routing loop:

  • Observation: Agen menemui langkah tugas (misalnya, perencanaan, coding, verifikasi).
  • Evaluation: NeMo Switchyard mengevaluasi konteks query terhadap kekuatan model yang tersedia.
  • Routing Decision:
    1. High-Volume/Specialized Tasks: Routed ke Nemotron 3.5 Lightning lokal untuk efisiensi dan privasi (misalnya, routine classification, data extraction).
    2. Complex Reasoning Tasks: Routed ke Frontier Model ketika kemampuan khusus terlampaui.
  • Execution & Feedback: Model yang dipilih memproses permintaan. Performance telemetry memberi feedback ke Switchyard untuk memperbaiki keputusan perutean di masa depan.

5. Kasus Penggunaan Industri

Arsitektur hybrid ini menargetkan workflow vertikal spesifik di mana agen "always-on" membutuhkan inferensi yang konsisten dan andal:

  • Personal Agents: Mengelola email, kalender, project, dan booking secara lokal di DGX Spark/RTX Spark.
  • Software Development: Penyimpulan PR, klasifikasi kode, dan penanganan tes.
  • Financial Services: Ekstraksi data dari dokumen, pemeriksaan aturan kebijakan, pemantauan sinyal risiko, dan pembuatan ringkasan.
  • Cybersecurity: Peningkatan peringatan, klasifikasi insiden, pencarian log, validasi kontrol, dan finding preparation.
  • Telecom & Healthcare: Penanganan alarm network/menjawab billing queries (Telecom); mengotomatiskan scheduling/billing/standardized comms (Healthcare Admin).

6. Hasil & Bukti Performa

Penerapan produksi yang menggunakan arsitektur perutean ini telah menunjukkan pengurangan biaya dan peningkatan efisiensi yang signifikan:

  • Harvey Legal: Mengurangi biaya inferensi model lebih dari 10 kali lipat dengan memasangkan Switchyard dengan model Nemotron post-trained yang disesuaikan untuk domain hukum mereka.
  • Applied Compute: Mencapai pengurangan 25% dalam biaya model keseluruhan dan mempertahankan akurasi frontier-level pada benchmark SWE-bench Verified melalui perutean cerdas.

Arsitektur ini memindahkan adopsi AI dari "procurement of GPU clusters" ke penerapan sistem software modular dan optimal yang mampu mengoptimalkan secara mandiri seiring waktu.

Berlangganan dengan blog kami

Tetap up to date dengan hardware, tips, dan berita terbaru

Please check the box if you would like to receive our latest news and updates.By clicking here, you consent to the processing of your personal data by [Micro-Star International Co., LTD.] to send you information about [MSI’s products, services and upcoming events]. Please note that you can unsubscribe from the MSI Newsletters here at any time.

Further details of our data processing activities are available in the MSI Privacy Policy