Apa itu Guardrails?
Guardrails dapat berada sebelum model menerima input, setelah model menghasilkan jawaban, atau di sekitar pemanggilan tool. Bentuknya dapat berupa aturan izin, validasi format, moderasi, pemeriksaan data sensitif, ambang risiko, dan persetujuan manusia. Ia adalah lapisan pengendalian, bukan tombol ajaib.
Sebelum agent mengirim email, sistem memeriksa apakah penerima termasuk daftar yang diizinkan, apakah isi email mengandung data rahasia, dan meminta konfirmasi pengguna. Jika salah satu pemeriksaan gagal, aksi tidak dijalankan.
Cara kerja sederhana
Sistem menetapkan apa yang boleh, harus diperiksa, dan harus ditolak. Input guardrail dapat menyaring permintaan awal, output guardrail menilai jawaban akhir, dan tool guardrail memeriksa argumen serta hasil tool sebelum aksi berlanjut.
Kenapa Anda perlu memahaminya?
Saat AI memiliki akses data atau mampu bertindak, kualitas jawaban saja tidak cukup. Guardrails membantu mengurangi tindakan yang tidak sesuai tujuan, kebocoran data, format keluaran yang berbahaya, dan kegagalan workflow yang dapat diprediksi.
Kesalahpahaman yang umum
Guardrails bukan sama dengan satu system prompt. System prompt adalah instruksi untuk model, sedangkan guardrails adalah kontrol sistem yang dapat memvalidasi dan menghentikan alur. Guardrails juga bukan pengganti keamanan aplikasi, otorisasi, atau audit manusia.
Catatan penting sebelum menggunakannya
Guardrails dapat melewatkan kasus baru, terlalu ketat, atau menambah latensi. Efektivitasnya harus diuji dengan skenario nyata dan diperbarui. Untuk aksi sensitif, pertahankan izin minimum dan persetujuan manusia meskipun guardrails telah dipasang.