Applied AI
Retrieval-Augmented Auto-Justification untuk Penilaian Compliance
Juli 2026 · 4 menit baca
Penilaian compliance, pada intinya, adalah latihan membuat judgment yang bisa dipertanggungjawabkan. Seseorang membaca sebuah requirement — kontrol dari ISO 27001/27002, atau klausul dari framework apa pun yang menjadi komitmen organisasi — lalu menelusuri kebijakan, prosedur, dan catatan sistem untuk menjawab pertanyaan yang terdengar sederhana: apakah kami benar-benar sudah mengimplementasikannya, dan seberapa baik? Bila dikerjakan dengan jujur, jawaban itu mahal. Buktinya tersebar di dokumen-dokumen yang tidak pernah ditulis dengan asesor dalam benak penulisnya, dan kesimpulannya harus tahan diperiksa auditor yang tidak hadir saat kesimpulan itu dibuat.
Pada platform kepatuhan keamanan siber tempat saya berkontribusi, kami membangun fitur yang menyusun draf judgment itu secara otomatis. Pengguna memilih sebuah requirement dari framework mana pun yang dimuat ke platform, dan sistem menghasilkan usulan penilaian: justification tertulis, status maturity, sitasi ke dokumen sumber milik organisasi itu sendiri, dan rekomendasi yang actionable. Saya menyebut polanya retrieval-augmented auto-justification, dan membangunnya mengajarkan saya lebih banyak tentang hubungan AI dengan auditability daripada perdebatan abstrak mana pun tentang keduanya.
Bagian yang menarik tidak pernah terletak pada kemampuan language model menulis paragraf yang terdengar meyakinkan tentang compliance. Itu memang bisa. Bagian yang menarik adalah semua hal di sekeliling model yang mengubah paragraf yang meyakinkan menjadi penilaian yang berani dipertahankan organisasi.
Berpijak pada bukti milik organisasi sendiri
Sebuah penilaian hanya bermakna bila ia bernalar dari apa yang benar-benar dilakukan organisasi, bukan dari kebiasaan organisasi pada umumnya. Karena itu fitur ini dibangun di atas retrieval-augmented generation (RAG) terhadap konteks organisasi itu sendiri: setiap dokumen yang diunggah ke platform — termasuk dokumen hasil scan yang dibaca lewat OCR — dan data terstruktur yang diinput tim ke platform, semuanya di-chunk, di-embed, dan diindeks untuk retrieval.
Index itu ketat per-tenant. Bukti setiap organisasi hidup di index terisolasi miliknya sendiri, dan tidak ada hasil retrieval satu tenant yang bisa memengaruhi penilaian tenant lain. Ini keputusan relevansi sekaligus keputusan keamanan — dan itu pas, karena premis platform ini memang bahwa keduanya jarang menjadi keputusan yang berbeda. Reindexing di background menjaga index tetap mutakhir saat data perusahaan berubah, sehingga penilaian mencerminkan organisasi sebagaimana adanya sekarang, bukan sebagaimana saat upload terakhir.
Kualitas retrieval adalah kualitas penilaian
Saat penilaian dijalankan, requirement yang dipilih menggerakkan vector search di index tenant tersebut, dan potongan yang ter-retrieve di-re-rank dengan MMR (maximal marginal relevance). Langkah re-ranking itu lebih penting dari kedengarannya: tanpanya, retrieval cenderung mengembalikan beberapa fragmen nyaris identik dari kebijakan yang paling cocok, dan model akhirnya menilai satu dokumen, bukan organisasinya. MMR menukar sedikit similarity mentah demi cakupan, sehingga konteks yang dinalar model merentang ke bukti-bukti yang berbeda.
Verdikt terstruktur, bukan teks bebas
Jawaban model tidak pernah berupa prosa bebas. Ia adalah output JSON terstruktur dengan bagian-bagian yang terdefinisi:
- Justification tertulis atas judgment implementasinya.
- Status maturity pada skala tujuh level: Nonexistent, Initial, Limited, Defined, Managed, Optimized — plus Not Applicable.
- Sitasi dokumen sumber yang menjadi pijakan judgment tersebut.
- Rekomendasi actionable untuk menutup gap yang tersisa.
Gagal dengan lantang, bukan diam-diam
Struktur itu dipaksakan, bukan sekadar diminta. Setiap respons divalidasi ketat terhadap bentuk yang diharapkan, dan respons yang tidak sesuai muncul sebagai error eksplisit — tidak pernah menjadi silent fallback yang diam-diam meloloskan penilaian setengah jadi. Dalam konteks compliance, ini satu-satunya pilihan yang bisa dipertahankan: jawaban salah yang gagal dengan lantang adalah bug yang bisa diperbaiki; jawaban salah yang lolos diam-diam adalah kegagalan tata kelola yang mungkin baru ketahuan saat audit menemukannya.
Disiplin yang sama berlaku untuk kualitas dari waktu ke waktu. Sebuah eval harness menilai kualitas retrieval dan jawaban, sehingga perubahan pada chunking atau ranking dinilai berdasarkan bukti, bukan berdasarkan apakah sebuah demo terlihat meyakinkan sore itu. Mengevaluasi sistem sebagaimana auditor mengevaluasi sebuah kontrol ternyata membentuk sebagian besar keputusan kami yang lain.
Human oversight sejak desain
Dua guardrail memikul sebagian besar bobot tata kelolanya. Pertama: status Not Applicable hanya boleh ditetapkan manusia. AI tidak diizinkan menyimpulkan bahwa sebuah requirement tidak berlaku bagi organisasi, karena menyatakan sesuatu berada di luar cakupan adalah titik di mana judgment otomatis justru paling berbahaya — ia mengeluarkan sebuah kontrol dari pertimbangan sama sekali.
Kedua: pemisahan yang disengaja antara narasi dan traceability. Justification ditulis tanpa merujuk nama file, sehingga prosanya tidak pernah membocorkan struktur internal penyimpanan dokumen organisasi — sementara sitasi sumber tetap dicatat terpisah menyertai setiap penilaian. Reviewer memegang traceability penuh atas dasar judgment itu; narasinya tetap cukup bersih untuk dibagikan.
Tidak ada dari semua ini yang membutuhkan teknologi eksotis. Yang dibutuhkan adalah memperlakukan fitur AI sebagaimana platform memperlakukan setiap kontrol lainnya: dengan kepemilikan yang jelas, mode kegagalan yang eksplisit, dan bukti yang bisa ditelusuri. Itulah tesis yang terus saya pegang dalam pekerjaan saya — keputusan teknis juga keputusan keamanan, sekaligus keputusan tata kelola. Penilaian berbantuan AI, yang dibangun dengan disiplin seperti itu, tidak menggerus auditability. Ia menyerahkan draf judgment kepada asesor dengan bukti yang sudah terlampir, dan menjaga keputusan yang memang harus tetap di tangan manusia, tetap di tangan manusia.