Tentang Sesi Ini
Ringkasan & metadata
Sesi ini menunjukkan cara memadukan Amazon Athena — mesin kueri SQL serverless yang langsung membaca data di Amazon S3 — dengan Amazon Bedrock yang menyediakan model bahasa besar (LLM), untuk membangun analitik kontekstual berbahasa natural. Idenya sederhana namun kuat: pengguna cukup bertanya dengan bahasa manusia biasa, sistem menerjemahkannya menjadi kueri SQL, mengeksekusinya ke data lake, lalu merangkai hasilnya menjadi jawaban dan insight yang mudah dibaca.
Selama ini, mengubah pertanyaan bisnis menjadi angka membutuhkan seorang analis yang fasih SQL dan paham struktur tabel. Setiap "berapa penjualan wilayah Timur bulan lalu?" berujung antre di tim data. Pendekatan text-to-SQL yang dibahas di sesi ini menghapus jembatan yang hilang itu: LLM menyusun "surat perintah" SQL, Athena yang mengeksekusi. Tetapi membuatnya akurat, aman, dan hemat biaya bukan sekadar menempelkan LLM ke database — di situlah letak isi teknis sesi ini: peran metadata/skema, AWS Glue Data Catalog, guardrails, penanganan ambiguitas, dan pengendalian biaya.
Kenapa penting untuk Anda? Jika tim non-teknis di organisasi Anda kerap menunggu berhari-hari hanya untuk sebuah angka, sesi ini adalah cetak biru untuk menjadikan data lake bisa "ditanya" langsung — tanpa mengorbankan keamanan dan anggaran.
Apa Itu & Bagaimana Bekerjanya
Apa itu analitik kontekstual
Analitik kontekstual berbahasa natural adalah kemampuan bertanya kepada data seolah berbicara dengan seorang analis: "Produk mana yang paling laris di Surabaya kuartal ini, dan bagaimana trennya?" Sistem memahami maksud (intent), menyusun kueri yang tepat, menjalankannya, lalu menjelaskan hasilnya dalam kalimat — lengkap dengan konteks. Kuncinya ada dua: Athena yang mengeksekusi SQL langsung ke file di S3 (tanpa perlu memindahkan/menyalin data ke database terpisah), dan Bedrock yang menyediakan "kecerdasan bahasa" untuk menerjemahkan pertanyaan ↔ SQL ↔ jawaban.
Yang membedakan solusi mainan dari solusi produksi adalah konteks skema. LLM tidak bisa menebak nama tabel dan kolom Anda. Ia harus "diberi tahu" struktur data — dari mana? Dari AWS Glue Data Catalog, katalog metadata yang menyimpan definisi tabel, kolom, tipe data, dan partisi. Dengan skema yang jelas (plus deskripsi kolom yang baik), LLM menyusun SQL yang jauh lebih akurat dan tidak "berhalusinasi" nama kolom.
Komponen utama
Berikut layanan dan lapisan inti yang membangun solusi ini, dengan fungsi ringkasnya:
Keenam bagian ini bekerja sebagai satu rantai. Contohnya, saat pengguna bertanya, LLM di Bedrock membaca skema dari Glue Catalog, menyusun SQL, lalu Guardrails memeriksa agar kueri hanya membaca (bukan menghapus/mengubah) data. Athena mengeksekusi ke S3, dan Observability mencatat kueri beserta jumlah data yang dipindai — yang berhubungan langsung dengan biaya.
Analogi yang Mudah Dicerna
Sang penerjemah ke gudang data
Ibaratnya, LLM adalah seorang penerjemah dan juru tulis yang berdiri di antara Anda dan sebuah gudang raksasa berisi jutaan berkas. Anda tidak perlu tahu di rak mana barang disimpan atau bahasa formal apa yang dipakai petugas gudang. Anda cukup berkata, dengan bahasa sehari-hari, "tolong ambilkan rekap penjualan sepatu bulan lalu." Sang penerjemah menyusun "surat perintah" resmi (kueri SQL) sesuai tata bahasa gudang, menyerahkannya ke petugas (Athena), dan petugas mengambil berkas dari rak (S3).
- Anda = pengguna bisnis yang bertanya dengan bahasa biasa.
- Penerjemah/juru tulis = LLM (Bedrock) yang mengubah pertanyaan menjadi SQL.
- Buku denah gudang = Glue Data Catalog — peta rak, laci, dan label (skema).
- Petugas gudang = Athena yang mengeksekusi surat perintah.
- Rak & berkas = data lake di Amazon S3.
- Satpam = guardrails — memastikan surat perintah hanya "mengambil", tak pernah "membakar arsip".
High-Level Architecture & Alur
High-Level Architecture (HLA)
Secara garis besar, arsitektur solusi analitik kontekstual ini terlihat seperti ini: aplikasi menerima pertanyaan pengguna, meneruskannya ke Bedrock bersama konteks skema dari Glue Data Catalog. Bedrock menghasilkan SQL, yang divalidasi guardrails, lalu dijalankan Athena ke data di S3. Hasil baris data dikembalikan ke Bedrock untuk dirangkai menjadi jawaban natural, dan semuanya terekam Observability.
Alur kerja satu permintaan (text-to-SQL)
Ketika seseorang mengetik "berapa total penjualan wilayah Timur bulan lalu?", inilah yang terjadi di balik layar:
- Pahami maksud. LLM menangkap intent dan entitas ("wilayah Timur", "bulan lalu", "total penjualan").
- Ambil skema. Konteks tabel & kolom diambil dari Glue Data Catalog agar SQL merujuk nama yang benar.
- Susun SQL. LLM menghasilkan kueri SELECT yang sesuai (filter tanggal, agregasi SUM, dsb).
- Validasi (guardrails). Kueri diperiksa: hanya baca (SELECT), tanpa perintah destruktif, dengan batas biaya/scan.
- Eksekusi. Athena menjalankan kueri langsung ke data di S3.
- Rangkai jawaban. Hasil baris dikembalikan ke LLM untuk dijelaskan dalam kalimat + konteks; semua terekam untuk audit & biaya.
Dari Konsep ke Bisnis Nyata
Contoh nyata (konteks Indonesia)
Agar tidak berhenti di teori, berikut tiga skenario penerapan yang khas di Indonesia.
Tim non-teknis bertanya sendiri
Tim pemasaran dan operasional sebuah retail sering menunggu antrean laporan dari tim data. Dengan solusi ini, mereka cukup bertanya di sebuah chat internal: "produk mana yang stoknya menipis di gudang Jawa Timur minggu ini?" LLM menyusun SQL, Guardrails memastikan hanya membaca, dan Athena menjawab dari data lake. Beban tim data berkurang, keputusan diambil lebih cepat, dan setiap kueri tetap terekam untuk kepatuhan.
Laporan bahasa natural untuk pimpinan
Seorang manajer regional ingin ringkasan performa tanpa membuka dasbor rumit. Ia bertanya, "bandingkan pendapatan kuartal ini dengan kuartal lalu per wilayah, dan jelaskan penyebab utamanya." Sistem tidak hanya mengembalikan angka: LLM merangkai narasi insight ("wilayah Timur naik 12%, terutama karena kategori elektronik"). Metadata yang rapi di Glue Catalog membuat perbandingan antar-periode akurat.
Menjelajah data mentah dengan cepat
Tim data engineering menampung log dan berkas mentah dalam jumlah besar di S3. Alih-alih menulis kueri eksplorasi berulang, mereka bertanya bahasa natural untuk cepat memahami isi dataset baru: "kolom apa saja yang ada di tabel transaksi, dan berapa baris per hari minggu ini?" Guardrails membatasi jumlah data yang dipindai agar biaya tetap terkendali, sementara ambiguitas ("minggu ini") diklarifikasi lebih dulu bila perlu.
Ringkasan Visual (Geser)
Ringkasan visual
Enam kartu berikut merangkum inti sesi. Gunakan tombol atau tombol panah keyboard (← →) untuk berpindah.
Poin yang Bisa Dibawa Pulang
Poin yang bisa dibawa pulang
- Text-to-SQL menghapus jembatan yang hilang. Pengguna non-teknis bisa "bertanya" ke data lake tanpa menulis SQL.
- Athena + Bedrock saling melengkapi. Athena mengeksekusi SQL serverless atas S3; Bedrock menyediakan kecerdasan bahasa.
- Skema adalah nyawa akurasi. Glue Data Catalog dengan metadata & deskripsi kolom yang baik membuat SQL tepat, bukan mengarang.
- Aman & hemat sejak awal. Guardrails membatasi SQL agar read-only, dan pengendalian scan menjaga biaya tetap terkendali.