AWS Summit Jakarta 2026 · Seri Sesi

Bertanya ke Data Lake dengan Bahasa Manusia

Menggabungkan Amazon Athena dan Amazon Bedrock untuk analitik kontekstual berbahasa natural.
Kode DEV203Level 300 · LanjutanTrack Data & Analytics
Edisi Pertama · 2026 · Bagian dari seri 61 sesi
Track · Data & Analytics

Tentang Sesi Ini

01

Ringkasan & metadata

DEV20311:20 WIBFloor 4, Ballroom 1B Level 300 · LanjutanBahasa IndonesiaPembicara: AWS Community Builder

Sesi ini menunjukkan cara memadukan Amazon Athena — mesin kueri SQL serverless yang langsung membaca data di Amazon S3 — dengan Amazon Bedrock yang menyediakan model bahasa besar (LLM), untuk membangun analitik kontekstual berbahasa natural. Idenya sederhana namun kuat: pengguna cukup bertanya dengan bahasa manusia biasa, sistem menerjemahkannya menjadi kueri SQL, mengeksekusinya ke data lake, lalu merangkai hasilnya menjadi jawaban dan insight yang mudah dibaca.

Selama ini, mengubah pertanyaan bisnis menjadi angka membutuhkan seorang analis yang fasih SQL dan paham struktur tabel. Setiap "berapa penjualan wilayah Timur bulan lalu?" berujung antre di tim data. Pendekatan text-to-SQL yang dibahas di sesi ini menghapus jembatan yang hilang itu: LLM menyusun "surat perintah" SQL, Athena yang mengeksekusi. Tetapi membuatnya akurat, aman, dan hemat biaya bukan sekadar menempelkan LLM ke database — di situlah letak isi teknis sesi ini: peran metadata/skema, AWS Glue Data Catalog, guardrails, penanganan ambiguitas, dan pengendalian biaya.

Kenapa penting untuk Anda? Jika tim non-teknis di organisasi Anda kerap menunggu berhari-hari hanya untuk sebuah angka, sesi ini adalah cetak biru untuk menjadikan data lake bisa "ditanya" langsung — tanpa mengorbankan keamanan dan anggaran.
Konsep Inti

Apa Itu & Bagaimana Bekerjanya

02

Apa itu analitik kontekstual

Analitik kontekstual berbahasa natural adalah kemampuan bertanya kepada data seolah berbicara dengan seorang analis: "Produk mana yang paling laris di Surabaya kuartal ini, dan bagaimana trennya?" Sistem memahami maksud (intent), menyusun kueri yang tepat, menjalankannya, lalu menjelaskan hasilnya dalam kalimat — lengkap dengan konteks. Kuncinya ada dua: Athena yang mengeksekusi SQL langsung ke file di S3 (tanpa perlu memindahkan/menyalin data ke database terpisah), dan Bedrock yang menyediakan "kecerdasan bahasa" untuk menerjemahkan pertanyaan ↔ SQL ↔ jawaban.

Yang membedakan solusi mainan dari solusi produksi adalah konteks skema. LLM tidak bisa menebak nama tabel dan kolom Anda. Ia harus "diberi tahu" struktur data — dari mana? Dari AWS Glue Data Catalog, katalog metadata yang menyimpan definisi tabel, kolom, tipe data, dan partisi. Dengan skema yang jelas (plus deskripsi kolom yang baik), LLM menyusun SQL yang jauh lebih akurat dan tidak "berhalusinasi" nama kolom.

Komponen utama

Berikut layanan dan lapisan inti yang membangun solusi ini, dengan fungsi ringkasnya:

Amazon AthenaKueri SQL serverless atas S3
Amazon S3Penyimpanan data lake
AWS Glue CatalogMetadata: tabel, kolom, skema
Amazon BedrockLLM untuk text-to-SQL & insight
GuardrailsBatasi SQL agar aman (read-only)
ObservabilityJejak kueri, biaya & audit

Keenam bagian ini bekerja sebagai satu rantai. Contohnya, saat pengguna bertanya, LLM di Bedrock membaca skema dari Glue Catalog, menyusun SQL, lalu Guardrails memeriksa agar kueri hanya membaca (bukan menghapus/mengubah) data. Athena mengeksekusi ke S3, dan Observability mencatat kueri beserta jumlah data yang dipindai — yang berhubungan langsung dengan biaya.

Perumpamaan

Analogi yang Mudah Dicerna

03

Sang penerjemah ke gudang data

Ibaratnya, LLM adalah seorang penerjemah dan juru tulis yang berdiri di antara Anda dan sebuah gudang raksasa berisi jutaan berkas. Anda tidak perlu tahu di rak mana barang disimpan atau bahasa formal apa yang dipakai petugas gudang. Anda cukup berkata, dengan bahasa sehari-hari, "tolong ambilkan rekap penjualan sepatu bulan lalu." Sang penerjemah menyusun "surat perintah" resmi (kueri SQL) sesuai tata bahasa gudang, menyerahkannya ke petugas (Athena), dan petugas mengambil berkas dari rak (S3).

DARI PERTANYAAN KE GUDANG DATA Pengguna LLM (Bedrock)menyusun SQL Athenaeksekusi Data Lake (S3) Denah gudang = Glue Catalog (skema)
Analogi: Anda bertanya biasa; LLM jadi penerjemah yang menyusun surat perintah (SQL) ke gudang data.
Arsitektur

High-Level Architecture & Alur

04

High-Level Architecture (HLA)

Secara garis besar, arsitektur solusi analitik kontekstual ini terlihat seperti ini: aplikasi menerima pertanyaan pengguna, meneruskannya ke Bedrock bersama konteks skema dari Glue Data Catalog. Bedrock menghasilkan SQL, yang divalidasi guardrails, lalu dijalankan Athena ke data di S3. Hasil baris data dikembalikan ke Bedrock untuk dirangkai menjadi jawaban natural, dan semuanya terekam Observability.

Aplikasi/ Chat Bedrock (LLM)text-to-SQL Glue Catalog (skema) Athenaeksekusi SQL S3 Guardrails (SQL aman) Observability & biaya
HLA: pertanyaan → Bedrock (+ skema Glue) → SQL → guardrails → Athena → S3, hasil dirangkai jadi jawaban, terekam.

Alur kerja satu permintaan (text-to-SQL)

Ketika seseorang mengetik "berapa total penjualan wilayah Timur bulan lalu?", inilah yang terjadi di balik layar:

  1. Pahami maksud. LLM menangkap intent dan entitas ("wilayah Timur", "bulan lalu", "total penjualan").
  2. Ambil skema. Konteks tabel & kolom diambil dari Glue Data Catalog agar SQL merujuk nama yang benar.
  3. Susun SQL. LLM menghasilkan kueri SELECT yang sesuai (filter tanggal, agregasi SUM, dsb).
  4. Validasi (guardrails). Kueri diperiksa: hanya baca (SELECT), tanpa perintah destruktif, dengan batas biaya/scan.
  5. Eksekusi. Athena menjalankan kueri langsung ke data di S3.
  6. Rangkai jawaban. Hasil baris dikembalikan ke LLM untuk dijelaskan dalam kalimat + konteks; semua terekam untuk audit & biaya.
MaksudSkemaSusun SQLGuardrailAthena
Alur text-to-SQL: pahami maksud → ambil skema → susun SQL → guardrail → Athena → jawaban (semua terekam).
Contoh Penerapan

Dari Konsep ke Bisnis Nyata

05

Contoh nyata (konteks Indonesia)

Agar tidak berhenti di teori, berikut tiga skenario penerapan yang khas di Indonesia.

Contoh Penerapan · Self-service Analytics

Tim non-teknis bertanya sendiri

Tim pemasaran dan operasional sebuah retail sering menunggu antrean laporan dari tim data. Dengan solusi ini, mereka cukup bertanya di sebuah chat internal: "produk mana yang stoknya menipis di gudang Jawa Timur minggu ini?" LLM menyusun SQL, Guardrails memastikan hanya membaca, dan Athena menjawab dari data lake. Beban tim data berkurang, keputusan diambil lebih cepat, dan setiap kueri tetap terekam untuk kepatuhan.

Contoh Penerapan · Laporan Bisnis

Laporan bahasa natural untuk pimpinan

Seorang manajer regional ingin ringkasan performa tanpa membuka dasbor rumit. Ia bertanya, "bandingkan pendapatan kuartal ini dengan kuartal lalu per wilayah, dan jelaskan penyebab utamanya." Sistem tidak hanya mengembalikan angka: LLM merangkai narasi insight ("wilayah Timur naik 12%, terutama karena kategori elektronik"). Metadata yang rapi di Glue Catalog membuat perbandingan antar-periode akurat.

Contoh Penerapan · Eksplorasi Data Lake

Menjelajah data mentah dengan cepat

Tim data engineering menampung log dan berkas mentah dalam jumlah besar di S3. Alih-alih menulis kueri eksplorasi berulang, mereka bertanya bahasa natural untuk cepat memahami isi dataset baru: "kolom apa saja yang ada di tabel transaksi, dan berapa baris per hari minggu ini?" Guardrails membatasi jumlah data yang dipindai agar biaya tetap terkendali, sementara ambiguitas ("minggu ini") diklarifikasi lebih dulu bila perlu.

Mode Slide

Ringkasan Visual (Geser)

06

Ringkasan visual

Enam kartu berikut merangkum inti sesi. Gunakan tombol atau tombol panah keyboard (← →) untuk berpindah.

DEV203 · Slide 1

Bertanya ke data dengan bahasa manusia

Pengguna bertanya biasa → LLM menyusun SQL → Athena mengeksekusi ke data lake → hasil jadi insight.

1 / 6
DEV203 · Slide 2

Athena + Bedrock

Athena: kueri SQL serverless atas S3. Bedrock: kecerdasan bahasa untuk text-to-SQL & merangkai jawaban.

2 / 6
DEV203 · Slide 3

Skema adalah kuncinya

  • Glue Data Catalog = peta tabel/kolom
  • Deskripsi kolom yang baik = SQL akurat
  • Kurangi halusinasi nama kolom
3 / 6
DEV203 · Slide 4

Guardrails & ambiguitas

SQL hanya baca (SELECT), tanpa perintah destruktif. Pertanyaan ambigu diklarifikasi dulu.

4 / 6
DEV203 · Slide 5

Biaya = data yang dipindai

Athena menagih per data yang di-scan. Batasi scan, pakai partisi & format kolumnar agar hemat.

5 / 6
DEV203 · Slide 6

Bawa pulang

Buka data lake untuk tim non-teknis — dengan skema rapi, guardrails, dan kontrol biaya sejak awal.

6 / 6
Penutup

Poin yang Bisa Dibawa Pulang

07

Poin yang bisa dibawa pulang

Tentang Buku Ini
Sainskerta · Seri AWS Summit Jakarta 2026

Buku ini adalah rangkuman edukatif independen atas satu sesi AWS Summit Jakarta 2026, dibuat agar materi tetap bisa dipelajari oleh mereka yang tak sempat hadir. Bukan materi resmi AWS; seluruh nama produk & merek adalah milik pemiliknya masing-masing. Contoh penerapan bersifat ilustratif.

Bagian dari seri 61 sesi AWS Summit Jakarta 2026 — satu buku untuk tiap sesi.