AWS Summit Jakarta 2026 · Seri Sesi

Lebih dari Reaktif

Mengubah operasi cloud dari memadamkan kebakaran menjadi mencegahnya — bersama AWS DevOps Agent.
Kode SEC302Level 300 · LanjutanCloud Ops & AI
Edisi Pertama · 2026 · Bagian dari Seri 61 Sesi
Track · Cloud Operations & AI

Tentang Sesi Ini

01

Ringkasan & metadata

SEC30211:30 WIBFloor 4, Ballroom 3B & 3C Level 300 · LanjutanBahasa IndonesiaPembicara: Traveloka & AWS

Sesi ini mengangkat sebuah pergeseran cara berpikir yang besar dalam operasi cloud: dari reaktif menjadi proaktif. Selama ini, tim operasi (Ops/SRE) sering bekerja seperti pemadam kebakaran — menunggu alarm berbunyi, lalu bergegas memadamkan masalah yang sudah terlanjur mengganggu pengguna. Pola ini melelahkan, mahal, dan rapuh. Dengan AWS DevOps Agent, pendekatannya dibalik: masalah dideteksi dari sinyal-sinyal awal, didiagnosis otomatis, dan bila perlu diperbaiki sebelum pengguna sempat merasakannya.

AWS DevOps Agent adalah agen AI yang terus membaca telemetri sistem (metrik, log, jejak), mengenali anomali lebih dini, mengusulkan atau menjalankan remediasi, dan membantu analisis akar masalah (root-cause analysis). Ia menggabungkan kekuatan observability dengan penalaran model bahasa (LLM) sehingga bisa "memahami" konteks kejadian, bukan sekadar mencocokkan ambang batas. Yang membedakannya dari sekadar otomasi lama: ia bisa menghubungkan titik-titik lintas layanan dan menjelaskan temuannya dalam bahasa manusia.

Kenapa penting untuk Anda? Jika tim Anda kelelahan oleh alert fatigue — dibanjiri notifikasi tetapi tetap telat menemukan akar masalah — sesi ini menunjukkan bagaimana agen AI dapat memangkas kebisingan, mempercepat diagnosis, dan menurunkan MTTR (waktu rata-rata pemulihan).
Konteks Nyata · Traveloka

Traveloka lahir di Indonesia pada 2012 dan kini dikenal sebagai Online Travel Agent (OTA) terbesar di Asia Tenggara, beroperasi di tujuh negara (Indonesia, Malaysia, Singapura, Thailand, Vietnam, Filipina, dan Australia). Skalanya besar: aplikasinya telah diunduh hampir 140 juta kali dengan sekitar 50 juta pengguna aktif bulanan. Beban puncaknya melonjak tajam di musim liburan akhir tahun dan Ramadan, sehingga tim menempatkan observability (monitoring & logging) sebagai prioritas utama untuk mengantisipasi bottleneck sebelum lonjakan trafik. Secara publik, Traveloka menjalankan sebagian besar layanannya (banyak ditulis dalam Java) di atas Amazon EKS, memakai Amazon S3 dan AWS Glue untuk pipeline data, Amazon Personalize untuk rekomendasi, serta Amazon API Gateway dengan Backstage sebagai portal developer. Menariknya, beban analitik datanya justru dipublikasikan berjalan di Google Cloud — gudang data BigQuery menyimpan ~400 TB (±500 miliar baris) untuk deteksi fraud, personalisasi, dan pengambilan keputusan bisnis.

Sumber: Traveloka "About Us" (traveloka.com/about-us); Travel Voice — Traveloka sebagai OTA terbesar Asia Tenggara; AWS Blogs — "How Traveloka Uses AWS to Maintain Visibility Into its Systems" & "How Traveloka Uses Backstage as an API Developer Portal for Amazon API Gateway"; iTnews Asia — Amazon Personalize; Google Cloud Customers — Traveloka (BigQuery). Catatan jujur: tidak ada studi kasus publik tentang penerapan AWS DevOps Agent oleh Traveloka, dan detail arsitektur AWS sesi ini bersifat ilustratif serta tidak dipublikasikan resmi; sebagian beban kerja analitik Traveloka bahkan berjalan di Google Cloud, bukan AWS. Profil di atas disajikan sebagai relevansi umum tema operasi proaktif, bukan klaim spesifik atas arsitektur DevOps Agent Traveloka.

Konsep Inti

Dari Reaktif Menuju Proaktif

02

Dari reaktif ke proaktif

Operasi cloud tradisional bersifat reaktif: sistem berjalan sampai sesuatu rusak, dashboard memerah, alarm berbunyi, lalu manusia terbangun tengah malam untuk menyelidiki. Karena ambang batas (threshold) dibuat kaku, dua hal buruk sering terjadi bersamaan — terlalu banyak alarm palsu (menimbulkan alert fatigue) sekaligus alarm penting yang datang terlambat. Tim menghabiskan energi memadamkan gejala, bukan mencegah penyebab.

Pendekatan proaktif membalik urutannya. Alih-alih menunggu ambang batas terlampaui, agen mengamati pola: tren memori yang perlahan naik, latensi yang mulai menyimpang dari kebiasaannya, laju error yang bergerak tidak wajar. Sinyal-sinyal lemah ini dirangkai menjadi peringatan dini yang bermakna, jauh sebelum menjadi insiden. Tujuannya bukan menyingkirkan manusia, melainkan membebaskan manusia dari pekerjaan berulang agar fokus pada keputusan yang benar-benar butuh penilaian.

Bagaimana agen bekerja

AWS DevOps Agent memadukan dua kemampuan: observability (data metrik, log, dan jejak yang lengkap) sebagai "indera", serta LLM sebagai "otak" yang menalar. Alurnya bertumpu pada layanan-layanan AWS berikut:

AWS DevOps AgentOtak: deteksi, diagnosis, remediasi
CloudWatchMetrik, log & alarm
EventBridgeBus kejadian & pemicu
Systems ManagerEksekusi runbook & aksi
BedrockModel penalaran (LLM)
ObservabilityMetrik + log + trace terpadu

Kombinasinya: CloudWatch dan observability memasok data mentah; EventBridge menyalurkan kejadian ke agen; Bedrock memberi kemampuan menalar dan menjelaskan; dan Systems Manager menjadi "tangan" yang menjalankan tindakan perbaikan — semuanya diikat oleh guardrails agar aksi berisiko tetap butuh persetujuan manusia.

Perumpamaan

Analogi yang Mudah Dicerna

03

Dari pemadam yang telat ke detektor asap pintar

Ibaratnya, operasi cloud reaktif seperti petugas pemadam kebakaran yang selalu telat: mereka baru bergerak setelah api membesar dan bangunan sudah rusak. Mereka hebat memadamkan, tetapi kerugian sudah terjadi — pengguna terdampak, layanan sempat mati.

AWS DevOps Agent mengubahnya menjadi detektor asap pintar di setiap ruangan. Begitu ada percikan kecil atau bau asap tipis, ia langsung mengenali, memperkirakan dari mana asalnya, dan — untuk masalah yang aman ditangani sendiri — memadamkan percikan itu sebelum menjadi kebakaran. Untuk situasi berbahaya, ia tidak nekat: ia membunyikan peringatan yang jelas dan menunggu keputusan petugas. Intinya: masalah dicegah sebelum pengguna terdampak.

GEDUNG (Sistem Cloud) Detektor asap (DevOps Agent) Cium asap (deteksi) Telusuri sumber (RCA) Padamkan percikan Aman → tangani sendiri Bahaya → minta izin
Analogi: agen sebagai detektor asap pintar yang mencegah percikan menjadi kebakaran, dengan persetujuan manusia untuk aksi berisiko.
Arsitektur

High-Level Architecture & Alur

04

High-Level Architecture (HLA)

Secara garis besar, pipeline operasi proaktif di atas AWS DevOps Agent tersusun seperti ini: sistem produksi memancarkan telemetri ke CloudWatch dan lapisan Observability; sinyal & kejadian mengalir lewat EventBridge ke DevOps Agent; agen menalar dengan model di Bedrock; lalu — melalui Systems Manager dan setelah lolos guardrails/persetujuan — menjalankan remediasi kembali ke sistem.

SistemProduksi CloudWatch ObservabilityMetrik/Log/Trace EventBridge DevOps AgentDiagnosis + RCA Bedrock (LLM) Systems Manager Remediasi
HLA: sistem → CloudWatch/Observability → EventBridge → DevOps Agent (menalar via Bedrock) → Systems Manager → remediasi, dengan guardrails di jalur aksi.

Alur deteksi & remediasi

Ketika sebuah layanan mulai menunjukkan gejala tak sehat, inilah yang terjadi di balik layar:

  1. Amati. Agen terus membaca metrik, log, dan jejak dari CloudWatch & observability.
  2. Deteksi anomali. Pola menyimpang (latensi naik, error meningkat) dikenali lebih dini, bukan menunggu ambang batas keras.
  3. Diagnosis (RCA). Dengan bantuan Bedrock, agen menghubungkan sinyal lintas layanan untuk menemukan akar masalah dan menjelaskannya.
  4. Usulkan aksi. Agen menyiapkan remediasi (mis. restart, rollback, scale-out) via Systems Manager.
  5. Guardrails & persetujuan. Aksi aman dijalankan otomatis; aksi berisiko menunggu persetujuan manusia.
  6. Pulih & belajar. Sistem pulih, MTTR turun, dan tiap kejadian terekam untuk perbaikan berikutnya.
AmatiDeteksiDiagnosisUsul aksiPulih
Alur operasi proaktif: amati → deteksi anomali → diagnosis (RCA) → usul remediasi → pulih (semua terekam).
Contoh Penerapan

Dari Konsep ke Operasi Nyata

05

Contoh nyata

Agar tidak berhenti di teori, berikut tiga skenario penerapan yang mencerminkan pengalaman operasi cloud skala besar — termasuk konteks Traveloka sebagai platform travel/OTA.

Contoh Penerapan · OTA / Travel Skala Besar

Menjaga uptime saat musim ramai (Traveloka)

Sebagai platform Online Travel Agent, Traveloka menghadapi lonjakan trafik tajam saat musim liburan dan promo. AWS DevOps Agent memantau ribuan sinyal — latensi pencarian penerbangan, laju kegagalan pembayaran, antrean pemesanan hotel — dan mengenali gejala bottleneck lebih dini. Ketika satu layanan mulai melambat, agen dapat memicu scale-out lewat Systems Manager sebelum pengguna merasakan lambat, menjaga pengalaman pemesanan tetap mulus di puncak beban.

Contoh Penerapan · Keandalan

Self-healing & auto-remediation

Untuk masalah rutin yang berulang — instance yang macet, disk hampir penuh, service yang perlu di-restart — agen menjalankan runbook perbaikan secara otomatis dalam batas guardrails yang telah ditetapkan. Tim tak lagi terbangun tengah malam untuk tugas mekanis. Untuk tindakan berisiko (mis. rollback rilis besar), agen berhenti di titik persetujuan dan menyerahkan keputusan ke manusia — otomasi yang tahu kapan harus meminta izin.

Contoh Penerapan · Investigasi Insiden

Root-cause analysis yang lebih cepat

Saat insiden tetap terjadi, waktu paling banyak habis untuk mencari penyebab, bukan memperbaikinya. Agen mempercepat ini dengan merangkai korelasi lintas metrik, log, dan deployment terbaru, lalu menyajikan hipotesis akar masalah dalam bahasa yang mudah dipahami. Hasilnya: MTTR turun, laporan post-mortem lebih tajam, dan pola berulang bisa dicegah ke depan.

Mode Slide

Ringkasan Visual (Geser)

06

Ringkasan visual

Enam kartu berikut merangkum inti sesi. Gunakan tombol atau tombol panah keyboard (← →) untuk berpindah.

SEC302 · Slide 1

Masalahnya: operasi yang reaktif

Menunggu alarm lalu memadamkan itu melelahkan dan mahal — alert fatigue plus alarm penting yang datang terlambat.

1 / 6
SEC302 · Slide 2

AWS DevOps Agent = proaktif

Agen AI membaca telemetri, mendeteksi anomali dini, mengusulkan/menjalankan remediasi, dan membantu RCA.

2 / 6
SEC302 · Slide 3

Observability + LLM

  • CloudWatch & Observability = indera
  • Bedrock (LLM) = otak yang menalar
  • EventBridge & Systems Manager = saraf & tangan
3 / 6
SEC302 · Slide 4

Analogi detektor asap

Dari pemadam yang selalu telat, menjadi detektor asap pintar yang mencegah percikan jadi kebakaran.

4 / 6
SEC302 · Slide 5

Guardrails itu wajib

Aksi aman dijalankan otomatis; aksi berisiko menunggu persetujuan manusia. Otomasi yang tahu kapan minta izin.

5 / 6
SEC302 · Slide 6

Dampak: MTTR turun

Deteksi dini + diagnosis cepat + self-healing = keandalan naik. Pengalaman Traveloka di skala OTA.

6 / 6
Penutup

Poin yang Bisa Dibawa Pulang

07

Poin yang bisa dibawa pulang

Tentang Buku Ini
Sainskerta · Seri AWS Summit Jakarta 2026

Buku ini adalah rangkuman edukatif independen atas satu sesi AWS Summit Jakarta 2026, dibuat agar materi tetap bisa dipelajari oleh mereka yang tak sempat hadir. Bukan materi resmi AWS maupun Traveloka; seluruh nama produk & merek adalah milik pemiliknya masing-masing. Contoh penerapan bersifat ilustratif.

Bagian dari seri 61 sesi AWS Summit Jakarta 2026 — satu buku untuk tiap sesi.