AI Crawler: Mengizinkan atau Memblokir GPTBot dan ClaudeBot
Dyaksa Naya
6 Agustus 2026
AI crawler adalah program yang merayapi situs untuk kepentingan sistem kecerdasan buatan — entah untuk melatih model, atau untuk mengambil sumber saat menjawab pertanyaan pengguna.
Keputusan mengizinkan atau memblokirnya sering diambil terburu-buru, biasanya karena kekhawatiran konten dipakai tanpa imbalan. Masalahnya, crawler-crawler ini tidak mengerjakan hal yang sama, dan memblokir semuanya sekaligus sering menutup hal yang justru diinginkan.
Dua Jenis yang Perlu Dibedakan
Crawler pelatihan mengambil konten untuk dipakai melatih model. Konten yang diambil tidak dikaitkan kembali ke situs asalnya saat model menjawab.
Crawler pencarian mengambil konten saat ada pengguna bertanya, lalu menampilkan jawaban beserta tautan ke sumbernya. Ini yang mendatangkan kunjungan dan menampilkan nama situs.
Perbedaan ini menentukan segalanya. Memblokir crawler pelatihan berarti menolak konten dipakai melatih model. Memblokir crawler pencarian berarti menghilang dari jawaban yang menampilkan sumber — termasuk kehilangan tautan yang bisa diklik orang.
Beberapa penyedia memisahkan keduanya menjadi crawler dengan nama berbeda, sehingga bisa dipilih salah satu. Sebagian lagi belum memisahkannya.
Yang Perlu Diketahui Sebelum Memblokir
Ada satu hal yang sering disalahpahami dan berakibat mahal:
Pengaturan yang mengendalikan penggunaan konten untuk model AI tidak selalu sama dengan yang mengendalikan kemunculan di hasil pencarian.
Pada ekosistem Google, misalnya, ada pengaturan terpisah untuk penggunaan konten pada produk AI-nya. Tetapi blok jawaban yang muncul di halaman hasil pencarian mengambil sumber lewat perayapan pencarian biasa. Artinya menolak yang pertama tidak mengeluarkan situs dari blok jawaban itu — satu-satunya cara keluar dari sana adalah keluar dari indeks pencarian sama sekali, dan itu berarti kehilangan seluruh trafik organik.
Kesimpulannya: kalau tujuannya menghindari jawaban AI Google tanpa kehilangan pencarian, tidak ada pengaturan yang menyediakan itu. Cara kerja blok jawabannya dibahas di artikel tentang AI Overview.
Cara Mengatur
Pengaturannya lewat robots.txt di akar situs, dengan menyebut nama agen crawler yang ingin diatur. Nama-nama agen ini berubah dan bertambah, jadi daftar mana pun perlu diperiksa ulang ke dokumentasi resmi tiap penyedia sebelum dipakai — menyalin daftar dari artikel lama adalah cara paling umum salah pasang.
Beberapa hal teknis yang perlu diperhatikan:
Aturan robots.txt bersifat sukarela. Crawler besar dari penyedia yang dikenal umumnya mematuhinya. Crawler yang tidak menyatakan identitasnya tidak bisa dikendalikan dengan cara ini — untuk itu diperlukan pembatasan di tingkat server atau layanan CDN.
Memblokir crawler tidak menghapus data yang sudah diambil sebelumnya.
Salah menulis nama agen membuat aturannya tidak berlaku sama sekali, tanpa peringatan apa pun. Setelah mengubah robots.txt, isinya perlu diperiksa langsung dengan membuka berkasnya.
Cara Memutuskan
Pertanyaannya bukan “aman atau tidak”, tapi konten kita ini apa.
Untuk sebagian besar bisnis jasa dan lokal: izinkan. Situs jasa hidup dari ditemukan. Muncul sebagai sumber di jawaban AI menampilkan nama bisnis kepada orang yang sedang mempertimbangkan, dan sebagian di antaranya berlanjut ke kunjungan. Memblokir berarti membayar biaya nyata untuk melindungi sesuatu yang bukan aset utama.
Untuk penerbit yang produknya konten itu sendiri: pertimbangkan pemisahan. Menolak crawler pelatihan sambil mengizinkan crawler pencarian adalah posisi tengah yang masuk akal bagi media dan pemilik arsip besar.
Untuk konten berbayar atau di balik pendaftaran: yang menentukan bukan robots.txt, melainkan kontrol akses. Konten yang butuh login memang tidak terambil crawler mana pun.
Untuk dokumentasi dan referensi teknis: izinkan. Justru jenis konten inilah yang paling sering dikutip beserta sumbernya.
Yang Sering Keliru Dilakukan
Memblokir semuanya karena panik. Ini menutup jalur kunjungan tanpa memberi perlindungan yang berarti, karena data lama tetap ada dan crawler yang tidak jujur tetap lewat.
Menyalin daftar agen dari artikel lama. Nama agen berubah; daftar yang usang menghasilkan aturan yang tidak berlaku.
Mengira ada mekanisme penggantian otomatis. Tidak ada sistem imbalan bawaan untuk konten yang dipakai model.
Mengira llms.txt mengatur akses. Berkas itu tidak mengatur izin apa pun, dan statusnya sendiri masih usulan — dibahas di artikel tentang llms.txt.
Setelah Diputuskan, Ukur
Kalau memilih mengizinkan, kunjungan yang datang dari mesin AI bisa dipisahkan di laporan analitik berdasarkan sumber rujukannya. Caranya dibahas di artikel tentang trafik dari ChatGPT dan Perplexity.
Tanpa memisahkannya, tidak ada dasar untuk menilai apakah keputusan mengizinkan itu menguntungkan atau tidak — dan keputusan yang tidak diukur akan diulang berdasarkan perasaan.
Urutan pengerjaan selengkapnya ada di panduan AI search.
Artikel Terkait
AEO, GEO, dan SEO: Apa yang Benar-Benar Berbeda
Tiga istilah yang sering dijual sebagai disiplin terpisah, padahal sebagian besar pekerjaannya bertumpuk. Pahami apa yang benar-benar berbeda, apa yang sama, dan cara menilai penawaran jasa yang memakai istilah ini.
Dyaksa Naya
6 Agustus 2026
AI Overview: Cara Kerja dan Dari Mana Sumbernya Diambil
AI Overview menyusun jawaban dari beberapa halaman sekaligus, bukan menampilkan satu pemenang. Pahami cara kerjanya, apa yang menentukan halaman mana yang diambil, dan apa yang berubah untuk pemilik situs.
Dyaksa Naya
6 Agustus 2026
Entity dan Knowledge Graph: Kenapa Mesin Perlu Tahu Kita Ini Apa
Mesin menyimpan bisnis sebagai entitas yang saling terhubung, bukan sebagai kumpulan kata kunci. Pahami syarat sebuah entitas dikenali, kenapa menyebut nama berpengaruh dan menyebut sifat tidak, dan urutan membangunnya.
Dyaksa Naya
6 Agustus 2026