ai-search

AI Crawler: Mengizinkan atau Memblokir GPTBot dan ClaudeBot

DN

Dyaksa Naya

6 Agustus 2026

6 min read
#ai search #robots txt #crawler

AI crawler adalah program yang merayapi situs untuk kepentingan sistem kecerdasan buatan — entah untuk melatih model, atau untuk mengambil sumber saat menjawab pertanyaan pengguna.

Keputusan mengizinkan atau memblokirnya sering diambil terburu-buru, biasanya karena kekhawatiran konten dipakai tanpa imbalan. Masalahnya, crawler-crawler ini tidak mengerjakan hal yang sama, dan memblokir semuanya sekaligus sering menutup hal yang justru diinginkan.

Dua Jenis yang Perlu Dibedakan

Crawler pelatihan mengambil konten untuk dipakai melatih model. Konten yang diambil tidak dikaitkan kembali ke situs asalnya saat model menjawab.

Crawler pencarian mengambil konten saat ada pengguna bertanya, lalu menampilkan jawaban beserta tautan ke sumbernya. Ini yang mendatangkan kunjungan dan menampilkan nama situs.

Perbedaan ini menentukan segalanya. Memblokir crawler pelatihan berarti menolak konten dipakai melatih model. Memblokir crawler pencarian berarti menghilang dari jawaban yang menampilkan sumber — termasuk kehilangan tautan yang bisa diklik orang.

Beberapa penyedia memisahkan keduanya menjadi crawler dengan nama berbeda, sehingga bisa dipilih salah satu. Sebagian lagi belum memisahkannya.

Yang Perlu Diketahui Sebelum Memblokir

Ada satu hal yang sering disalahpahami dan berakibat mahal:

Pengaturan yang mengendalikan penggunaan konten untuk model AI tidak selalu sama dengan yang mengendalikan kemunculan di hasil pencarian.

Pada ekosistem Google, misalnya, ada pengaturan terpisah untuk penggunaan konten pada produk AI-nya. Tetapi blok jawaban yang muncul di halaman hasil pencarian mengambil sumber lewat perayapan pencarian biasa. Artinya menolak yang pertama tidak mengeluarkan situs dari blok jawaban itu — satu-satunya cara keluar dari sana adalah keluar dari indeks pencarian sama sekali, dan itu berarti kehilangan seluruh trafik organik.

Kesimpulannya: kalau tujuannya menghindari jawaban AI Google tanpa kehilangan pencarian, tidak ada pengaturan yang menyediakan itu. Cara kerja blok jawabannya dibahas di artikel tentang AI Overview.

Cara Mengatur

Pengaturannya lewat robots.txt di akar situs, dengan menyebut nama agen crawler yang ingin diatur. Nama-nama agen ini berubah dan bertambah, jadi daftar mana pun perlu diperiksa ulang ke dokumentasi resmi tiap penyedia sebelum dipakai — menyalin daftar dari artikel lama adalah cara paling umum salah pasang.

Beberapa hal teknis yang perlu diperhatikan:

Aturan robots.txt bersifat sukarela. Crawler besar dari penyedia yang dikenal umumnya mematuhinya. Crawler yang tidak menyatakan identitasnya tidak bisa dikendalikan dengan cara ini — untuk itu diperlukan pembatasan di tingkat server atau layanan CDN.

Memblokir crawler tidak menghapus data yang sudah diambil sebelumnya.

Salah menulis nama agen membuat aturannya tidak berlaku sama sekali, tanpa peringatan apa pun. Setelah mengubah robots.txt, isinya perlu diperiksa langsung dengan membuka berkasnya.

Cara Memutuskan

Pertanyaannya bukan “aman atau tidak”, tapi konten kita ini apa.

Untuk sebagian besar bisnis jasa dan lokal: izinkan. Situs jasa hidup dari ditemukan. Muncul sebagai sumber di jawaban AI menampilkan nama bisnis kepada orang yang sedang mempertimbangkan, dan sebagian di antaranya berlanjut ke kunjungan. Memblokir berarti membayar biaya nyata untuk melindungi sesuatu yang bukan aset utama.

Untuk penerbit yang produknya konten itu sendiri: pertimbangkan pemisahan. Menolak crawler pelatihan sambil mengizinkan crawler pencarian adalah posisi tengah yang masuk akal bagi media dan pemilik arsip besar.

Untuk konten berbayar atau di balik pendaftaran: yang menentukan bukan robots.txt, melainkan kontrol akses. Konten yang butuh login memang tidak terambil crawler mana pun.

Untuk dokumentasi dan referensi teknis: izinkan. Justru jenis konten inilah yang paling sering dikutip beserta sumbernya.

Yang Sering Keliru Dilakukan

Memblokir semuanya karena panik. Ini menutup jalur kunjungan tanpa memberi perlindungan yang berarti, karena data lama tetap ada dan crawler yang tidak jujur tetap lewat.

Menyalin daftar agen dari artikel lama. Nama agen berubah; daftar yang usang menghasilkan aturan yang tidak berlaku.

Mengira ada mekanisme penggantian otomatis. Tidak ada sistem imbalan bawaan untuk konten yang dipakai model.

Mengira llms.txt mengatur akses. Berkas itu tidak mengatur izin apa pun, dan statusnya sendiri masih usulan — dibahas di artikel tentang llms.txt.

Setelah Diputuskan, Ukur

Kalau memilih mengizinkan, kunjungan yang datang dari mesin AI bisa dipisahkan di laporan analitik berdasarkan sumber rujukannya. Caranya dibahas di artikel tentang trafik dari ChatGPT dan Perplexity.

Tanpa memisahkannya, tidak ada dasar untuk menilai apakah keputusan mengizinkan itu menguntungkan atau tidak — dan keputusan yang tidak diukur akan diulang berdasarkan perasaan.

Urutan pengerjaan selengkapnya ada di panduan AI search.

Artikel Terkait

ai-search 6 min read

AEO, GEO, dan SEO: Apa yang Benar-Benar Berbeda

Tiga istilah yang sering dijual sebagai disiplin terpisah, padahal sebagian besar pekerjaannya bertumpuk. Pahami apa yang benar-benar berbeda, apa yang sama, dan cara menilai penawaran jasa yang memakai istilah ini.

#ai search #geo #aeo +1 more
DN

Dyaksa Naya

6 Agustus 2026

ai-search 6 min read

AI Overview: Cara Kerja dan Dari Mana Sumbernya Diambil

AI Overview menyusun jawaban dari beberapa halaman sekaligus, bukan menampilkan satu pemenang. Pahami cara kerjanya, apa yang menentukan halaman mana yang diambil, dan apa yang berubah untuk pemilik situs.

#ai search #ai overview #seo
DN

Dyaksa Naya

6 Agustus 2026

Bagikan Artikel

Butuh Bantuan SEO untuk Bisnis Kamu di Jogja?

Kami bantu bisnis di Yogyakarta muncul di halaman satu Google — dari audit teknis, optimasi Google Business Profile, sampai strategi konten lokal.