Perayap situs web

Rayapi situs web Anda dan temukan halaman-halamannya

Hampir tidak ada orang yang tahu berapa banyak halaman yang benar-benar dimiliki situsnya. Halaman yatim tertinggal setelah migrasi, rangkaian bernomor berjalan lebih panjang daripada yang diingat siapa pun, satu bagian utuh duduk di balik tautan yang tidak pernah diperbarui. Perayap menjawabnya dengan menyusuri situs seperti mesin telusur menyusurinya — mulai dari satu alamat, ikuti apa yang ditemukan, dan catat semua yang dilihatnya.

Dari mana perayap menemukan halaman Anda

Lima sumber memberi makan antrean, dan setiap URL yang ditemukan mencatat sumber mana yang memunculkannya: alamat yang Anda kirimkan, sitemap XML (termasuk berkas indeks sitemap, diikuti sampai anak-anaknya), deklarasi robots.txt, navigasi dan footer situs, serta tautan biasa di dalam halaman yang sudah dibaca. Halaman yang bisa dijangkau lewat beberapa jalur itu adalah halaman yang tidak perlu dikhawatirkan siapa pun; halaman yang hanya muncul di sitemap dan tidak di mana pun lagi biasanya perlu.

Urutannya diputuskan, bukan kebetulan

Ketika sebuah situs memuat lebih banyak URL daripada yang diizinkan paket, halaman mana yang dibaca lebih penting daripada berapa banyak. Setiap URL diberi prioritas hanya dari fakta yang teramati — kedalamannya, tempat tautannya ditemukan, teks jangkarnya, berapa banyak halaman internal berbeda yang menunjuk padanya, dan apakah jalurnya menyerupai rangkaian bernomor. Hasilnya dapat diulang: situs yang sama, dirayapi dua kali, memilih halaman yang sama, dan alasan tiap pilihan bisa dinyatakan.

Setiap halaman yang tidak terbaca disebut, beserta alasannya

Ditemukan, diantre, diambil, dirender, dianalisis, diblokir, ditantang dan gagal dihitung terpisah, dan URL yang masih menunggu saat perayapan berhenti juga dihitung. Halaman yang ditolak robots.txt, tertahan di balik proses masuk, menjawab dengan tantangan anti-bot, kehabisan waktu atau dialihkan ke luar situs dicatat dengan alasan persisnya alih-alih diam-diam dibuang. Laporan perayapan yang hanya menampilkan apa yang berhasil sedang bercerita tentang situs yang berbeda dari situs Anda.

URL dibandingkan, bukan sekadar dikumpulkan

Parameter pelacakan dibuang sebelum dua alamat dibandingkan, sehingga satu halaman yang tiba dengan selusin tanda kampanye tetap satu halaman, bukan selusin. Subdomain dari domain terdaftar yang sama dihitung sebagai bagian situs, yang mencegah subdomain toko atau bahasa dikira milik orang lain. Skema, varian www, garis miring akhir dan huruf besar-kecil lalu dibandingkan di seluruh URL yang benar-benar diambil.

Perayap atau pemindai: mana yang Anda butuhkan

Perayap menjawab sampai mana situs ini bisa disusuri, dan seberapa banyak yang berhasil dijangkau. Pemindai menjawab dari apa situs ini tersusun — sumber daya, gambar, cookie, pelacak dan teknologi yang ditarik halamannya. Yang satu memetakan wilayahnya, yang lain mendaftar apa yang berdiri di atasnya. Kebanyakan orang yang tiba di sini menginginkan gambaran utuh, dan akhirnya menjalankan keduanya, dalam urutan itu.

Apa yang dilaporkan perayapan tentang keterjangkauan

Masing-masing adalah pemeriksaan yang nyata, dan masing-masing berbicara tentang apakah halaman Anda bisa ditemukan dan dibaca sama sekali.

  • Koherensi navigasi

    Membandingkan navigasi setiap halaman yang dirayapi dan memeriksa bahwa halaman kunci tertaut dari sana.

  • Sitemap XML

    Sitemap XML dipublikasikan dan dapat dibaca.

  • robots.txt

    Berkas robots.txt dipublikasikan.

  • Peta situs HTML (untuk pengunjung)

    Mencari halaman peta situs yang dapat dibaca manusia. Ini BUKAN sitemap.xml, yang diaudit oleh pemeriksaan SEO.

  • Keterindeksan

    Halaman yang dianalisis tidak diblokir dari pengindeksan oleh meta tag robots.

  • Konsistensi URL

    Membandingkan skema, varian www, garis miring akhir, huruf besar-kecil dan parameter di seluruh URL yang benar-benar diambil.

  • Respons kesalahan

    Halaman yang dirayapi menjawab tanpa kesalahan server.

  • Cakupan pengukuran performa

    Seberapa banyak inventaris sumber daya yang benar-benar dapat diukur dalam anggaran pemindaian.

Perayapan menghormati robots.txt dan berhenti pada anggaran halaman paket Anda, jadi ia membaca bagian tertentu dari situs Anda alih-alih seluruhnya, dan menyebut bagian mana. Ia tidak pernah masuk ke akun, tidak pernah menyelesaikan CAPTCHA dan tidak pernah menyiasati perlindungan anti-bot: halaman yang memerlukan sesi nyata dilaporkan sebagai tidak dianalisis, beserta alasannya.

Jalankan pemindaian gratis

Masukkan alamat situs web Anda dan VeriFixScan langsung menganalisisnya. Tanpa akun, tanpa pemasangan, tidak ada yang perlu ditambahkan ke situs Anda.

Pertanyaan yang sering diajukan

Apa itu website crawler?
Program yang mulai dari satu alamat, membaca halamannya, mengikuti tautan dan entri sitemap yang ditemukannya, lalu mengulanginya. Begitulah mesin telusur menemukan isi sebuah situs, dan begitulah Anda tahu halaman mana saja yang benar-benar dapat dijangkau.
Bagaimana cara merayapi situs web saya sendiri?
Kirimkan alamat Anda dan perayapan dimulai dari sana. Tidak ada berkas yang perlu diunggah dan tidak ada yang perlu dipasang: halaman dibaca lewat HTTP persis seperti yang disajikan kepada orang lain.
Bisakah ia memindai semua halaman sebuah situs web?
Ia menemukan apa yang dapat dijangkau dari alamat awal Anda, sitemap Anda, robots.txt Anda dan navigasi Anda, dalam anggaran halaman paket Anda. Halaman yang tidak ditaut dari mana pun dan tidak ada di sitemap mana pun tidak dapat ditemukan perayap mana pun, termasuk milik kami — dan angka cakupan menyebut sejauh mana perayapan benar-benar sampai.
Apakah perayap mengikuti sitemap dan robots.txt?
Keduanya, dengan alasan yang berbeda. Sitemap dan deklarasi robots.txt dibaca sebagai sumber URL; aturan robots.txt kemudian dipatuhi, sehingga jalur yang dilarang dicatat sebagai diblokir alih-alih diambil.
Apakah ia merayapi subdomain?
Subdomain dari domain terdaftar yang sama diperlakukan sebagai bagian situs Anda, jadi subdomain toko atau bahasa tetap diikuti alih-alih dibuang sebagai eksternal. Domain yang tidak berkaitan tidak pernah dirayapi.
Apakah ia merayapi situs milik orang lain?
Ia merayapi alamat yang Anda kirimkan. Tautan yang menunjuk ke domain lain diverifikasi sebagai tautan, sehingga yang mati tetap dilaporkan, tetapi halamannya tidak dirayapi dan tidak dianalisis.
Apa yang terjadi ketika sebuah halaman tidak dapat dibaca?
Perayapan langsung melanjutkan dan mencatat alasannya: dilarang robots, perlu masuk, perlindungan anti-bot, sebuah 403, sebuah 429, waktu habis, kesalahan jaringan atau pengalihan ke luar situs. Sisa analisisnya diselesaikan dan dilaporkan dengan halaman-halaman itu tercantum.
Apa bedanya merayapi dan memindai?
Merayapi menemukan dan menjangkau halaman; memindai mendaftar isi halaman-halaman itu. Halaman ini membahas yang pertama, halaman pemindai situs web membahas yang kedua, dan audit penuh menjalankan keduanya atas perayapan yang sama.
Bisakah saya merayapi situs web saya secara gratis?
Pemindaian gratis merayapi sebagian situs Anda tanpa akun. Anggaran halaman yang lebih besar, dan karenanya perayapan yang lebih dalam, hadir bersama paket berlangganan.

Baca juga

Halaman ini dalam bahasa lain