Bu proje, Siber Tehdit İstihbaratı (CTI) süreçlerinde "Keşif" (Reconnaissance) aşamasını otomatize etmek amacıyla geliştirilmiş bir web kazıma (scraping) aracıdır.
Program, hedef web sitelerinden statik verileri (HTML, Linkler) ve dinamik görüntüleri (Ekran Görüntüsü) toplayarak istihbarat analizi için hazır hale getirir.
Bu araç, standart bir HTML parser olmanın ötesinde, modern web siteleriyle başa çıkabilmek için hibrit bir mimariye sahiptir:
- Hibrit Motor: Hızlı veri çekmek için
Colly, dinamik (JS) içerikleri görüntülemek içinChromedp(Headless Chrome) kullanır. - Bot Koruması Aşma: HTTP başlıklarında (User-Agent Spoofing) kendini gerçek bir tarayıcı gibi tanıtarak Amazon, Wikipedia gibi sitelerdeki engelleri aşar.
- Dinamik İçerik Desteği: JavaScript ile sonradan yüklenen içerikleri (React, Vue vb.) bekleyerek tam sayfa ekran görüntüsü alır.
- CLI Yönetimi: Komut satırı üzerinden hedef odaklı (
-url) tarama yapar. - Modern Kod Yapısı: Dosya işlemleri için güncel
oskütüphanesini kullanır.
Projeyi bilgisayarınıza indirmek ve çalıştırmak için aşağıdaki adımları izleyin:
-
Depoyu Klonlayın:
git clone https://github.com/Umutsezeer/Scraper.git cd Scraper -
Gerekli Kütüphaneleri Yükleyin:
go mod tidy
Programı çalıştırmak için terminalden hedef adresi -url parametresi ile belirtmeniz yeterlidir.
Örnek Çalıştırma:
go run scraper.go -url https://www.amazon.com.tr
## 📂 Test Verileri ve Kanıtlar
Proje kapsamında test edilen 15 adet web sitesine ait tarama sonuçları `scraped_data` klasörü altına yüklenmiştir.
Her klasörün içinde şunlar bulunur:
1. **screenshot.png:** Sitenin çalışır haldeki ekran görüntüsü (Kanıt).
2. **output.html:** Sitenin kaynak kodları.
3. **links.txt:** Siteden ayıklanan link listesi.