Publié le 23/07/2010
Auteur fobec
Réseaux sociaux
0 partages
0 tweets
0 plus
0 commentaires

Google, le moteur de recherche rappel a l'ordre

Chaque seconde, des milliers de requęte sont envoyés sur le moteur de recherche Google. On peut penser que quelques requętes de plus devrait passer inapercu. Ce n'est pas le cas, Google surveille de près l'activité sur son moteur de recherche et en bloque l'accès le cas échéant.

Comment passer pour un spammer aux yeux de Google

Dans le cadre du référencement du site fobec.com, je développe une application SEO en JAVA. Pour vérifier l'indexation du site, l'outil teste les URL du sitemap sur Google une à une avec une requęte de type
http://www.google.com/search?q=inurl:http://www.fobec.com/CMS/...

Au fil de la boucle, le temps de traitement d'une URL passe de 0,15 sec à 5 sec. Vérification faite, aucune fuite mémoire dans mon code, c'est bien le temps de réponse de Google qui est devenu plus long.

Google rappel à l'ordre

En saisissant l'URL manuellement dans le navigateur internet Mozilla, on obtient un début d'explication:
google_colere

"nous ne pouvons pas traiter votre requęte pour le moment. Un virus informatique ou un spyware (logiciel espion) nous envoie des requętes automatiques, et il semble que votre ordinateur ou votre réseau soit infecté."

L'interface classique du moteur s'affiche à nouveau après le test gotcha. Par contre, que ce soit en java ou que ce soit sous Mozilla, toutes les requętes de type inurl ont un délai de réponse de 5 secondes.
A priori, Google sanctionne l'IP et une série de mot clé pour une période donnée.

Conclusion

Si vous souhaitez Scraper Google, la première chose à faire est de ne pas se faire prendre par les filtres anti-bot du moteur de recherche. Lorsque votre adresse IP est détectée comme suspecte, il n'est pas facile de retrouver le comportement normal à vos requetes sur Google. A priori, la solutions consiste à utiliser plusieurs adresses IP et de varier au maximum les UserAgent, le type de requete et d'arreter les requetes à la première alerte.

Ajouter un commentaire

Les champs marqués d'un * sont obligatoires, les adresses emails se sont pas publiées.

A lire aussi

Réseaux sociaux
Présentation de l'article
Catégorie
tuto - webmaster
Mise a jour
23/07/2010
Visualisation
vu 2976 fois
Public
Internaute
Auteur de la publication
Fobec
Admin
Auteur de 267 articles
|BIO_PSEUDO|
Commentaires récents

Publié par Diégo DELPY dans CMS

IL FAUT IMPERATIVEMENT DONNER DES CHEMINS COMPLETS à pFrom et à pTo, sinon ça marche
bizzarrement.
Exemple :

// Chemin relatif : PAS BON !
pFrom := \'Bureau\\Tél...

Publié par Etiazam dans php5

Si je peux me permettre, il manque l'incrementation dans les deux boucles, telles qu'elles sont presentees elles font tourner le navigateur en rond, il faut donc ajouter
for ($x=0;$x<50;$x...

Publié par Fobec dans news

Bonjour,
la localisation des adresses ip utilise plusieurs algo de recherche de position geographique. La precision du rapport d'analyse correspond la qualite de la localisation:
9/10 la locali...

Publié par Mosard dans java

Bonsoir je voulais inclure un fichier txt dans mon programme cependant j'avais pas vraiment d'idee,mais j 'ai deja une idee je vais essayer. Merci beaucoup

Publié par Pierrot dans CMS

Je présume que c'est plutot application.terminate;, le clavier à fourcher, ça m'arrive souvent.
@+