-
Re: Zoekmachines
Jaap van Wingerde in nl.internet.www.server-side (Wed, 28 Apr 2004
23:31:02 +0200):
>On Wed, 28 Apr 2004 16:11:44 -0500, John Bokma
><postmaster@castleamber.com> wrote in nl.internet.www.server-side in
>message <40901e11$0$190$58c7af7e@news.kabelfoon.nl> with the subject:
>Re: Zoekmachines:
>
>>Waarom drukt Google ze dan vet groen af? Google herkend dus wel degelijk
>>sri lanka in srilanka... Zo ingewikkeld is dat niet.
>
>Verdomd, je hebt gelijk. Ik weet bijna zeker dat Google dat kunstje
>een tijd geleden nog niet kon.
Het komt door de nieuwe opmaak van Google, waardoor de zoektermen ook in
een URL vet worden gedrukt. Inhoudelijk is er niets veranderd: Google
heeft nog steeds geen weet van srilanka als 1 woord. En evenmin
indexeert Google de woorden in een URL. Het is puur presentatie.
Jan
--
Look, Ma. No tables - http://enbio.steenbergen-stichting.nl/
-
Re: Zoekmachines
Jan Ehrhardt wrote:
> John Bokma in nl.internet.www.server-side (Wed, 28 Apr 2004 16:21:16
> -0500):
>
>
>>Jan Ehrhardt wrote:
>>
>>
>>>John Bokma in nl.internet.www.server-side (Wed, 28 Apr 2004 14:53:12
>>>-0500):
>>>
>>>
>>>>Geruchten die je leest zijn, geen (session) id achtige constructies,
>>>>niet meer dan 2 variabelen in je URI, URI niet te lang.
>>>
>>>Niet meer dan 2 variabelen heb ik nooit gemerkt. Kijk maar eens naar
>>>http://www.google.com/search?q=site:...eaker-threaded
>>
>>Wellicht wordt er naam=waarde&naam=waarde&naam=waarde bedoelt^Hd.
>
> Dan is het dus makkelijk te omzeilen.
Dat is in deze draad al meer dan eens genoemd. Niets let je om met
mod_rewrite fotos/vakanties/1999/srilanka/strand/schelpjes om te
schrijven, intern, naar search?q=goebagoeba.
>>>Jan - die nog steeds probeert die resultaten uit Google te halen
>>
>>Heb je al geprobeerd met robots.txt?
>>
>>User-Agent: *
>>Disallow: /speaker-threaded.cgi?
>
> Ik wil wel dat Google 'follow't.
Yup, ik begrijp uit onder dat je:
http://cgi.monitor.nl/speaker-threaded.cgi?&704&693&702
omzet in een moved permanent naar:
http://cgi.monitor.nl/speaker-thread...04&693&702#693
? ([R=301,L])
>>Wat wellicht ook werkt is met mod_rewrite de googlebot een 404 of F
>>geven op de speaker-threaded requests.
>
> Iets dergelijks doe ik. Google krijgt een 301 naar een pagina die wel
> indexeerbaar is. Maar dat helpt dus niet.
Heel maf. Redirect je specifiek Google of alle bezoekers (ik zie nl een
link waar ik op kan klikken, en vermoed het eerste), en zie je in je
access_log dat googlebot geredirect wordt?
--
John MexIT: http://johnbokma.com/mexit/
personal page: http://johnbokma.com/
Experienced Perl programmer available: http://castleamber.com/
-
Re: Zoekmachines
Jaap van Wingerde wrote:
> On Wed, 28 Apr 2004 16:11:44 -0500, John Bokma
> <postmaster@castleamber.com> wrote in nl.internet.www.server-side in
> message <40901e11$0$190$58c7af7e@news.kabelfoon.nl> with the subject:
> Re: Zoekmachines:
>
>>Waarom drukt Google ze dan vet groen af? Google herkend dus wel degelijk
>>sri lanka in srilanka... Zo ingewikkeld is dat niet.
>
> Verdomd, je hebt gelijk. Ik weet bijna zeker dat Google dat kunstje
> een tijd geleden nog niet kon.
Het visueel weergeven zit er IIRC inderdaad pas in.
>>>Zo'n site kan er dus
>>>beter sri-lanka.org van maken, of een pagina maken die
>>>www.srilanka.org/sri_lanka.php heet.
>>
>>Kan je vermoeden dit bewijzen, of harder maken?
>
> Ik heb het ergens gelezen in een artikel over optimalisatie. Ik merk
> het aan de ranking van door mij gemaakte pagina's. Het lijkt me heel
> aannemelijk.
Mij niet, zeker niet omdat Google het sinds kort (IIRC, zie boven)
weergeeft, wat mij het gevoel geeft dat er iets gewijzigd is.
--
John MexIT: http://johnbokma.com/mexit/
personal page: http://johnbokma.com/
Experienced Perl programmer available: http://castleamber.com/
-
Re: Zoekmachines
Jan Ehrhardt wrote:
> John Bokma in nl.internet.www.server-side (Wed, 28 Apr 2004 16:26:05
> -0500):
>
>
>>>>>Google ruikt niet dat dat twee aan elkaar geplakte woorden zijn.
>>
>><br><font color="#008000">www.<b>sri</b><b>lanka</b>n.lk/ - 72k - 26
>
> Google ruikt het dus niet.
>
>>http://www.google.com/search?q=sri+lanka
>>
>>Ik zie duidelijk srilanka vet in www.srilankan.lk/ - 72k - 26 Apr ...
>
> Nee, je ziet sri vet en lanka vet.
Ja, en? Dus Google "ziet" sri en lanka in srilanka. Waarschijnlijk is
het vetmaakalgoritme lui geschreven, en is hetzelfde algortime gebruikt om
*sri*lalala*lanka*
lan*lanka*
*sri**lanka*
*sri*-*lanka*
te doen.
Dus als je sri spatie lanka invult, geeft google srilanka vet weer. En
dat doet google door sri en lanka los vet te maken. Lijkt mij eerder een
algoritme keuze dan wat anders.
Zoniet, snap ik totaal niet wat je bedoelt.
--
John MexIT: http://johnbokma.com/mexit/
personal page: http://johnbokma.com/
Experienced Perl programmer available: http://castleamber.com/
-
Re: Zoekmachines
John Bokma in nl.internet.www.server-side (Wed, 28 Apr 2004 17:04:22
-0500):
>Jan Ehrhardt wrote:
>
>> John Bokma in nl.internet.www.server-side (Wed, 28 Apr 2004 16:21:16
>> -0500):
>>
>>>Wat wellicht ook werkt is met mod_rewrite de googlebot een 404 of F
>>>geven op de speaker-threaded requests.
>>
>> Iets dergelijks doe ik. Google krijgt een 301 naar een pagina die wel
>> indexeerbaar is. Maar dat helpt dus niet.
>
>Heel maf. Redirect je specifiek Google of alle bezoekers (ik zie nl een
>link waar ik op kan klikken, en vermoed het eerste), en zie je in je
>access_log dat googlebot geredirect wordt?
http://cgi.monitor.nl/speaker-threaded.cgi?&704&693&702 wordt voor
Google geredirect naar http://cgi.monitor.nl/s_704_693_702_.htm en dat
is (wederom voor Google) is een NOINDEX frameset met
http://cgi.monitor.nl/s_704_.htm
http://cgi.monitor.nl/s_693_.htm
http://cgi.monitor.nl/s_702_.htm
Je kunt het ook met Opera/4 proberen, want daar werkt het ook zo.
Bij mijn access_log kan ik helaas niet, maar die speaker-threaded URL's
staan al maaaaanden te wachten op verwijdering bij Google. Ik zal er
eens een trace op zetten om te zien of Google wel eens langskomt.
Jan
--
Look, Ma. No tables - http://enbio.steenbergen-stichting.nl/
-
Re: Zoekmachines
-
Re: Zoekmachines
Jan Ehrhardt in nl.internet.www.server-side (Thu, 29 Apr 2004 01:50:33
+0200):
>Bij mijn access_log kan ik helaas niet, maar die speaker-threaded URL's
>staan al maaaaanden te wachten op verwijdering bij Google. Ik zal er
>eens een trace op zetten om te zien of Google wel eens langskomt.
Tuut, tuut, dat is snel. 49 seconden nadat ik die trace zelf getest had
kwam de Googlebot al langs:
| Thu Apr 29 02:25:16 2004 - z_704_693_702_.htm - Opera/4.02
| Thu Apr 29 02:26:05 2004 - z_703_703A1_703A1A1_706_705A1A1_700A1A1_.htm - Googlebot/2.1
| Thu Apr 29 02:26:07 2004 - z_703_703A1_703A1A1_695A2A1A1_705A4_.htm - Googlebot/2.1
| Thu Apr 29 02:26:09 2004 - z_704_699_692A1A1A2_737A1_.htm - Googlebot/2.1
| Thu Apr 29 02:27:05 2004 - z_698_696A2_749_.htm - Googlebot/2.1
| Thu Apr 29 02:27:06 2004 - z_698_698A1_736_752A1_.htm - Googlebot/2.1
Kortom, Google komt wel langs. Maar desondanks neemt het aantal hits op
http://www.google.com/search?q=site:...eaker-threaded maar
zeer langzaam af.
Jan
--
Look, Ma. No tables - http://enbio.steenbergen-stichting.nl/
-
Re: Zoekmachines
Jan Ehrhardt wrote:
> John Bokma in nl.internet.www.server-side (Wed, 28 Apr 2004 14:53:12
> -0500):
>
>
>>Geruchten die je leest zijn, geen (session) id achtige constructies,
>>niet meer dan 2 variabelen in je URI, URI niet te lang.
>
>
> Niet meer dan 2 variabelen heb ik nooit gemerkt. Kijk maar eens naar
> http://www.google.com/search?q=site:...eaker-threaded
>
> Jan - die nog steeds probeert die resultaten uit Google te halen
Een url met & maar zonder = ziet Google niet als dynamisch.
--
Michiel de Roo.
Online concert agenda voor de stad Utrecht:
http://www.utrecht-live.nl
-
Re: Zoekmachines
Daniel Tryba wrote:
> John Bokma <postmaster@castleamber.com> wrote:
>
>>[ dingen die niet werken zoals gedocumenteerd ]
>>
>>
>>>Klopt. En soms is het helaas mogelijk. Je kan of een feature vermijden,
>>>of er om heen hacken en scherp blijven.
>>
>>Dat moet onmogelijk zijn, natuurlijk :-D.
>
>
> Mijn werkgever stelt het helemaal niet op prijs dat ik om fouten van
> externe partijen heen ga hacken, immers heb je op dat moment 2
> problemen:
> -je moet je eigen werknemers tijd laten besteden aan het oplossen van
> het probleem (kost geld)
> -de externe partij heeft slecht werk geleverd en dus niet de afgesproken
> waar het geld.
En, als de externe parij zijn bug repareert, heb jij er mogelijk weer een
bug bij. Maar als de externe partij niet repareert, zul jij toch aan je
klant moeten antwoorden waarom het niet goed werkt. Als je dan de externe
partij de schuld geeft, komt dat op zo'n klant ook niet echt geod over.
>
> Bij deze beschrijving komen enkele goed Dilberts in mijn gedachten op.
>
--
Michiel de Roo.
Online concert agenda voor de stad Utrecht:
http://www.utrecht-live.nl
-
Re: Zoekmachines
John Bokma <postmaster@castleamber.com>, you wrote on Wed, 28 Apr 2004
14:53:12 -0500:
>Roland van Ipenburg wrote:
>> On Wed, 28 Apr 2004 10:08:30 +0000 (UTC), robert <{n.i.w.s}@allyourbass.org.invalid> mentioned:
>> [knip]
>>
>>>Het ging erover hoe Google dynamische pagina's kan herkennen, niet over hoe
>>>Google er mee omgaat.
>>
>> Wat is dan jouw definitie van "dynamische pagina"? En
>> wanneer je niet weet hoe Google er mee omgaat, hoe kan je
>> dan weten of Google het herkent?
>
>Ik vrees dat elke definitie mank loopt :-D.
>
>* Een cronjob die elke dag de pagina aanmaakt
>* Een pagina die 3x per dag aangepast wordt door de gebruiker (lokaal +
> upload)
>* Een pagina die aangemaakt wordt, als die niet bestaat, on the fly
>* Een pagina die telkens opnieuw aangemaakt wordt bij elke request, maar
> weken gelijk blijft op bitnivo.
>
>Google lijkt iets te hanteren als: als de URL er dynamisch uitziet, is
>het dynamisch. Een ding dat tegen Google spreekt, is dat er geen
>duidelijke specs voor zijn (ik kan ze niet 1,2,3 vinden op de Google site).
>
>Geruchten die je leest zijn, geen (session) id achtige constructies,
>niet meer dan 2 variabelen in je URI, URI niet te lang.
De twee kampen in deze draad zijn als vanouds zij die de regel
afwijzen en zij die de heuristiek afwijzen.
Inderdaad, het is onmogelijk voor Google om te zien of een bestand al
dan niet dynamisch is gegenereerd.
Maar: Google is een bedrijf. De bottom-line van Google is dat er winst
moet worden gemaakt, en dan is het weinig zinvol om te luisteren naar
lieden die vanuit hun ivoren toren zwaaien met de bewijzen dat iets
onmogelijk is.
Google heeft daarom twee problemen:
1. Als Google dynamisch gegenereerde pagina's zou volgen, dan kan
Google simpelweg in een niet-ontsnapbare lus terechtkomen. (Rene had
daar een duur woord voor dat ik even vergeten ben.)
2. Als Google wil uitsluiten dynamische pagina's te indexeren, dan kan
Google geen enkele pagina meer spideren, want de regel zegt dat Google
niet kan zien of een pagina statisch of dynamisch is.
Wat Google dus nodig heeft is natte-vingerwerk (met een duur woord:
heuristiek). Als Google de laatste jaren wel iets heeft bewezen (en
Google hoeft echt niet meer iets te bewijzen), dan is het wel dat het
een olympisch kampioen natte-vingerwerk is.
De heuristiek die John aandraagt is voor zover ik kan beoordelen een
redelijke. Misschien dat er binnen de tekst van het document ook nog
hints te vinden zijn die de keuze voor Google makkelijker maken.
--
branko collin
- dr: "have you been exposed to any user interfaces designed by engineers?"
- woman: "yes"
- dr: "you have interface poisoning. you'll be dead within a week" (scott adams, dilbert)
-
Re: Zoekmachines
Branko Collin wrote:
> Google heeft daarom twee problemen:
>
> 1. Als Google dynamisch gegenereerde pagina's zou volgen, dan kan
> Google simpelweg in een niet-ontsnapbare lus terechtkomen. (Rene had
> daar een duur woord voor dat ik even vergeten ben.)
Je bedoelt dat je op pagina infiniteloop?id=n naar infiniteloop?id=n+1
verwijst met n een geheel getal? Er is vast een bovengrens aan URL
lengte. Gisteren nog meer gelezen, en het lijkt ook alsof Google erg
lange URLs niet prettig vind. Verder zal er vast een bovengrens zitten
aan het aantal pagina's maximaal per site, want een infinite loop is
anders ook te maken door
http://inifinite.loop.is.invalid/a/b/c/d/e/......../
met a,b,c enz tellers die lopen van zeg 0 tot 10,000,000
Voor de vulling had ik in gedachte: trek postings uit high traffic
groepen, en plaats per pagina 1 posting. Dit soort vervelende grappen
worden al uitgehaald.
--
John MexIT: http://johnbokma.com/mexit/
personal page: http://johnbokma.com/
Experienced Perl programmer available: http://castleamber.com/