Shaik Naseera / Tejasree Samakoti
Dieses Buch befasst sich mit der Extraktion von Daten aus dem Internet, d. h. aus Online-Datenbanken, mithilfe von Annotationen. Die Datenbanken sind über eine HTML-basierte Benutzeroberfläche im Internet zugänglich. Wenn eine Suchanfrage an die Suchmaschine gestellt wird, können daraus Informationen extrahiert werden. Ergebnisseiten, die von den Online-Datenbanken zurückgegeben werden. Eine Online-Datenbank enthält mehrere Suchergebnisdatensätze. Semantische Beschriftungen der Dateneinheiten werden auf den Ergebnisseiten nicht angezeigt. Semantische Beschriftungen für Dateneinheiten sind nicht nur für die oben genannte Datensatzverknüpfung wichtig, sondern auch für die Speicherung der gesammelten SRRs in einer Datenbanktabelle. Frühere Anwendungen erfordern manuellen Aufwand, um Dateneinheiten manuell zu annotieren. Dies schränkt die Skalierbarkeit ein. In diesem Beitrag untersuchen wir, wie den Dateneinheiten innerhalb der von Web-Datenbanken zurückgegebenen SRRs automatisch Bezeichnungen zugewiesen werden können, und wie die Ergebnisse durch den Einsatz von Clustering-Verfahren - nämlich BIRCH und ROCK - verbessert werden können. Zunächst werden die Dateneinheiten auf einer Ergebnisseite in verschiedene Gruppen geordnet, sodass die Daten derselben Gruppe dieselbe Semantik aufweisen. Mithilfe eines Annotations-Wrappers können dann Informationen aus den Web-Datenbanken extrahiert werden.