Was liest ChatGPT? Vom Take Off der Token
摘要
Der Beitrag untersucht, welche literarischen Texte für das Training von OpenAIs Generative Pre-Trained Transformer (GPT) verwendet wurden. Über öffentlich zugängliche Informationen und wissenschaftliche Studien zum Thema hinaus bespricht der Autor eigene Experimente mit ChatGPT, mit denen er die Fähigkeit des Modells zur Memorisierung von Trainingsdaten geprüft hat. Es wird gezeigt, dass ChatGPT bis zum Herbst 2024 auch vom Copyright gedeckte literarische Texte im Wortlaut wiedergeben konnte. Die Weigerung aktueller Versionen des Modells, aus rechtlich geschützten Werken zu zitieren, kann als Eingeständnis gewertet werden, dass weiterhin entsprechendes Material zur Entwicklung von Large Language Models eingesetzt wird.