Wenn Entwicklerinnen und Entwickler früher Fragen hatten, auf die sie bei ihren Kollegen keine Antwort fanden, haben sie sich oft an Know-how-Austauschforen wie Stack Overflow gewendet. Seit dem Aufkommen von ChatGPT und anderen KI-Systemen stellen sie aber immer öfter ihre Fragen an diese Systeme.
Forscher der Universität Purdue haben sich die Frage gestellt, wie gut die Antworten von ChatGPT auf Programmierfragen sind. Kurz gefasst: Sie sind oft teilweise falsch.
Unnötige und falsche Antworten
Das Forscherteam hat auf Stack Overflow 517 Fragen zusammengesucht und diese an ChatGPT gestellt. Die Antworten wurden danach auf Korrektheit, Verständlichkeit und Prägnanz hin analysiert.
Laut der Analyse enthielten nicht weniger als 52% der Antworten unkorrekte Informationen. Zudem waren 77% der Antworten unnötig ausführlich.
Das Forscherteam befragte auch User zu den ChatGPT-Antworten. Obwohl so viele davon Fehler enthielten, bevorzugten die User in 35% der Fälle die KI-Antworten. Laut der Studie begründeten sie dies mit der Verständlichkeit und der guten Formulierung der Antworten von ChatGPT. Gleichzeitig erkannten sie aber in 39% der Fälle die darin enthaltenen Fehler nicht.
Vielleicht werden die Antworten von ChatGPT bald besser. Bis dann aber, resümieren die Forscher, sollten Programmiererinnen und Programmierer immer wieder daran erinnert werden, dass Antworten von ChatGPT Fehler enthalten können und verifiziert werden müssen.