Die Grundidee von ML ist die Entwicklung von Vorhersagemodellen aus Daten. Dieser Prozess umfasst im Wesentlichen drei Hauptkomponenten: (1) Repräsentation, das Set möglicher Modellfunktionen, (2) Evaluation, die Quantifizierung des Modellfehlers durch eine Verlustfunktion, und (3) Optimierung, die iterative Anpassung der Modellparameter. Ziel ist die Minimierung des empirischen Fehlers. Dabei gilt es, eine adäquate Modellflexibilität zu finden, um sowohl Overfitting als auch Underfitting zu vermeiden. Hierfür wird sogenanntes Resampling verwendet, um Modelle zu optimieren, indem Datensätze in Trainings- und Testsets aufgeteilt werden. Eine häufige Form des Resamplings ist die Kreuzvalidierung, bei der die Daten in Substichproben unterteilt werden und jede dieser einmal als Testset verwendet wird. Dadurch wird die Datennutzung maximiert und die Fehlerabschätzung verlässlicher. Nested Resampling, eine erweiterte Version des klassischen Resamplings, wird zudem genutzt, um Hyperparameter zu verbessern und eine unvoreingenommene Bewertung des Modells zu gewährleisten.

错误:搜索内容不能为空,请输入英文关键词
错误:关键词超出字数限制,请精简
高级检索

Grundidee des Machine Learnings

  • Sven Hilbert,
  • Elisabeth Kraus,
  • Alfred Lindl

摘要

Die Grundidee von ML ist die Entwicklung von Vorhersagemodellen aus Daten. Dieser Prozess umfasst im Wesentlichen drei Hauptkomponenten: (1) Repräsentation, das Set möglicher Modellfunktionen, (2) Evaluation, die Quantifizierung des Modellfehlers durch eine Verlustfunktion, und (3) Optimierung, die iterative Anpassung der Modellparameter. Ziel ist die Minimierung des empirischen Fehlers. Dabei gilt es, eine adäquate Modellflexibilität zu finden, um sowohl Overfitting als auch Underfitting zu vermeiden. Hierfür wird sogenanntes Resampling verwendet, um Modelle zu optimieren, indem Datensätze in Trainings- und Testsets aufgeteilt werden. Eine häufige Form des Resamplings ist die Kreuzvalidierung, bei der die Daten in Substichproben unterteilt werden und jede dieser einmal als Testset verwendet wird. Dadurch wird die Datennutzung maximiert und die Fehlerabschätzung verlässlicher. Nested Resampling, eine erweiterte Version des klassischen Resamplings, wird zudem genutzt, um Hyperparameter zu verbessern und eine unvoreingenommene Bewertung des Modells zu gewährleisten.