Wie lange dauert es, die Specialization abzuschließen?

Der Kurs dauert etwa 3-5 Stunden, so dass Sie innerhalb von nur zwei Wochen über die Fähigkeiten verfügen, die Sie brauchen, um einen Arbeitgeber zu beeindrucken!

Brauche ich irgendwelche Vorkenntnisse, um diesen Kurs erfolgreich abzuschließen?

<text variant="body1">Dieser Kurs ist auf mittlerem Niveau angesiedelt. Um den größtmöglichen Lernerfolg zu erzielen, müssen Sie über Grundkenntnisse in Python, großen Sprachmodellen (LLMs), Verstärkungslernen und Befehlsabstimmung verfügen. Sie sollten auch mit Konzepten des maschinellen Lernens und neuronaler Netze vertraut sein.

Welche Funktionen werden von den Fähigkeiten, die ich in diesem Kurs erwerbe, profitieren?

Dieser Kurs ist Teil der Spezialisierung Generative AI Engineering mit LLMs. Wenn Sie die Spezialisierung abschließen, haben Sie die Fähigkeiten und das Selbstvertrauen, um Berufsrollen wie KI-Ingenieur, Datenwissenschaftler, Ingenieur für maschinelles Lernen, Deep-Learning-Ingenieur, KI-Ingenieur und Entwickler, die mit LLMs arbeiten wollen, zu übernehmen.

Benötige ich spezielle Software oder Tools, um den Kurs erfolgreich abzuschließen?

<text variant="body1">Für die Teilnahme an diesem Kurs und allen praktischen Übungen ist lediglich ein moderner Webbrowser erforderlich. Sie erhalten kostenlosen Zugang zu Cloud-basierten Umgebungen, um die Übungen durchzuführen.

Wann werde ich Zugang zu den Vorlesungen und Aufgaben haben?

Um Zugang zu den Kursmaterialien und Aufgaben zu erhalten und um ein Zertifikat zu erwerben, müssen Sie die Zertifikatserfahrung erwerben, wenn Sie sich für einen Kurs anmelden. Sie können stattdessen eine kostenlose Testversion ausprobieren oder finanzielle Unterstützung beantragen. Der Kurs kann stattdessen die Option "Vollständiger Kurs, kein Zertifikat" anbieten. Mit dieser Option können Sie alle Kursmaterialien einsehen, die erforderlichen Bewertungen abgeben und eine Abschlussnote erhalten. Dies bedeutet auch, dass Sie kein Zertifikat erwerben können.

Was bekomme ich, wenn ich dieses Zertifikat abonniere?

Wenn Sie sich für den Kurs anmelden, erhalten Sie Zugang zu allen Kursen des Zertifikats, und Sie erhalten ein Zertifikat, wenn Sie die Arbeit abgeschlossen haben. Ihr elektronisches Zertifikat wird zu Ihrer Seite "Leistungen" hinzugefügt - von dort aus können Sie Ihr Zertifikat ausdrucken oder zu Ihrem LinkedIn-Profil hinzufügen.

Generative AI Erweiterte Feinabstimmung für LLMs

Generative AI Erweiterte Feinabstimmung für LLMs

Dieser Kurs ist Teil mehrerer Programme.

Dozenten: Joseph Santarcangelo

23.214 bereits angemeldet

Bei enthalten

Mehr erfahren

2 Module

Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.

132 Bewertungen

Stufe Mittel

Empfohlene Erfahrung

Flexibler Zeitplan

9 Stunden zu vervollständigen

In Ihrem eigenen Lerntempo lernen

88%

Den meisten Lernenden hat dieser Kurs gefallen

2 Module

Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.

132 Bewertungen

Stufe Mittel

Empfohlene Erfahrung

Flexibler Zeitplan

9 Stunden zu vervollständigen

In Ihrem eigenen Lerntempo lernen

88%

Den meisten Lernenden hat dieser Kurs gefallen

Was Sie lernen werden

Gefragt sind generative KI-Engineering-Fähigkeiten zur Feinabstimmung von LLMs, die von Arbeitgebern aktiv gesucht werden
Anweisungsabstimmung und Belohnungsmodellierung unter Verwendung von Hugging Face, sowie Verständnis von LLMs als Richtlinien und Anwendung von RLHF-Techniken
Direkte Präferenzoptimierung (DPO) mit Partitionsfunktion und Hugging Face, einschließlich der Definition optimaler Lösungen für DPO-Probleme
Proximale Politikoptimierung (PPO) mit Hugging Face zur Erstellung von Bewertungsfunktionen und Tokenisierung von Datensätzen für die Feinabstimmung

Kompetenzen, die Sie erwerben

Kategorie: Modell Ausbildung
Kategorie: Feinabstimmung
Kategorie: Modell-Optimierung
Kategorie: Generative Modellarchitekturen
Kategorie: Reinforcement Learning
Kategorie: Methoden des maschinellen Lernens
Kategorie: Bewertung des Modells
Kategorie: Modellierung großer Sprachen

Werkzeuge, die Sie lernen werden

Kategorie: Generative KI

Wichtige Details

Zertifikat zur Vorlage

Zu Ihrem LinkedIn-Profil hinzufügen

Bewertungen

5 Aufgaben

Unterrichtet in Englisch

Erfahren Sie, wie Mitarbeiter führender Unternehmen gefragte Kompetenzen erwerben.

Weitere Informationen zu Coursera für Unternehmen

Logos von Petrobras, TATA, Danone, Capgemini, P&G und L'Oreal

Erweitern Sie Ihre Fachkenntnisse

Dieser Kurs ist als Teil verfügbar

Wenn Sie sich für diesen Kurs anmelden, müssen Sie auch ein bestimmtes Programm auswählen.

Lernen Sie neue Konzepte von Branchenexperten
Gewinnen Sie ein Grundverständnis bestimmter Themen oder Tools
Erwerben Sie berufsrelevante Kompetenzen durch praktische Projekte
Erwerben Sie ein Berufszertifikat zur Vorlage

In diesem Kurs gibt es 2 Module

"Die Feinabstimmung großer Sprachmodelle (Large Language Models, LLMs) ist unerlässlich, um sie auf spezifische Geschäftsanforderungen abzustimmen, die Genauigkeit zu verbessern und die Leistung zu optimieren. In der heutigen KI-gesteuerten Welt sind Unternehmen auf fein abgestimmte Modelle angewiesen, um präzise, umsetzbare Erkenntnisse zu generieren, die Innovation und Effizienz fördern. Dieser Kurs stattet angehende KI-Ingenieure mit den gefragten Fähigkeiten aus, die Arbeitgeber aktiv suchen. Sie werden fortgeschrittene Feinabstimmungstechniken für kausale LLMs erforschen, einschließlich Instruktionsabstimmung, Belohnungsmodellierung und direkte Präferenzoptimierung. Sie erfahren, wie LLMs als probabilistische Richtlinien für die Generierung von Antworten fungieren und wie sie mit Hilfe von Tools wie Hugging Face an menschliche Präferenzen angepasst werden können. Sie werden in die Belohnungsberechnung, das Verstärkungslernen aus menschlichem Feedback (RLHF), die proximale Policy-Optimierung (PPO), den PPO-Trainer und optimale Strategien für die direkte Präferenzoptimierung (DPO) eintauchen. Die praktischen Übungen in diesem Kurs vermitteln Ihnen praktische Erfahrungen mit der Abstimmung von Instruktionen, der Belohnungsmodellierung, der PPO und der DPO und geben Ihnen die Werkzeuge an die Hand, mit denen Sie LLMs für hochwirksame Anwendungen selbstbewusst feinabstimmen können. Erwerben Sie in nur zwei Wochen berufsreife generative KI-Fähigkeiten! Melden Sie sich noch heute an und bringen Sie Ihre Karriere in der KI voran!"

Moduldetails

In diesem Modul werden Sie fortgeschrittene Techniken zur Feinabstimmung großer Sprachmodelle (LLMs) durch Instruktionsabstimmung und Belohnungsmodellierung erkunden. Sie beginnen mit der Definition der Befehlsabstimmung und lernen den Prozess kennen, einschließlich des Ladens von Datensätzen, Texterzeugungspipelines und Trainingsargumenten mit Hugging Face. Anschließend tauchen Sie in die Belohnungsmodellierung ein, wo Sie Datensätze vorverarbeiten, Low-Rank-Adaptation (LoRA)-Konfigurationen anwenden und Qualitätsreaktionen quantifizieren, um die Modelloptimierung zu steuern und mit menschlichen Präferenzen in Einklang zu bringen. Sie werden auch Reward-Trainer und Reward-Modell-Verlustfunktionen beschreiben und anwenden. Darüber hinaus werden Sie in den praktischen Übungen Ihre Kenntnisse durch praktische Erfahrungen mit der Abstimmung von Anweisungen und der Belohnungsmodellierung vertiefen und so in die Lage versetzt, LLMs für bestimmte Aufgaben effektiv anzupassen.

Das ist alles enthalten

6 Videos4 Lektüren2 Aufgaben2 App-Elemente3 Plug-ins

6 VideosInsgesamt 36 Minuten

Einführung in den Kurs3 Minuten
Grundlagen des Instruktionstunings7 Minuten
Instruktions-Tuning mit umarmendem Gesicht7 Minuten
Belohnungsmodellierung: Auswertung der Antworten5 Minuten
Belohnungsmodell Training7 Minuten
Belohnungsmodellierung mit umarmendem Gesicht8 Minuten

4 LektürenInsgesamt 18 Minuten

Überblick über den Kurs3 Minuten
Übersicht über die Spezialisierung10 Minuten
Bewährte Praktiken für das Instruction-Tuning großer Sprachmodelle3 Minuten
Zusammenfassung und Highlights2 Minuten

2 AufgabenInsgesamt 30 Minuten

Verschiedene Ansätze zur Unterrichtsabstimmung21 Minuten
Praxis-Quiz: Instruktionsabstimmung und Belohnungsmodellierung9 Minuten

2 App-ElementeInsgesamt 150 Minuten

Anweisung Feinabstimmung LLMs90 Minuten
Labor: Modellierung von Belohnungen60 Minuten

3 Plug-insInsgesamt 35 Minuten

Hilfreiche Tipps für den Kursabschluss5 Minuten
Anweisung Tuning15 Minuten
Belohnungsmodellierung und Reaktionsbewertung15 Minuten

In diesem Modul erforschen Sie fortgeschrittene Techniken zur Feinabstimmung großer Sprachmodelle (LLMs) unter Verwendung von Reinforcement Learning from Human Feedback (RLHF), Proximal Policy Optimization (PPO) und Direct Preference Optimization (DPO). Sie werden zunächst beschreiben, wie LLMs als probabilistische Verteilungen funktionieren und wie diese in Richtlinien umgewandelt werden können, um Antworten auf der Grundlage von Eingabetext zu generieren. Sie werden die Beziehung zwischen Richtlinien und Sprachmodellen als Funktion von Parametern, wie z.B. Omega, untersuchen und wie Belohnungen unter Verwendung menschlichen Feedbacks berechnet werden können. Dazu gehören das Trainieren von Antwortmustern, die Bewertung der Leistung von Agenten und die Definition von Bewertungsfunktionen für Aufgaben wie die Analyse von Gefühlen mit PPO. Sie werden auch in der Lage sein, die PPO-Konfiguration, Lernraten und die Rolle des PPO-Trainers bei der Optimierung von Chatbot-Antworten mit Hugging Face-Tools zu erklären. Das Modul stellt außerdem DPO vor, eine direktere und effizientere Methode zur Anpassung von Modellen an menschliche Präferenzen. Obwohl komplexe Themen wie PPO und Reinforcement Learning vorgestellt werden, wird von Ihnen nicht erwartet, dass Sie sie in diesem Kurs in der Tiefe verstehen. In den praktischen Übungen in diesem Modul können Sie die Anwendung von RLHF und DPO üben. Zur Unterstützung Ihres Lernens sind ein Spickzettel und ein Glossar zum schnellen Nachschlagen enthalten.

Das ist alles enthalten

10 Videos5 Lektüren3 Aufgaben2 App-Elemente4 Plug-ins

10 VideosInsgesamt 59 Minuten

Große Sprachmodelle (LLMs) als Verteilungen7 Minuten
Von Verteilungen zu Policen4 Minuten
Verstärkungslernen aus menschlichem Feedback (RLHF)8 Minuten
Proximale Optimierung der Politik (PPO)5 Minuten
PPO mit Umarmungsgesicht4 Minuten
PPO-Trainer6 Minuten
DPO: Teilungsfunktion6 Minuten
DPO: Optimale Lösung8 Minuten
Von der Optimalen Politik zum DPO6 Minuten
DPO mit Umarmungsgesicht5 Minuten

5 LektürenInsgesamt 18 Minuten

Zusammenfassung und Highlights4 Minuten
Zusammenfassung und Highlights3 Minuten
Kurs Schlussfolgerung6 Minuten
Glückwünsche und nächste Schritte3 Minuten
Danke vom Kursteam2 Minuten

3 AufgabenInsgesamt 61 Minuten

Feinabstimmung kausaler LLMs mit menschlichem Feedback und direkter Präferenz30 Minuten
Praxis-Quiz: Proximale Optimierung der Politik (PPO)21 Minuten
Praxis-Quiz: Direkte Präferenz-Optimierung (DPO)10 Minuten