Hvad er DPO (Direct Preference Optimization)?
DPO er en finjusteringsmetode, hvor en sprogmodel lærer af præferencepar i stedet for et separat belønningsmodeltrin. Forklaringen dækker forskellen til RLHF, datakrav, referencemodel, beta-parameter, evaluering og de vigtigste praktiske begrænsninger før kontrolleret brug i modeludvikling.