"""
MK3 Alignment Module

Modern preference learning and alignment methods for continuous language models.

Supported methods:
- DPO: Direct Preference Optimization
- KTO: Kahneman-Tversky Optimization
- ORPO: Odds-Ratio Preference Optimization
- RRHF: Rank Responses to Human Feedback
- StepDPO: Step-wise DPO for reasoning tasks

All implementations work with MK3's continuous vector representations.
"""

from .dpo import DPOLoss, DirectPreferenceOptimization
from .kto import KTOLoss, KahnemanTverskyOptimization
from .orpo import ORPOLoss, OddsRatioPreferenceOptimization
from .rrhf import RRHFLoss, RankResponsesHumanFeedback
from .step_dpo import StepDPOLoss, StepwiseDirectPreferenceOptimization
from .trainer import PreferenceTrainer, PreferenceDataset
from .utils import PreferenceData, ResponsePair, StepPreference

__all__ = [
    # DPO
    'DPOLoss',
    'DirectPreferenceOptimization',

    # KTO
    'KTOLoss',
    'KahnemanTverskyOptimization',

    # ORPO
    'ORPOLoss',
    'OddsRatioPreferenceOptimization',

    # RRHF
    'RRHFLoss',
    'RankResponsesHumanFeedback',

    # StepDPO
    'StepDPOLoss',
    'StepwiseDirectPreferenceOptimization',

    # Trainer
    'PreferenceTrainer',
    'PreferenceDataset',

    # Data structures
    'PreferenceData',
    'ResponsePair',
    'StepPreference',
]

__version__ = '1.0.0'
