#!/usr/bin/env python3
import re
from pathlib import Path

corpus = Path("C:\\MONIKA\\datasets\\alice_wonderland.txt").read_text(encoding='utf-8', errors='ignore')

# Clean Gutenberg
if "*** START" in corpus:
    corpus = corpus.split("*** START", 1)[1]
if "*** END" in corpus:
    corpus = corpus.split("*** END", 1)[0]

# Extract sentences
sentences = re.split(r'[.!?]+\s+', corpus)
sentences = [s.strip() for s in sentences if 30 < len(s.strip()) < 150]

# Write batches for fastfood
output = Path("C:\\MONIKA\\alice_sentences.txt")
with open(output, 'w', encoding='utf-8') as f:
    for sent in sentences[:500]:
        f.write(sent + '\n')

print(f"Extracted {min(500, len(sentences))} sentences to {output}")
