Le dataset et sa génération
1855 paires question / raisonnement / réponse, fabriquées pour que la pensée intégrale devienne le défaut du modèle, pas un gabarit récité.
La qualité et le format des données font 80 % du résultat d'un fine-tuning. Ici, l'astuce centrale est de mettre toute l'analyse AQAL dans le canal de raisonnement, puis d'effacer le system prompt qui l'a produite.
L'idée : la méthode Orca "infusée"
Chaque exemple a trois parties : une question (un dilemme réaliste à la première personne), un <think> (l'analyse AQAL complète : centre de gravité, vérités partielles, polarité, ombre, intégration), puis une réponse en langage clair qui n'invoque pas le jargon. Le system prompt qui produit ce comportement est ensuite retiré du dataset. Résultat visé : le modèle apprend à faire l'analyse en coulisse et à répondre normalement, sans qu'on ait à le lui demander.
La génération à l'échelle
100 sous-agents Claude en parallèle, chacun écrivant un lot de 20 exemples, avec un thème de vie par lot (28 domaines en rotation : relations, travail, argent, deuil, spiritualité, politique, corps, etc.). Chaque agent reçoit le même prompt, avec une consigne stricte de voix (pas d'antithèse balancée, pas d'aphorismes, anglais carré et direct) et un format à délimiteurs.
STEP 2. Generate 20 DISTINCT examples. Primary theme: {domaine}.
Vary the asker's developmental center of gravity across the batch:
some from a traditional/duty place, some rational/success, some
pluralist/relativist, some egocentric/power, some anxious, some cynical.
Each example: a QUESTION (1-3 sentences, first person), a THINK (internal
AQAL analysis), a RESPONSE (250-500 words) that develops the competing
partial truths, leads with shadow work, keeps integral vocabulary
simplified but present, ends on real questions, no fixed template.
Trois exemples de paires réelles
Q : "I'm supposed to give a big presentation... I've done hundreds, I know my material cold, but this time it's so much worse. Why can't I just get my act together?"
<think> : "Center of gravity: rational/orange... 'Get my act together' is a self-management command. Shadow: the person is anxious about being anxious."
Réponse : "Track record and competence genuinely don't protect you here, and that's not a failure of willpower... you're now not just afraid, you're afraid and ashamed of being afraid."
Q : "I've always voted the same party because that's how my family does it. My coworker says that makes me a sheep. Is he right?"
<think> : "Center of gravity: mythic-amber / traditional... The 'sheep' accusation is from a rationalist position valuing autonomous judgment."
Réponse : "The image implies the non-sheep position is one of pure individual rational evaluation... That position is less stable than it sounds. Everyone brings prior commitments."
Q : "I've done ayahuasca three times, each time a profound ego dissolution. My friends say it's just neurotransmitters. I say spiritual revelation. Who's right?"
<think> : "...a classic IT vs. I quadrant conflict. Friends (orange/materialist): the neurological substrate is real..."
Réponse : "Your friends aren't wrong about the neurotransmitters, and you're not wrong that something real happened. The problem is you've both accepted a framing where these compete, and they don't."
Sortie conversationnelle ChatML : chaque ligne est un objet messages avec un tour user (la question) et un tour assistant dont le contenu est <think> analyse </think> puis la réponse. Aucun message système. Le chat template natif de Qwen3 préserve le <think> dans le tour assistant, ce qui permet de l'entraîner comme du vrai raisonnement.