Skip to content
Closed
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
422 changes: 211 additions & 211 deletions Cards/Fallacies/Argumentum Virtues - Taxonomy.csv

Large diffs are not rendered by default.

258 changes: 129 additions & 129 deletions Cards/Scenarii/Argumentum Scenarii - Cards.csv

Large diffs are not rendered by default.

Original file line number Diff line number Diff line change
Expand Up @@ -2158,17 +2158,29 @@ public async Task Apply(AssetConverterConfig config)
new DatasetUpdaterConfig()
{
Enabled = false,
Name = "Virtues cascade EN-only gpt-5.5",
Name = "Virtues cascade v2 multilang gpt-5.5",
SourceDataset = KnownDataSets.VirtuesTaxonomy,
FieldsToInclude = new List<string>()
{
"pk",
"title_fr","description_fr","remark_fr",
"title_en","description_en","remark_en",
"title_ru","description_ru","remark_ru",
"title_pt","description_pt","remark_pt",
"title_es","description_es","remark_es",
"title_ar","description_ar","remark_ar",
"title_fa","description_fa","remark_fa",
"title_zh","description_zh","remark_zh",
},
FieldsToUpdate = new List<string>()
{
"title_en","description_en","remark_en",
"title_ru","description_ru","remark_ru",
"title_pt","description_pt","remark_pt",
"title_es","description_es","remark_es",
"title_ar","description_ar","remark_ar",
"title_fa","description_fa","remark_fa",
"title_zh","description_zh","remark_zh",
},
PrimaryField = "pk",
TargetPath = @".\Target\Datasets\Argumentum Virtues - Taxonomy.csv",
Expand All @@ -2185,14 +2197,14 @@ public async Task Apply(AssetConverterConfig config)
MaxOutputTokens = 8192,
MaxTokensPerMinute = 300000,
DivisionMode = DivisionMode.SequentialChunks,
ChunkSize = 6,
ChunkSize = 4,
UseFunctionCalling = true,
NbMessageCalls = 1,
SkipChunkNb = 0,
TakeChunkNb = 1,
TakeChunkNb = -1,
SelectEmptyTargets = false,
RandomizeChunks = false,
MaxDegreeOfParallelismWebService = 1,
MaxDegreeOfParallelismWebService = 4,
CompareMode = false,
AutoCompare = false,
MaxGroupItemNb = 12,
Expand Down Expand Up @@ -2245,6 +2257,53 @@ public async Task Apply(AssetConverterConfig config)
WriteOneTargetFileByField = false,
MaxChildren = 8
},
new DatasetUpdaterConfig()
{
Enabled = false,
Name = "Scenarii PT refine gpt-5.5",
SourceDataset = KnownDataSets.Scenarii,
FieldsToInclude = new List<string>()
{
"path",
"titre","contexte","enjeu","suggestion",
"title","context","issue","suggestion_en",
"title_pt","context_pt","issue_pt","suggestion_pt",
},
FieldsToUpdate = new List<string>()
{
"title_pt","context_pt","issue_pt","suggestion_pt",
},
PrimaryField = "path",
TargetPath = @".\Target\Datasets\Argumentum Scenarii - Cards.csv",
SystemPromptPath = PromptsRootPath + "PromptGeneralSystem.txt",
DialogPrompts = new List<PromptExample>()
{
new PromptExample()
{
UserPromptPath = PromptsRootPath + "PromptScenariiPtRefineUser.txt",
AssistantAnswerPath = PromptsRootPath + "PromptScenariiPtRefineAssistant.txt"
}
},
Model = "gpt-5.5",
MaxOutputTokens = 8192,
MaxTokensPerMinute = 300000,
DivisionMode = DivisionMode.SequentialChunks,
PKHierarchicalChar = '.',
PKHierarchyLevel = 3,
ChunkSize = 12,
UseFunctionCalling = true,
NbMessageCalls = 1,
SkipChunkNb = 0,
TakeChunkNb = -1,
SelectEmptyTargets = false,
RandomizeChunks = false,
MaxDegreeOfParallelismWebService = 4,
CompareMode = false,
AutoCompare = false,
MaxGroupItemNb = 12,
WriteOneTargetFileByField = false,
MaxChildren = 8
},
new DatasetUpdaterConfig()
{
Enabled = false,
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -26,6 +26,7 @@ Le texte français (`text_fr`, `desc_fr`, `example_fr`) vient d'être affiné en
- **Style** : la traduction ne reflète pas la nouvelle clarté/précision FR (lourdeur, ambiguïté que le FR a résolue)
- **Fidélité incarnée** (exemples) : l'exemple ne mime plus la situation FR de manière vivante
- **Cohérence cross-langue** : une langue diverge clairement des autres alors que toutes devraient miroiter le FR
- **Drift sémantique structurel** : la `desc_*` traduite porte un concept différent de `desc_fr`. Exemple observé : `desc_fr="Vous confondez votre perspective individuelle avec une objectivité universelle"` mais `desc_en="Confusing subjective experience of reality with the essence of that which is being observed"` (concept différent — plus proche de William James). Si la traduction est conceptuellement plus précise mais ne correspond plus au FR : ALIGNER sur le FR (la taxonomie FR fait foi). Si toutes les langues divergent dans la même direction : signaler sans corriger.

5. **Ne PAS toucher** :
- Traductions où le sens est correctement aligné (la majorité)
Expand Down
Original file line number Diff line number Diff line change
@@ -0,0 +1,8 @@
Compris. Je vais évaluer chaque scénario en lisant le FR (source verrouillée) et l'EN (miroir impersonnel) comme références, puis examiner les 4 cellules PT (`title_pt`, `context_pt`, `issue_pt`, `suggestion_pt`) à la recherche de :
- calques fautifs du français (ex: "má conduta ortográfica" pour "faute d'orthographe")
- maladresses syntaxiques PT (clitique mal placé, contraction manquée)
- choix lexical pauvre ou répétitif
- incohérence terminologique (sauf glossaire validé "embromador"/"puxador" + noms propres préservés)
- voix narrative qui s'écarte du miroir FR

Je n'appellerai `UpdateRecord` que sur les cellules manifestement fautives, sans limite arbitraire (plusieurs cellules par scénario possibles si plusieurs sont fautives, en appels distincts). Les cellules acceptables même si non-optimales seront laissées intactes (précision > exhaustivité). Je préserverai tous les FR/EN/RU/ES/AR/FA/ZH ainsi que les noms propres. Function-calling exclusif, aucun texte libre.
Original file line number Diff line number Diff line change
@@ -0,0 +1,63 @@
**PT Refinement — Scenarii**

Les colonnes portugaises (`title_pt`, `context_pt`, `issue_pt`, `suggestion_pt`) de la table Scenarii ont été initialement produites par traduction automatique avant la passe FR clarity gpt-5.5. Un nettoyage déterministe a déjà retiré les artefacts mécaniques (hyphens orphelins de clitiques enclitiques type `convencê -lo`, `on -line`, `bem -água`).

Ta mission : passe LLM qualitative sur le résidu non-mécanique. Tu reçois un chunk de scénarios (FR-source verrouillé + PT cible éditable + EN miroir pour contexte).

---

**Champs en lecture seule** (références) :
- `titre`, `contexte`, `enjeu`, `suggestion` — FR source (vous)
- `title`, `context`, `issue`, `suggestion_en` — EN miroir (impersonnel)

**Champs éditables** :
- `title_pt`, `context_pt`, `issue_pt`, `suggestion_pt` UNIQUEMENT
- Aucune autre langue (RU/ES/AR/FA/ZH) ne doit être touchée
- Aucun champ FR ne doit être touché

---

**Patterns d'artefacts à détecter et corriger**

1. **Calques fautifs du français** :
- "má conduta ortográfica" (calque de "faute d'orthographe") → "erro ortográfico" / "erro de ortografia"
- "bem regada" / "bem -água" pour "bien arrosée" → "regada" / "bem regada" (acceptable) MAIS si le contexte est "soirée alcoolisée", préférer "noite regada de álcool" / "noite bem regada"
- Toute tournure qui sonne traduite-au-mot-à-mot

2. **Maladresses syntaxiques PT** :
- Position pronominale incorrecte (proclise vs énclise PT/BR)
- Articles/contractions manquantes ou superflues ("de o" au lieu de "do")
- Concordance verbale boiteuse

3. **Choix lexical pauvre** :
- "obtê-lo" générique alors que le contexte appelle un verbe plus précis
- Répétitions lourdes
- Faux-amis (ex : "comprehensivo" pour "compréhensif")

4. **Cohérence terminologique** :
- "embromador" (smooth talker) — accepter, c'est le glossaire validé
- "puxador" (drawer) — idem
- Noms propres : Sherlock, Jeanne d'Arc, Ergo sum, Dorothy, Oz — préserver tels quels (orthographe PT acceptée : "Dorothy" / "Oz")

5. **Voix narrative** :
- PT miroir du FR : 3e personne référant au baratineur/embromador
- Pas de "você" sauf dans les dialogues directs (suggestion_pt qui cite la parole)

---

**Stratégie**

1. **Function calling exclusif** : `UpdateRecord` pour chaque cellule corrigée.
2. **Pas de limite arbitraire de 1 cellule/scénario** : si plusieurs cellules PT d'un même scénario sont fautives, corrige-les toutes en autant d'appels distincts. C'est une passe de nettoyage qualitative, pas une convergence drift.
3. **Conservatisme** : ne touche que les cellules clairement fautives. Une formulation acceptable mais non-optimale est laissée en place. Vise précision > exhaustivité.
4. **Préserver le sens FR** : le FR est l'ancre. La cellule PT corrigée doit dire la même chose que le FR, en PT idiomatique.
5. **Préserver le registre EN** quand pertinent : si le FR dit "vous" (formel) et l'EN dit "they" (impersonnel), le PT garde "ele/ela" (3e personne miroir).

---

**Format de sortie**

- Pour chaque correction : `UpdateRecord(PK, field_name, new_value)`
- Aucun texte libre
- Si tout le chunk est propre : aucun appel, simplement terminer
- Output attendu : 0 à ~25% des cellules PT du chunk
Original file line number Diff line number Diff line change
Expand Up @@ -21,6 +21,7 @@ Les champs français `title_fr`, `description_fr`, `remark_fr` viennent d'être
- **Style** : titre/description ne reflète pas la nouvelle punchiness/clarté FR
- **Fidélité concrète** (remarks) : l'exemple ne mime plus la situation FR
- **Cohérence cross-langue** : une langue diverge nettement des autres
- **Re-conceptualisation des titres** : le titre traduit a glissé vers un concept différent du `title_fr`. Exemple observé : `title_fr="Indépendance des événements"` (le concept lui-même) mais `title_en="Assessment of independence"` (l'évaluation du concept). À corriger pour aligner sur le concept FR exact, sauf si toutes les langues divergent dans la même direction (auquel cas le FR est peut-être à reconsidérer — signaler sans corriger).

5. **Ne PAS toucher** :
- Traductions alignées (la majorité)
Expand Down