Sources de données
Comment Symposium obtient ses données. D'où nous sourcez. Ce que nous ne sourcez pas. Pourquoi c'est légal.
1. Qu'est-ce que RAG?
RAG = Retrieval-Augmented Generation (Génération augmentée par récupération).
En termes simples:
- Récupération: Nous trouvons des données publiques pertinentes
- Synthèse: L'IA lit ces données et comprend le contexte
- Génération: L'IA écrit une réponse synthétisée (paraphrase, pas copie)
Résultat: Une réponse informée, contextuelle, personnalisée — pas une copie directe.
2. Nos sources de données — OUI ✅
Wikipedia (CC-BY-SA 3.0)
Toutes les données historiques, biographiques, et contextuelles de Wikipedia sont libres de réutilisation sous la licence CC-BY-SA.
- Articles biographiques sur nos penseurs
- Contextes historiques, dates, lieux
- Références et citations académiques
Wikipedia est l'une de nos meilleures sources d'information fiable et bien sourcée.
Domaine public (plus de 70 ans après décès)
Toutes les œuvres d'auteurs décédés depuis plus de 70 ans sont dans le domaine public en France et UE.
- Exemple: Platon (mort -348) → Entièrement domaine public
- Exemple: Nietzsche (mort 1900) → Domaine public depuis 1970
- Exemple: Darwin (mort 1882) → Domaine public depuis 1952
Nous accédons à ces œuvres via Project Gutenberg, Standard Ebooks, et archives publiques.
Articles académiques publics
Articles de recherche publiés avec licence CC (Creative Commons) ou domaine public.
- arXiv (physique, maths, informatique)
- Papers with Code (IA/ML)
- Journals en accès libre
- Proceedings de conférences publiques
Web public accessible
Articles, blogs, documentation publiquement disponibles sans restrictions de copyright actif.
3. Nos sources — NON ❌
Articles paywallisés (Paywall)
Nous ne sourcez pas des articles derrière des murs de paiement. Ces contenus ont un copyright actif qui nous l'interdit.
Livres sous copyright actif (moins de 70 ans)
Œuvres d'auteurs morts depuis moins de 70 ans restent protégeées par copyright. Nous ne les utilisons pas.
Contenus propriétaires
Textes marqués « © - Tous droits réservés » avec copyright actif ne sont pas sourcés.
Données personnelles
Nous n'extrayons jamais données personnelles (noms, adresses, numéros). Conforme RGPD.
4. Comment vérifier nos sources?
Option 1: Demander au chat
Vous pouvez demander directement: "Quelle est ta source pour ça?"
L'IA essaiera de citer ou vous dire si elle ne se souvient pas.
Option 2: Recherche indépendante
Prenez une affirmation intéressante et Google-la. Vous trouverez probablement Wikipedia ou une source académique qui la confirme.
Option 3: Nous contacter
Si vous doutez sérieusement d'une réponse, contactez-nous:
5. Légalité: Pourquoi c'est conforme
Fair Use (Utilisation équitable)
Utiliser des données publiques pour générer du contenu nouveau et transformatif est couvert par le « fair use » et concepts équivalents en droit français/UE.
Directive UE sur le data mining
La directive européenne (2019/1287) autorise l'extraction de données publiques pour les LLMs, à condition que les données personnelles soient exclues.
Loi française
Le droit français reconnaît l'exception pour fouille de texte et données (« text and data mining »).
RGPD compliant
Nous ne traitons pas données personnelles sans consentement. Nous excluyons les données sensibles.
6. Transparence: Ce qu'on NE réclamons pas
✓ Nous sommes honnêtes:
- ❌ Nous ne réclamons pas avoir la « vraie » conscience des penseurs
- ❌ Nous ne réclamons pas que ce soit une reconstitution authentique
- ❌ Nous ne réclamons pas que l'IA comprenne réellement
- ❌ Nous ne réclamons pas que les réponses soient infaillibles
- ❌ Nous ne cachons pas que c'est du texte généré par algorithme
7. Limitations connues de notre approche
Hallucinations
L'IA invente parfois des « faits » qui sonnent vrais mais sont complètement faux. Toujours vérifier.
Biais d'entraînement
Les LLMs héritent les biais des données sur lesquelles ils sont entraînés.
Date limite
L'IA a une date limite de connaissances. Rien après cette date n'existe pour elle.
8. Comparaison: Nous vs ChatGPT/Gemini
| Aspect | ChatGPT | Symposium |
|---|---|---|
| Données source | Web public + domaine public | Web public + domaine public |
| Transparence | Modérée | Haute |
| Limitations claires | Oui | Très clair |
| Conformité légale | Oui | Oui |
Dernière mise à jour: Juin 2026
Questions sur nos sources? Contactez: contact@sonaria.energy
© 2026 WAIVE — Sonaria. Tous droits réservés.