Modération automatique (IA + filtres)
La modération automatique est la première ligne de défense. Elle fonctionne en temps réel sur tout le contenu généré.
Comment ça marche :
1. Filtres de mots-clés. Une liste de mots/expressions interdits (insultes courantes, slurs, termes haineux) déclenche un masquage automatique. Le message est remplacé par « [Message masqué par la modération] » et l'auteur est notifié.
2. Détection IA contextuelle. On utilise un modèle d'IA entraîné sur des milliers d'exemples pour détecter le contenu inapproprié au-delà des simples mots-clés. Par exemple, « Tu es vraiment [insulte déguisée] » est détecté même si l'insulte est créative.
3. Détection de spam. Si tu envoies 10 messages identiques en 1 minute, ou si tu envoies des liens externes suspects, le système te mute automatiquement pendant 15 minutes.
4. Détection de manipulation. Si plusieurs comptes coordonnent leurs messages (même contenu, même timing), le système détecte le pattern et applique des mesures (mute temporaire, escalade vers la modération humaine).
Avantages. Rapide (millisecondes), sans biais humain, applique les règles uniformément.
Limites : peut faire des faux positifs (message légitime masqué). Dans ce cas, l'utilisateur peut faire appel.
Modération humaine réactive (sur signalements)
Quand un utilisateur signale un contenu, la modération humaine réactive prend le relais.
Comment ça marche :
- Le signalement arrive dans la file d'attente de la modération.
- Un modérateur humain prend le ticket. Il examine :
- Le message ou comportement signalé.
- Le contexte (conversation entière).
- L'historique de l'utilisateur signalé (récidive ou première fois).
- Les éventuels signalements multiples (si plusieurs personnes ont signalé, c'est un signal fort).
- Décision prise en 24h en moyenne, parfois jusqu'à 7 jours pour les cas complexes.
- L'utilisateur signalé reçoit la décision (avertissement, mute, ban, etc.).
- L'utilisateur qui a signalé reçoit un message de retour : « Ton signalement a été traité. Sanction appliquée : [type] » ou « Ton signalement a été examiné, mais le contenu signalé ne violait pas nos règles. »
Équipe : ~25 modérateurs humains équivalent temps plein, basés à Yaoundé, Douala, Dakar et Paris. Couverture 24/7 par rotation.
Volume : la modération traite environ 5 000 signalements par jour en moyenne, avec des pics jusqu'à 15 000 lors de grands événements (matchs majeurs, élections).
Modération humaine proactive (surveillance des patterns)
En plus de la réactive, une modération proactive surveille des patterns suspects sans attendre les signalements.
Cas surveillés :
1. Comptes nouveaux à comportement suspect. Un compte créé hier qui poste 100 messages en 1 heure, ou qui suit 500 personnes immédiatement, est analysé.
2. Patterns de fraude collective. Plusieurs comptes qui se « matchent » entre eux dans l'arène pour blanchir de l'argent, ou qui se votent mutuellement dans des défis.
3. Évolution de la toxicité globale. Si une thématique (politique d'un pays par exemple) devient soudainement très toxique, on peut renforcer la modération sur cette thématique.
4. Tendances émergentes. Nouveaux types de spam, nouvelles formes de phishing, nouveaux contenus problématiques détectés sur d'autres plateformes - la modération proactive met à jour les filtres.
Équipe : ~5 modérateurs dédiés au travail proactif, plus une équipe technique d'ingénieurs anti-fraude.
Transparence et publication de rapports
Ktkarena publie un rapport de modération trimestriel dans la section « Transparence » du site web. Ce rapport contient :
- Nombre total de signalements reçus dans le trimestre.
- Répartition par type (insultes, spam, fraude, etc.).
- Décisions prises (sanctions appliquées, signalements classés sans suite).
- Délais moyens de traitement.
- Nombre d'appels et taux de succès.
- Nombre de bannissements définitifs.
C'est notre engagement de transparence. On ne cache pas les défis de modération, on les expose et on s'améliore.
Suggestions de la communauté. Tu peux envoyer des suggestions à moderation@ktkarena.com. Les meilleures idées sont régulièrement intégrées.