Comment nous écrivons
Les textes de lerugby.com sont rédigés automatiquement. Voici à partir de quoi, et avec quels contrôles.
Ce qui est écrit par une machine
Les actualités, les articles de données, les avant-match et les comptes rendus de match sont rédigés par un programme. Les actualités et les textes de match passent par un modèle de langue d’OpenAI. Les articles de données n’en utilisent aucun.
Aucun journaliste n’écrit ces textes, et aucune personne ne les relit avant leur publication. Chacun porte la mention « Texte rédigé automatiquement ». Ce qui les encadre, ce sont des sources citées et des contrôles qui bloquent la publication au moindre défaut.
Directeur de la publication : Mathieu Dugue. Une erreur se signale à [email protected] (voir Contact).
D’un fil de presse à un article
Les signaux. Le programme lit 14 flux RSS de quatre médias français (Rugbyrama, La Dépêche, Sud Ouest, Le Rugbynistère) et 13 flux étrangers, dont RugbyPass, The Rugby Paper, RTÉ et OnRugby. Ces flux disent ce qui se passe. Ils ne fournissent pas le texte.
Le sujet. Un modèle de langue choisit au plus cinq événements précis par passage, et dix par jour. Il écarte ce que le site a déjà couvert dans les quatorze derniers jours.
Le dossier. Pour chaque sujet, une recherche sur le web réunit des faits, chacun rattaché à la page qui le porte. Il faut au moins huit faits distincts, venus d’au moins deux sites différents, dont une page réellement ouverte. Sinon, aucun article n’est écrit.
La rédaction. Le modèle écrit de 300 à 800 mots à partir de ce seul dossier. Il lui est interdit d’ajouter un fait de mémoire, une cause, un pronostic ou un jugement.
Les contrôles. Chacun bloque la publication, sans correction automatique :
- la longueur doit tenir entre 300 et 800 mots ;
- chaque nombre, date, score et nom propre du texte doit figurer dans le dossier. Ce contrôle est mécanique : il vérifie la présence des termes, pas le sens des phrases ;
- aucune suite de plus de huit mots ne doit reprendre le titre ou le chapeau d’une source ;
- une liste de formules d’opinion est refusée (« meilleur », « il faut », « mérite »…) ;
- si tout passe, un second appel au modèle relit le texte contre le dossier : attributions, dates, rumeurs, doublon avec un article déjà publié. Le moindre motif bloque.
Les sources. Elles sont listées en fin d’article. Quand un fait nouveau complète un article déjà publié, cet article est mis à jour plutôt que doublé.
Les photos. Elles viennent de Wikimedia Commons ou de Flickr, sous licence libre (CC0, CC BY ou CC BY-SA), avec l’auteur et la licence sous l’image. À défaut, une illustration est générée par IA, et la légende le dit.
Avant-match et comptes rendus
Ces textes partent d’une fiche de faits tirée de notre base, et de rien d’autre. Avant le match : la compétition, la journée, l’heure, le lieu, les diffuseurs, le classement des deux équipes et leurs dernières confrontations. Après le match : le score, le score à la mi-temps, l’affluence et le classement.
Chaque nombre, nom et score du texte est vérifié contre cette fiche. Un fait répété ou une formule d’opinion bloque la publication. Ces textes ne passent pas par une seconde relecture du modèle.
Articles de données
Les articles de la rubrique Analyses sont des phrases à trous remplies avec les valeurs de la base : journées de championnat achevées, affluences, comptages des clubs. Aucun modèle de langue n’intervient. Les sources sont citées en fin d’article.
Des données recoupées
Les calendriers, scores et classements des compétitions professionnelles sont demandés à plusieurs fournisseurs. Ce que chacun dit est conservé. Si au moins deux sources disent la même chose, la valeur est confirmée. Si une seule source la donne, elle est enregistrée comme non recoupée. Si les sources divergent, la majorité l’emporte. Si rien ne permet de trancher, rien n’est publié.
Une version ne remplace l’autre que si tout passe
Le site est reconstruit trois fois par jour, à 6 h 15, 12 h 15 et 18 h 15. La nouvelle version n’est mise en ligne que si ses contrôles passent : volumes de données en base, nombre de pages produites, titres uniques, adresses canoniques. Sinon, la version précédente reste en ligne.
Ce contrôle porte sur le nombre et la forme des pages, pas sur le sens des textes.
