Il y a une manière de chercher sur le net qui consiste à taper trois mots et à prendre ce que l’algorithme veut bien remonter. Et il y en a une autre, plus lente, qui consiste à ouvrir des armoires.
Les armoires existent. Des millions de films éphémères déposés chez archive.org, des milliers de livres tombés dans le domaine public, des enregistrements de terrain déposés par des gens qui se sont levés à cinq heures pour capter la pluie sur une tôle. Tout ça est là, en accès libre, et presque personne n’y va — parce qu’il faut connaître chaque armoire, son adresse, sa manière de ranger.
J’ai écrit un outil qui les ouvre toutes depuis la même barre. Ce texte parle surtout de ce que j’y ai trouvé en les ouvrant, pas du code.
Six fonds, six logiques de rangement
archive.org pour les films et l’audio, avec ses collections — Prelinger et ses films industriels, la radio vintage, la télé classique. Gutenberg pour les livres du domaine public. Wikimedia Commons pour les images. LibriVox pour les livres lus par des bénévoles. Freesound pour les bruitages et les prises de terrain. Et la Library of Congress.
Six fonds, et aucun ne range pareil. Ce n’est pas un défaut : chacun a été construit par des gens différents, à des époques différentes, pour des usages qui n’étaient pas le mien.
LibriVox ne cherche que par préfixe de titre. Pas de plein texte. Si le livre ne commence pas par ce que vous tapez, il n’existe pas. Freesound ne connaît que des sons, donc le filtre par type n’a aucun sens chez lui. archive.org accepte des tris, des collections, des bornes de date — c’est le seul qui ressemble vraiment à une base de données.
Celle qui refuse d’ouvrir aux machines
La Library of Congress est la plus belle armoire des six, et je ne peux pas l’ouvrir.
Leur site entier est derrière un défi JavaScript. Un navigateur le passe sans rien faire — vous ne le voyez même pas. Un programme reçoit 403 sur tout, y compris sur leur propre page de documentation d’API. L’institution qui archive la mémoire sonore des États-Unis publie une API dont la documentation est inaccessible à un programme.
J’aurais pu bricoler un contournement. J’ai choisi d’assumer : dans l’outil, cette source ouvre simplement leur site dans un onglet. Pas de résultats intégrés, pas de panier, pas de lecteur. Les résultats vivent chez eux, et c’est dit.
Faire semblant d’intégrer une source qu’on n’intègre pas, c’est mentir à l’usager six mois plus tard, quand il cherchera pourquoi cette source ne rend jamais rien.
Les tiroirs qui coincent
Gutendex — l’API de Gutenberg — met entre quinze et trente secondes à répondre quand elle est chargée. Mon délai d’attente était de dix secondes pour toutes les sources. Résultat : l’outil déclarait Gutenberg mort alors qu’il était simplement en train de travailler.
Pire, quand il est surchargé, il ne renvoie pas une erreur propre mais une page HTML. Le code tentait de la lire comme du JSON et affichait Expecting value: line 1 column 1 — un message qui ressemble à un bug chez moi alors que le problème est à trois mille kilomètres.
J’ai donc un délai par source : trente secondes pour Gutenberg seulement. L’allonger partout ferait patienter une minute sur une vraie coupure d’archive.org. Et le message dit maintenant ce qui se passe : leur service est lent ou indisponible, réessaie plus tard.
Une armoire ancienne a des tiroirs qui coincent. On ne répare pas le tiroir : on apprend à tirer plus longtemps, et on prévient celui qui vient après.
Ce que les étiquettes racontent malgré elles
En construisant les suggestions de recherche — des mots-clés dérivés des résultats eux-mêmes, sans aucun service tiers — j’ai dû regarder ce que ces fonds écrivent vraiment dans leurs champs.
Chez archive.org, les propositions remontaient systématiquement 00am, 01am, 30am. Ce sont des horodatages de conduite d’antenne, restés collés dans les descriptions de milliers d’enregistrements radio. Personne ne les a nettoyés. Ils sont la trace du moment où quelqu’un a noté à quelle heure la bande partait.
Chez Freesound, un titre sur trois finit par .wav. Les gens déposent leur fichier et gardent le nom du fichier comme titre. Mon téléchargeur écrivait donc fidèlement pluie.wav.mp3.
Ces scories ne sont pas des erreurs à corriger. Ce sont des couches de sédiment. On y lit comment les gens travaillaient : une console de radio, un enregistreur de terrain, une habitude de nommage. L’outil les filtre pour ne pas noyer les suggestions — mais il garde 16mm et super8, qui ressemblent à du bruit et qui sont de vrais termes de recherche pour un fonds film.
La moitié des armoires n’ont pas de poignée
Le plus instructif est venu du téléchargement groupé. On coche ce qu’on veut dans un panier, on choisit un dossier, tout se range.
Sauf que deux sources sur six donnent réellement un fichier. archive.org et Freesound. Les autres — Gutenberg, Wikimedia, LibriVox — renvoient une page web. Une étiquette qui pointe vers une étagère, pas l’objet.
J’ai d’abord trouvé ça gênant, puis j’ai compris que c’était l’information principale. Ces fonds ont été pensés pour être consultés, pas moissonnés. Leur unité n’est pas le fichier, c’est la notice. Un outil qui prétendrait tout télécharger raconterait une histoire fausse sur ce qu’est une archive.
Donc le panier le dit : ces éléments sont ignorés, nommément, avec la raison. Un lot de douze qui rend trois fichiers sans explication passerait pour une panne. Avec l’explication, c’est une leçon sur le fonds.
Freesound, lui, ne livre que la prévisualisation en mp3 : le fichier d’origine demande une authentification plus lourde. On repart donc avec une copie d’écoute, pas le master. C’est utilisable, et il faut le savoir avant de bâtir quoi que ce soit dessus.
Ce que ça change pour Robotariis
Cet univers se nourrit de matière trouvée. Des nappes d’un film industriel de 1954, une voix de bénévole sur un texte de Verne, une pluie enregistrée à Bangkok par quelqu’un dont je ne saurai jamais rien.
Ce qui manquait n’était pas l’accès — tout est public. C’était la patience. Ouvrir six onglets, apprendre six syntaxes, perdre le lien trouvé la semaine dernière parce qu’il était dans l’historique d’une autre machine.
Le panier et les favoris vivent donc sur le serveur, pas dans le navigateur. Une trouvaille faite sur le portable le soir est là sur la machine du studio le lendemain. C’est bête, et c’est précisément ce qui fait la différence entre fouiller une armoire et se contenter de savoir qu’elle existe.
L’outil tourne sur mon réseau, pas en ligne. Le code est libre : github.com/obareau/archive-search.