Purpose

Paperoni is a database for Mila's publications, developed in-house. As a sizable research organization, Mila needs to track and analyze the papers its researchers publish for various reasons:

  • Broadcast the achievements of our researchers on various platforms
  • Keep partners and stakeholders informed about latest Mila research
  • Help connect researchers with partners and with each other based on their existing research
  • Compute KPIs to report to stakeholders and maintain funding
  • Anticipate future demands (e.g. quantity of compute) based on past trends

Contact: questions, reports or feedback should sent to publications@mila.quebec via email.

How it works

  • Automated collection
    • Every week, an automated process collects publications from various sources and places them in a validation queue.
    • An employee validates the queue, starting from the most recent acquisitions, for inclusion in the database.
  • Manual curation
    • The automated process cannot be exhaustive or error-free. It often runs into breakages due to changes or bugs in the sources. Errors can be corrected in Paperoni by the researchers themselves, who are encouraged to check in regularly to make sure that their work is properly represented.
    • Any suggested fixes go through manual validation, to prevent user mistakes or possible abuse.

How are papers collected?

We use two master lists to gather candidates:

  • The list of Mila-affiliated professors (available on the website)
  • Mila-specific affiliations (various wordings for Mila)

Sources that allow search by author or affiliation are queried for each author/affiliation in the list. Some other sources, such as some conference-specific lists, are fetched wholesale.

Each candidate paper is then scored:

  • 10 points for each "Mila" affiliation in the data (note: affiliations are often missing at this stage)
  • 3 points for each Mila professor
  • 1 point for various Mila researchers whose names and a Mila affiliation we found in at least two other validated papers
  • 1 point for Mila-adjacent affiliations:
    • Université de Montréal
    • McGill University
    • HEC Montréal
    • Polytechnique Montréal
    • Concordia University

The candidates are ordered in decreasing score, then "refined" using various auxiliary sources that may give us more data. Papers for which we can find a PDF are downloaded and fed through an LLM to read researcher affiliations directly from the paper.

What are the sources used for collection?

Here are our primary sources, used to find papers:

  1. Aggregators: These sources index many papers from many domains
    • Semantic Scholar: indexes the space pretty exhaustively, but author names are abbreviated and the affiliation information is spotty.
    • OpenAlex: a newcomer which also appears to be fairly exhaustive. Good data quality in general.
  2. Conference-specific sources
    • OpenReview: used by many important conferences for peer review, for instance accepted papers at NeurIPS, ICML, ICLR are there.
    • MiniConf: software used by several major conferences (NeurIPS, ICLR, ICML, etc.) which keeps information about accepted papers in a handy JSON file.
    • PMLR/JMLR: proceedings for many relevant conferences can be found online in a structured-enough format.

Here are our secondary sources, used to get more information about the papers we found:

  • CrossRef: A repository of metadata about papers, indexed using their Digital Object Identifier or DOI.
  • DataCite: Another DOI-indexed repository, which has information about arXiv papers.
  • Unpaywall: Another DOI-indexed repository, well-curated.
  • bioRxiv: For papers published on bioRxiv.
  • DBLP: Repository of computer science papers.
  • Pubmed: Repository of papers related to medical sciences.
  • LLM analysis: When PDF links are available, the PDFs are fed into Gemini to gather affiliation data (which is, unfortunately, scarcely found in metadata, and not always accurate).

About missing papers and errors

The automatic collection process is unfortunately (but unsurprisingly) imperfect. If you see papers missing, or wrong information, we invite you to update the data yourself. Nonetheless, for your understanding, here are some of our recurring issues:

Papers without professors: We use a list of professors to auto-populate the database, not a list of all Mila members. This is a pragmatic measure to minimize the number of requests to the primary sources, but it does mean we miss out on certain papers where e.g. the senior author is staff or postdoc. We do want these papers in our database, so please add missing papers!

Indexing delays: There are necessarily delays between the moment a paper is accepted, the moment the acceptance is made public, and the moment the metadata for that paper is indexed somewhere we can find it. This delay can be weeks, sometimes months.

Poorly-indexed conferences: Many machine learning conferences simply aren't indexed on the main aggregators. The accepted papers often don't have DOIs. We'll usually find them if they are on arXiv, but associating them to a peer reviewed publication can be tricky.

Poorly-indexed workshops: This is even more common. There is no systemic way to get information about workshop-accepted papers. Sometimes they will be publicly viewable on OpenReview. Sometimes not.

Date confusion: Papers often have multiple associated dates: date of preprint, submission date, date of online publication, date of print publication, etc. In Paperoni, we try to store a date for each event (which we call a "release"), but even for a specific event it's not always easy to tell which date is the correct one, and some aggregators (cough Semantic Scholar) only keep the earliest of these dates, leading to confusion.

Date vagueness: Sometimes, all we have to work with is the publication year. We represent that internally as a "date precision" (day, month or year), but in practice these papers are pigeonholed on January 1st.

Aliasing: Venues and affiliations are not always listed under the same name. We have a normalization system to try to harmonize them for easy searching, but it doesn't always work properly.

Homonyms: Some researchers have homonyms, sometimes literally dozens, sometimes in a related field. This makes it tricky to match papers just by name. This is a big reason why we try hard to get affiliation data, and use a scoring system.

And so on, please tell us about any odd issues you encounter.

Source code?

Here you go. (This does not include configuration, which is currently in a private repository.)

Objectif

Paperoni est une base de données des publications de Mila, développée à l'interne. En tant qu'organisation de recherche de taille importante, Mila doit suivre et analyser les articles publiés par ses chercheurs pour diverses raisons :

  • Faire connaître les réalisations de nos chercheurs sur différentes plateformes
  • Tenir les partenaires et les parties prenantes informés des dernières recherches de Mila
  • Aider à mettre en relation les chercheurs avec des partenaires et entre eux, en fonction de leurs travaux existants
  • Calculer des indicateurs de performance (KPI) à communiquer aux parties prenantes et pour le maintien du financement
  • Anticiper les besoins futurs (par exemple, la quantité de calcul) en fonction des tendances passées

Contact : veuillez envoyer vos questions, signalements ou commentaires à publications@mila.quebec par courriel.

Fonctionnement

  • Collecte automatisée
    • Chaque semaine, un processus automatisé recueille les publications provenant de diverses sources et les place dans une file d'attente de validation.
    • Un employé valide la file d'attente, en commençant par les acquisitions les plus récentes, pour inclusion dans la base de données.
  • Curation manuelle
    • Le processus automatisé ne peut pas être exhaustif ni exempt d'erreurs. Il rencontre souvent des bris causés par des changements ou des bogues dans les sources. Les erreurs peuvent être corrigées dans Paperoni par les chercheurs eux-mêmes, qui sont encouragés à vérifier régulièrement que leurs travaux sont bien représentés.
    • Toute correction suggérée passe par une validation manuelle, afin de prévenir les erreurs des utilisateurs ou les abus potentiels.

Comment les articles sont-ils recueillis?

Nous utilisons deux listes maîtresses pour rassembler les candidats :

  • La liste des professeurs affiliés à Mila (disponible sur le site web)
  • Les affiliations propres à Mila (diverses formulations pour désigner Mila)

Les sources qui permettent une recherche par auteur ou par affiliation sont interrogées pour chaque auteur ou affiliation de la liste. Certaines autres sources, comme des listes propres à des conférences, sont récupérées en bloc.

Chaque article candidat est ensuite évalué selon des critères simples :

  • 10 points pour chaque affiliation « Mila » présente dans les données (à noter : les affiliations sont souvent manquantes à ce stade)
  • 3 points pour chaque professeur de Mila
  • 1 point pour divers chercheurs de Mila dont nous avons trouvé le nom et une affiliation Mila dans au moins deux autres articles validés
  • 1 point pour les affiliations proches de Mila :
    • Université de Montréal
    • Université McGill
    • HEC Montréal
    • Polytechnique Montréal
    • Université Concordia

Les candidats sont classés par ordre décroissant de score, puis « raffinés » à l'aide de diverses sources auxiliaires susceptibles de fournir davantage de données. Les articles pour lesquels nous trouvons un PDF sont téléchargés et soumis à un modèle de langage (LLM) afin de lire directement les affiliations des chercheurs dans l'article.

Quelles sont les sources utilisées pour la collecte?

Voici nos sources principales, utilisées pour trouver les articles :

  1. Agrégateurs : ces sources indexent de nombreux articles dans de nombreux domaines
    • Semantic Scholar : indexe l'espace de façon assez exhaustive, mais les noms des auteurs sont abrégés et l'information sur les affiliations est inégale.
    • OpenAlex : un nouveau venu qui semble également assez exhaustif. Généralement de bonne qualité.
  2. Sources propres aux conférences
    • OpenReview : utilisé par de nombreuses conférences importantes pour l'évaluation par les pairs; on y trouve, par exemple, les articles acceptés à NeurIPS, ICML et ICLR.
    • MiniConf : logiciel utilisé par plusieurs grandes conférences (NeurIPS, ICLR, ICML, etc.) qui conserve l'information sur les articles acceptés dans un fichier JSON pratique.
    • PMLR/JMLR : les actes de nombreuses conférences pertinentes peuvent être trouvés en ligne dans un format suffisamment structuré.

Voici nos sources secondaires, utilisées pour obtenir davantage d'information sur les articles trouvés :

  • CrossRef : un répertoire de métadonnées sur les articles, indexé par leur identifiant numérique d'objet (DOI).
  • DataCite : un autre répertoire indexé par DOI, qui contient de l'information sur les articles arXiv.
  • Unpaywall : un autre répertoire indexé par DOI, bien tenu à jour.
  • bioRxiv : pour les articles publiés sur bioRxiv.
  • DBLP : répertoire d'articles en informatique.
  • Pubmed : répertoire d'articles liés aux sciences médicales.
  • Analyse par LLM : lorsque des liens PDF sont disponibles, les PDF sont soumis à Gemini pour en extraire les données d'affiliation (qui, malheureusement, se trouvent rarement dans les métadonnées, et pas toujours de façon exacte).

À propos des articles manquants et des erreurs

Le processus de collecte automatique est malheureusement (mais sans surprise) imparfait. Si vous constatez que des articles sont manquants ou que des informations sont erronées, nous vous invitons à mettre à jour les données vous-même. Néanmoins, pour votre information, voici certains de nos problèmes récurrents :

Articles sans professeur : nous utilisons une liste de professeurs pour peupler automatiquement la base de données, et non une liste de tous les membres de Mila. Il s'agit d'une mesure pragmatique visant à minimiser le nombre de requêtes aux sources primaires, mais cela signifie que nous passons à côté de certains articles où, par exemple, l'auteur principal est un membre du personnel ou un postdoctorant. Nous voulons bel et bien ces articles dans notre base de données, alors n'hésitez pas à ajouter les articles manquants!

Délais d'indexation : il existe nécessairement des délais entre le moment où un article est accepté, le moment où l'acceptation est rendue publique et le moment où les métadonnées de cet article sont indexées quelque part où nous pouvons les trouver. Ce délai peut être de quelques semaines, parfois de quelques mois.

Conférences mal indexées : de nombreuses conférences en apprentissage automatique ne sont tout simplement pas indexées dans les principaux agrégateurs. Les articles acceptés n'ont souvent pas de DOI. Nous les trouvons habituellement s'ils sont sur arXiv, mais les associer à une publication évaluée par les pairs peut être délicat.

Ateliers mal indexés : ce cas est encore plus fréquent. Il n'existe aucune façon systématique d'obtenir de l'information sur les articles acceptés dans les ateliers (workshops). Parfois, ils sont visibles publiquement sur OpenReview. Parfois non.

Confusion des dates : les articles ont souvent plusieurs dates associées : date de prépublication, date de soumission, date de publication en ligne, date de publication imprimée, etc. Dans Paperoni, nous essayons de stocker une date pour chaque événement (que nous appelons une « publication » ou « release »), mais même pour un événement précis, il n'est pas toujours facile de déterminer quelle est la bonne date, et certains agrégateurs (ahem Semantic Scholar) ne conservent que la plus ancienne de ces dates, ce qui entraîne de la confusion.

Imprécision des dates : parfois, la seule information dont nous disposons est l'année de publication. Nous représentons cela à l'interne par une « précision de date » (jour, mois ou année), mais en pratique, ces articles se retrouvent classés au 1er janvier.

Alias : les lieux de publication (« venues ») et les affiliations ne sont pas toujours désignés sous le même nom. Nous disposons d'un système de normalisation pour tenter de les harmoniser afin de faciliter la recherche, mais il ne fonctionne pas toujours correctement.

Homonymes : certains chercheurs ont des homonymes, parfois littéralement des dizaines, parfois dans un domaine connexe. Cela complique l'association des articles par simple nom. C'est une des raisons principales pour lesquelles nous nous efforçons d'obtenir les données d'affiliation et utilisons un système de pointage.

Et ainsi de suite, veuillez nous informer de tout autre problème que vous encontrez.

Code source?

Le voici. (Ceci n'inclut pas la configuration, qui se trouve actuellement dans un dépôt privé.)