HyperAIHyperAI

Command Palette

Search for a command to run...

MsrTextCompression : Compression De Phrases Abstractive

Date

Organisation

Microsoft Research

Licence

Other

Balises

MsrTextCompression est un ensemble de données publié par Microsoft Research en 2016 pour l'évaluation du résumé et de la compression de phrases et de courts paragraphes, conçu pour fournir un corpus standard contenant des textes compressés et leurs évaluations de qualité afin de promouvoir le développement des technologies de résumé automatique.

Cet ensemble de données contient environ 6 000 textes sources provenant de l'Open American National Corpus (OANC1), soit environ 26 000 paires de textes sources et de textes compressés, couvrant des domaines tels que l'actualité, les lettres commerciales, les revues et les documents techniques. Chaque texte source est accompagné d'au plus cinq versions compressées générées par des travailleurs participatifs, ainsi que de scores de qualité concernant la préservation du sens et la correction grammaticale.

Composition de l'ensemble de données

Cet ensemble de données est divisé en trois parties :

  • Ensemble d'entraînement (train) : contient 4 936 échantillons, avec une taille de données d'environ 5 Mo.
  • Ensemble de validation (validation) : contient 447 échantillons, avec une taille de données d'environ 449 Ko.
  • Ensemble de test (test) : contient 785 échantillons, avec une taille de données d'environ 804 Ko.

Chaque enregistrement de données contient les champs suivants :

  • source_id : l'index du texte original dans l'ensemble de données d'origine.
  • domain : la classification du domaine du texte source (par exemple, Newswire).
  • source_text : le texte original non compressé.
  • targets : une liste contenant les résultats de compression et les informations d'évaluation associées, chaque élément correspondant à une version compressée :
  • compressed_text : le texte après compression.
  • judge_id : l'ID anonyme du travailleur participatif ayant fourni cette version compressée.
  • num_ratings : le nombre de notes reçues pour cette version compressée.
  • ratings : la liste spécifique des notes, basée sur des critères de préservation du sens et de correction grammaticale (par exemple, 6 représente un sens le plus important et une grammaire parfaite, 24 représente un sens très réduit et une grammaire confuse).

Citation```bibtex

@inproceedings{Toutanova2016ADA, title={A Dataset and Evaluation Metrics for Abstractive Compression of Sentences and Short Paragraphs}, author={Kristina Toutanova and Chris Brockett and Ke M. Tran and Saleema Amershi}, booktitle={EMNLP}, year={2016} }

Créer de l'IA avec l'IA

De l'idée au lancement — accélérez votre développement IA avec le co-codage IA gratuit, un environnement prêt à l'emploi et le meilleur prix pour les GPU.

Codage assisté par IA
GPU prêts à l’emploi
Tarifs les plus avantageux

HyperAI Newsletters

Abonnez-vous à nos dernières mises à jour
Nous vous enverrons les dernières mises à jour de la semaine dans votre boîte de réception à neuf heures chaque lundi matin
Propulsé par MailChimp