September 2nd, 2020

Modèles NLP avec BERT

RSS icon RSS Category: Driverless AI, NLP

H2O Driverless AI 1.9 vient de sortir, et je vous propose une série d’articles sur les dernières fonctionnalités innovantes de cette solution d’Automated Machine Learning, en commençant par l’implémentation de BERT pour les tâches NLP

BERT, ou “Bidirectional Encoder Representations from Transformers” est considéré aujourd’hui comme l’état de l’art sur une série de tâches de traitement du langage naturel.

Nos experts NLP Sudalai Rajkumar (SRK)Maximilian Jeblick et Trushant Kalyanpur ont travaillé dur pour implémenter BERT dans la dernière version de DriverlessAI, ce qui permet aux data scientists d’utiliser les techniques NLP à l’état de l’art, avec une variété de modèles et de transformers BERT, directement ‘out-of-the-box’.

Sur cet exemple, ‘airline sentiment’, jeu de données Kaggle bien connu où il s’agit de déterminer le sentiment d’un tweet, négatif, neutre ou positif, les résultats parlent d’eux-mêmes : en utilisant les techniques TF-IDF, puis en utilisant les transformers natifs TensorFlow, et enfin en utilisant BERT, le score ‘logloss’ sur le jeu de test passe de 0.6093 à 0.4066 (plus le score est bas, plus précis est le modèle)

Notons la disponibilité de plusieurs modèles BERT, dont ‘DistilBERT’, plus léger et plus rapide et presque aussi performant, ou encore le modèle ‘camemBERT’ (si si !), pré-entrainé sur un corpus en français.

BERT vient compléter le scope de DriverlessAI en termes de NLP, qui utilisait déjà nativement TensorFlow et des modèles pré-entrainés pour extraire des features numériques à partir des données texte.

Et comme toujours avec DriverlessAI, les utilisateurs peuvent pousser les modèles en production simplement en utilisant les Mojo C++ ou Python, générés par la plateforme.

Pour plus d’informations sur le NLP avec Driverless AI, je vous invite à suivre ce webinar avec SRK, Trushant Kalyanpur et Maximilian Jeblick

About the Author

Badr Chentouf

Leave a Reply

AI-Driven Predictive Maintenance with H2O Hybrid Cloud

According to a study conducted by Wall Street Journal, unplanned downtime costs industrial manufacturers an

August 2, 2021 - by Parul Pandey
What are we buying today?

Note: this is a guest blog post by Shrinidhi Narasimhan. It’s 2021 and recommendation engines are

July 5, 2021 - by Rohan Rao
The Emergence of Automated Machine Learning in Industry

This post was originally published by K-Tech, Centre of Excellence for Data Science and AI,

June 30, 2021 - by Parul Pandey
What does it take to win a Kaggle competition? Let’s hear it from the winner himself.

In this series of interviews, I present the stories of established Data Scientists and Kaggle

June 14, 2021 - by Parul Pandey
Snowflake on H2O.ai
H2O Integrates with Snowflake Snowpark/Java UDFs: How to better leverage the Snowflake Data Marketplace and deploy In-Database

One of the goals of machine learning is to find unknown predictive features, even hidden

June 9, 2021 - by Eric Gudgion
Getting the best out of H2O.ai’s academic program

“H2O.ai provides impressively scalable implementations of many of the important machine learning tools in a

May 19, 2021 - by Ana Visneski and Jo-Fai Chow

Start your 14-day free trial today