Dans cette vidéo, on va voir comment extraire des données qui ne sont pas visibles directement en HTML, mais cachées dans une balise "script" sous forme de JSON. C’est une technique puissante pour récupérer des infos qu’on ne pourrait pas avoir autrement, comme ici le SKU produit sur le site racetools.fr 🛠️
📌 Ce que tu vas apprendre :
✔️ Repérer une balise "script" contenant un JSON
✔️ Utiliser BeautifulSoup, httpx et re pour cibler l’info
✔️ Utiliser regex pour isoler le JSON dans la balise
✔️ Charger le JSON avec json.loads()
✔️ Extraire proprement des données (marque, nom, SKU)
✔️ Gérer les erreurs (KeyError, TypeError, AttributeError)
✔️ Ajouter un logging propre pour suivre l'exécution
✔️ Et tout ça, en structure modulaire (fonctions bien organisées)
💡 Un vrai cas pratique :
➡️ Extraction de 50 produits en 3 colonnes : marque, nom, SKU
➡️ Pas besoin d’API ou de headless browser : juste Python et les bonnes méthodes 😉
📌 Liens utiles :
🌍 Site scrappé : https://racetools.fr/collections/perf...
📋 Formateur JSON : https://jsonformatter.org/
📚 Logging Python : https://docs.python.org/3/library/log...
🕒 Format des dates : https://strftime.org/
📥 100 leads B2B offerts : https://scrap.id/s/1xY
📩 Me contacter pour une prestation : [email protected]
🔧 Librairies utilisées :
httpx (remplaçant moderne de requests)
BeautifulSoup
json
re (regex)
logging