markitdown.ai

markitdown.ai - Un convertisseur Markdown pour documents et pages web, transformant PDF, fichiers Office, images et HTML en Markdown prêt pour l'IA

Lancé aujourd'hui

markitdown.ai est un outil de conversion qui transforme les fichiers PDF, DOCX, PPTX, XLSX, les images et les URL de pages web publiques en un Markdown propre et structurellement précis. Il est conçu pour les développeurs d'IA, les équipes de données et les professionnels de la gestion des connaissances qui ont besoin d'un texte de sortie prévisible et faible en bruit pour les pipelines RAG, les workflows LLM et les systèmes d'agents sans nettoyage manuel.

3VuesDonnées IAFreemiumLow-CodeTraitement de DocumentsTraitement du Langage NaturelGrand Modèle de Langage (LLM)Génération Augmentée par Récupération

Fonctionnalités principales

markitdown.ai prend en charge la conversion depuis 7 formats d'entrée et 3 formats de sortie, tous exécutés sur un moteur d'analyse partagé côté serveur qui produit des résultats cohérents quel que soit l'appareil client.

Formats d'entrée pris en charge :

  • PDF : Les PDF à texte natif sont analysés directement, l'ordre de lecture multi-colonnes est reconstruit, les PDF numérisés sont soumis à une OCR automatique

  • DOCX / ancien format DOC : Conserve les titres, listes, tableaux et commentaires des fichiers Word

  • PPTX / ancien format PPT : Convertit les diaporamas diapositive par diapositive, conserve les titres comme des titres de section et les points de puce

  • XLSX / ancien format XLS : Chaque feuille du classeur devient un tableau Markdown sous le nom de sa feuille

  • PNG / JPG : Les captures d'écran et les images numérisées sont traitées par OCR, la compréhension d'image IA optionnelle est accessible aux utilisateurs connectés

  • HTML : Supprime les scripts et les styles, conserve la structure de l'article, les liens et les tableaux depuis les pages web sauvegardées

  • URL : Récupère les pages web publiques côté serveur, bloque les adresses privées et internes pour éviter la fuite de contenus restreints

Formats de sortie inversés pris en charge, qui s'exécutent entièrement localement dans le navigateur sans téléchargement du texte utilisateur :

  • Markdown vers HTML : Génère un HTML sémantique standard avec prise en charge des tableaux GitHub, des listes de tâches et de la coloration syntaxique du code

  • Markdown vers texte brut : Aplatit la structure en un texte non formaté lisible pour les fenêtres de discussion, les tickets de support et les saisies de formulaire

  • Markdown vers PDF : Affiche un aperçu d'impression local que l'utilisateur peut enregistrer à l'aide de la fonction d'impression native de son navigateur

Options de Workflow

Le produit propose trois manières distinctes d'exécuter les conversions, toutes connectées au même compte utilisateur et au solde de crédits partagé :

  1. Application web (navigateur) : Aucune connexion requise pour l'essai anonyme, prend en charge les téléversements de fichiers uniques ou le collage d'URL, avec une limite de taille de fichier de 10 Mo et de 25 pages sur le niveau d'essai gratuit. Les utilisateurs peuvent prévisualiser le Markdown rendu, copier le contenu ou télécharger directement des fichiers .md.

  2. Mode par lots : Pour les utilisateurs d'abonnements payants, il prend en charge le traitement de plusieurs fichiers en une seule exécution, avec le suivi de statut par fichier et une bibliothèque de conversions sauvegardées.

  3. API développeur : Utilise exactement le même pipeline d'analyse que l'interface web. Elle prend en charge la conversion synchrone sous 60 secondes, la conversion asynchrone pour les fichiers plus longs avec notifications de fin par sondage ou webhook, des clés API à portée limitée et des journaux complets d'activité. La référence publique de l'API est disponible à l'adresse /docs/api, et la spécification OpenAPI est accessible directement à l'adresse /v1/openapi.json.

Public cible et cas d'usage

L'outil est conçu pour ces équipes et cas d'usage principaux :

  • Équipes RAG et pipelines IA : Convertir les documents sources avant la segmentation et l'intégration pour éliminer le bruit de mise en page, conserver la hiérarchie des titres et la structure des tableaux, et garantir la cohérence des résultats de récupération sur des milliers de fichiers.

  • Chercheurs et analystes : Convertir les articles académiques, les livres blancs et les diaporamas en un Markdown consultable et modifiable pour éviter la saisie manuelle des tableaux et conserver l'ordre de lecture multi-colonnes correct des PDF denses.

  • Équipes opérationnelles : Traiter les contrats, factures, politiques et documents internes sans nettoyage manuel par copier-coller. L'historique Markdown stocké simplifie la révision, la comparaison et la réutilisation des travaux documentaires récurrents.

  • Équipes d'automatisation pour développeurs : Intégrer la conversion directement dans les tâches d'ingestion, les outils internes et les flux de traitement de documents, avec une sortie prévisible qui s'alimente de manière fiable dans les systèmes CMS, les bases de connaissances et les bots de support.

  • Concepteurs d'agents : Ajouter la conversion Markdown en tant qu'outil pour les agents IA, afin qu'ils puissent traiter les fichiers pris en charge et les URL de pages web publiques sans gérer de logique d'analyse de bas niveau ou d'OCR.

Tarifs et limites d'utilisation

L'essai anonyme sans inscription autorise 3 conversions par heure et 10 conversions par jour, avec une limite de taille de fichier maximale de 10 Mo et 25 pages maximales par fichier. La tarification basée sur des crédits s'applique à tous les abonnements : chaque page de texte standard ou page traitée par OCR coûte 1 crédit, tandis que la compréhension d'image IA facultative coûte 5 crédits par image. Il n'y a aucune différence de coût par page entre un document avec couche de texte et un document numérisé. Les abonnements payants commencent à 20 dollars par mois, et les limites de taille passent à 200 Mo par fichier et 200 pages par fichier sur le plan Pro. Les abonnements payants déverrouillent également le traitement par lots, l'accès à l'API et un historique plus long des sorties de conversion stockées.

Limites importantes

  • La qualité de reconnaissance OCR dépend de la résolution de l'image source : les numérisations à 300 dpi produisent un résultat texte beaucoup plus précis que les photos de téléphone basse résolution.

  • Les adresses web privées et internes sont bloquées pour la conversion d'URL en Markdown afin d'empêcher tout accès non autorisé à des contenus non publics.

  • L'extraction de JSON structuré, la transcription audio et la transcription vidéo sont des fonctionnalités prévues sur la feuille de route, qui ne sont pas encore disponibles en version livrée.

Commentaires

Commentaires

Pas encore de commentaires. Soyez le premier à partager vos impressions !