Convierte documentos HTML, contenido de sitios web o exportaciones de CMS a formato Markdown limpio. Útil para migrar contenido de una plataforma a otra, archivar páginas web como texto plano o extraer contenido para editarlo en un editor Markdown. La biblioteca turndown convierte encabezados, párrafos, listas, enlaces, imágenes, bloques de código y tablas mientras elimina las etiquetas HTML innecesarias.
Pega tu HTML
Pega código fuente HTML, una sección de página web, una plantilla de correo o HTML exportado de un CMS. Funcionan tanto documentos HTML completos como fragmentos HTML (sin doctype).
Haz clic en Convertir
turndown analiza el HTML y convierte los elementos semánticos a Markdown: <h1> → # Encabezado, <strong> → **negrita**, <a href="..."> → [texto](url), <ul><li> → - elemento, <code> → `código`.
Revisa el Markdown
Los diseños HTML complejos (varias columnas, tablas anidadas) pueden no convertirse a la perfección: revisa la salida y ajústala manualmente. El contenido sencillo como artículos, entradas de blog y documentación se convierte de forma limpia.
Copia o descarga
Copia el Markdown para pegarlo en un editor Markdown como Obsidian, Notion o Bear, o descárgalo como archivo .md.
Todos los elementos de documento estándar: encabezados (h1–h6), párrafos, negrita/cursiva/tachado, enlaces (con atributos title), imágenes, listas ordenadas y desordenadas, listas anidadas, citas, código en línea, bloques de código delimitados, líneas horizontales y tablas. Los elementos de maquetación como div y span se tratan como contenedores de bloque/en línea y su contenido se extrae sin las etiquetas.
El soporte de tablas en Markdown requiere que cada fila tenga el mismo número de columnas, y las tablas anidadas no se pueden expresar en Markdown. Si el HTML de origen tiene celdas combinadas (colspan/rowspan), tablas anidadas complejas o un número de columnas inconsistente, la conversión será imperfecta. Las tablas de datos sencillas con columnas consistentes se convierten de forma limpia.
Sí, pero la salida incluirá menús de navegación, pies de página, barras laterales y otro HTML que no es contenido y que tendrás que eliminar manualmente. Para extraer solo el contenido del artículo de una página web, es mejor copiar el HTML del área de contenido principal (inspeccionar elemento → copiar el HTML externo del elemento article o main) en lugar del código fuente de la página completa.
Los estilos CSS en línea (font-weight: bold, font-style: italic) no se convierten a equivalentes de Markdown: Markdown no tiene un concepto de CSS arbitrario. Solo las etiquetas HTML semánticas (<strong>, <em>, <b>, <i>) se convierten de forma fiable. Para el HTML exportado de un CMS que usa clases en lugar de etiquetas semánticas para el formato, la información de estilo se pierde.
turndown convierte los elementos HTML semánticos. Los elementos no semánticos o desconocidos (componentes web personalizados, etiquetas script/style, elementos SVG) se mantienen como HTML sin procesar en la salida Markdown (lo cual es válido: Markdown permite HTML sin procesar). Si quieres texto verdaderamente plano sin nada de HTML, elimina manualmente los bloques de HTML sin procesar tras la conversión.
¿Algo no funciona? Informar de un error