Unterstützte Dateiformate¶
Die folgende Tabelle zeigt alle Dateiformate, die in die Plattform hochgeladen und vom Wissensassistenten verarbeitet werden können.
Übersicht¶
| Kategorie | Format | Endung | Hinweise |
|---|---|---|---|
| Dokumente | .pdf |
Muss textbasiert sein (nicht gescannt) | |
| Word | .docx |
Empfohlenes Format für Textdokumente | |
| Tabellen | Excel | .xlsx, .xls |
Tabellen werden als Text dargestellt |
| CSV | .csv |
Komma- oder Semikolon-getrennt | |
| TSV | .tsv |
Tab-getrennt | |
| Präsentationen | PowerPoint | .pptx, .ppt |
Text aus Folien wird extrahiert |
| Text | Plaintext | .txt |
|
| Markdown | .md, .markdown |
||
| reStructuredText | .rst |
||
| LaTeX | .tex |
||
| Log-Dateien | .log |
||
| Web | HTML | .html, .htm |
Text wird aus HTML-Tags extrahiert |
| Strukturiert | JSON | .json |
|
| YAML | .yaml, .yml |
||
| XML | .xml |
||
| Templates | Jinja | .j2, .jinja, .jinja2 |
Was wird nicht unterstützt¶
| Format | Grund |
|---|---|
| Gescannte PDFs (Bilder) | Kein OCR — Text kann nicht extrahiert werden |
| Bilddateien (PNG, JPG) | Kein Text extrahierbar |
| Videodateien | Nicht verarbeitbar |
| Passwortgeschützte Dateien | Können nicht geöffnet werden |
| ZIP / Archive | Müssen vorher entpackt werden |
Tipp
Wenn Sie gescannte PDFs nutzen müssen, lassen Sie diese vorher durch ein OCR-Tool (z. B. Adobe Acrobat) verarbeiten, um den Text extrahierbar zu machen.