Firecrawl — Die Kontext-API für KI-Agenten im Web
KI-Agenten sind nur so gut wie die Daten, auf die sie zugreifen können. Das Web ist die größte lebende Datenquelle überhaupt — aber es wurde für Menschen gebaut, nicht für Maschinen. Firecrawl schließt diese Lücke. Es wandelt chaotische, dynamische Websites in sauberes Markdown oder strukturiertes JSON um, das ein Sprachmodell verwerten kann.
Was Firecrawl ist
Firecrawl ist eine API-Plattform, die drei Kernfunktionen für KI-Anwendungen bereitstellt: Search, Scrape und Interact. Sie wird von über 1,25 Millionen Entwicklern und 150.000 Unternehmen genutzt, darunter Shopify, Apple, Canva und Replit. Das Projekt ist Open Source und hat über 163.600 GitHub-Stars.
Die drei Kernfunktionen lassen sich als zusammenhängender Arbeitsfluss verstehen: Zuerst sucht man im Web nach relevanten Seiten (Search), dann extrahiert man den Inhalt einer konkreten URL (Scrape), und wenn die Seite Interaktion erfordert — etwa ein Login, eine Suchanfrage oder das Durchklicken von Paginierung —, übernimmt das der Interact-Modus.
Search braucht keine URL — man gibt eine Suchanfrage ein und bekommt Treffer mit vollständigen Seiteninhalten zurück. Scrape braucht eine konkrete URL und liefert deren Inhalt als Markdown, HTML, JSON oder Screenshot. Wer keine URL hat, startet mit Search. Wer eine hat, nimmt Scrape.
Wofür wir Firecrawl nutzen
In unserer Umgebung läuft Firecrawl als MCP-Server direkt im KI-Agenten. Das bedeutet: Der Agent kann Firecrawl-Werkzeuge aufrufen, ohne die API manuell anzusprechen — die Tools erscheinen als normale Werkzeuge im Agenten-Toolkit.
Die konkreten Anwendungsfälle:
- Recherche für Artikel und Blogposts: Statt manuell mehrere Webseiten zu öffnen, kann der Agent mit einem Suchaufruf relevante Quellen finden und deren Inhalt als Markdown weiterverarbeiten.
- Dokumentenextraktion: Firecrawl parst PDFs, DOCX-Dateien und andere Dokumentformate aus dem Web und liefert sauberes Markdown zurück.
- Website-Überwachung: Der Monitor-Endpunkt prüft wiederkehrend Seiten auf Änderungen und benachrichtigt per Webhook, E-Mail oder Slack.
- Forschungsindex: Der Research-Endpunkt durchsucht wissenschaftliche Paper und GitHub-Issues, -PRs und -READMEs.
Wie ein Agent Firecrawl nutzt
Die Integration erfolgt über den Model Context Protocol (MCP). Nach einem Neustart des Agenten stehen 27 Firecrawl-MCP-Tools automatisch zur Verfügung. Der Agent braucht keine weiteren Anweisungen — er kann die Tools wie jedes andere Werkzeug aufrufen.
firecrawl_search
Websuche mit vollständigen Seiteninhalten in den Treffern — 2 Credits pro 10 Ergebnisse.
firecrawl_scrape
Inhalt einer URL als Markdown/HTML/JSON extrahieren — 1 Credit pro Seite.
firecrawl_crawl
Eine ganze Website rekursiv durchsuchen und extrahieren — 1 Credit pro Seite.
Was Firecrawl von klassischen Scraping-Tools unterscheidet
Klassische Scraping-Bibliotheken wie BeautifulSoup, Scrapy oder Puppeteer erfordern, dass der Entwickler sich um Proxy-Management, JavaScript-Rendering, Anti-Bot-Mechanismen und Inhaltsbereinigung kümmert. Firecrawl übernimmt all das:
- Proxy-Management: Eigene Proxys, automatische Blockaden-Umgehung, Stealth-Modus für anspruchsvolle Fälle.
- JavaScript-Rendering: Dynamische Single-Page-Applications werden vollständig gerendert.
- Inhaltsbereinigung: Navigation, Footer und Werbung werden entfernt — 93% weniger Input-Tokens.
- Smart Wait: Automatische Erkennung, wann eine Seite fertig geladen ist.
- Dokumentenparsing: PDFs, DOCX, ODT, RTF, XLSX und HTML werden automatisch erkannt.
Kostenbewusster Einsatz im Free-Plan
Mit 1.000 Credits pro Monat ist sparsame Nutzung angesagt. Eine einzelne Research-Session mit 10 Scrape- und 5 Search-Aufrufen verbraucht bereits 20 Credits — das sind 2% des Monatsbudgets. Credits rollen nicht in den nächsten Monat über.
Der onlyMainContent-Parameter bei Scrape reduziert die Token-Last im Sprachmodell, kostet aber dieselben Credits. Das maxAge-Parameter steuert, wie alt ein zwischengespeichertes Ergebnis sein darf — mit maxAge: 0 erzwingt man einen Live-Abruf. Für Recherche reicht oft ein höheres maxAge, was Cache-Treffer ermöglicht und Credits spart.
Fazit
Firecrawl schließt die Lücke zwischen KI-Agenten und dem Web. Anstatt HTML manuell zu parsen, Proxy-Listen zu pflegen und JavaScript-Rendering zu debuggen, übergibt man eine URL oder eine Suchanfrage und erhält sauberes Markdown zurück. Die MCP-Integration macht die Werkzeuge für den Agenten zu einem natürlichen Teil seines Toolkits. Im Free-Plan mit 1.000 Credits pro Monat ist Firecrawl für gelegentliche Recherche, Artikelerstellung und Dokumentenextraktion ausreichend.