Autonome Web-Automatisierung mit LLMs: Komplexe Workflows mit Browser-use & Playwright AI automatisieren

Herkömmliche Testskripte mit Selenium oder Playwright brechen sofort ab, wenn sich CSS-Klassen oder DOM-IDs ändern.
Browser-use kombiniert Multimodal Vision LLMs (Claude 3.5 Sonnet, GPT-4o) mit Playwright-Browserinstanzen zu autonomen Web-Agenten, die Webseiten visuell wie ein menschlicher Benutzer bedienen.
Wichtige Erkenntnisse
- Visuelle Elemente ohne Selektoren: Markiert interaktive Elemente mit nummerierten Boxen für 100 % absichtsbasierte Klicks.
- CDP-Sitzungswiederverwendung: Verknüpft bestehende Chrome-Profile über CDP, um Logins und 2FA-Abfragen zu überspringen.
- Selbstheilung: Agenten analysieren Fehler oder Popups selbstständig und versuchen alternative Wege.
Python-Beispiel
import asyncio
from langchain_anthropic import ChatAnthropic
from browser_use import Agent, Browser, BrowserConfig
async def run_market_research():
browser = Browser(config=BrowserConfig(headless=False))
llm = ChatAnthropic(model_name="claude-3-5-sonnet-20241022")
agent = Agent(
task="""
1. Öffne https://news.ycombinator.com
2. Suche die Top 3 Artikel zu 'AI agent' und extrahiere Titel und URL.
3. Gib das Ergebnis als JSON zurück.
""",
llm=llm,
browser=browser,
)
result = await agent.run(max_steps=15)
print(result)
await browser.close()
if __name__ == "__main__":
asyncio.run(run_market_research())
Fazit
Die Kombination aus Browser-use und Playwright AI macht fragile Selektor-Skripte überflüssig und ermöglicht eine extrem robuste KI-RPA-Infrastruktur.