LLMによる自律型Web自動化: Browser-useとPlaywright AIによる複雑なワークフローの自動化

従来の Selenium や Playwright を用いたWeb自動化スク립トは、DOM要素のIDやCSSクラスが変更されると即座に破損するという課題がありました。
2026年、Browser-use は Multimodal Vision LLM (Claude 3.5 Sonnet, GPT-4o) と Playwright を統合し、人間のようにブラウザを視覚的に認識して自動操作するAIエージェントを実現しました。
要約
- 視覚的バウンディングボックス: 画面上の要素に番号付きボックスをオーバーレイし、CSSセレクターなしで意図ベースのクリック・入力を実行。
- セッション再利用: Playwright CDP経由で既存のChromeプロファイルを読み込み、2FAログイン状態を維持。
- 自己修復: エラーやポップアップが発生しても、エージェントが自律的に理由を分析して再試行。
パイソン実装例
import asyncio
from langchain_anthropic import ChatAnthropic
from browser_use import Agent, Browser, BrowserConfig
async def run_market_research():
browser = Browser(
config=BrowserConfig(
headless=False,
chrome_instance_path="/Applications/Google Chrome.app/Contents/MacOS/Google Chrome"
)
)
llm = ChatAnthropic(model_name="claude-3-5-sonnet-20241022", temperature=0.0)
agent = Agent(
task="""
1. https://news.ycombinator.com にアクセス。
2. 'AI agent' 関連のトップ3記事のタイトル、URL、スコアを取得。
3. 結果をJSONで整理して報告。
""",
llm=llm,
browser=browser,
)
result = await agent.run(max_steps=15)
print(result)
await browser.close()
if __name__ == "__main__":
asyncio.run(run_market_research())
まとめ
Browser-use と Playwright AI の組み合わせにより、壊れやすい従来の自動化スクリプトから脱却し、変化に強い次世代のAI RPAインフラを構築できます。