Pythonのselenium以外でブラウザ操作を行う方法
PythonでWebブラウザの自動操作を行う場合、Seleniumよりも高速で信頼性が高いPlaywrightや、JavaScriptの実行が可能なPyppeteer、静的サイトのデータ取得に適したrequestsとBeautifulSoupの組み合わせなどが主要な選択肢として挙げられます。Playwrightはマイクロソフトが提供するオープンソースのエンドツーエンドテスト自動化フレームワークで、Chromium、Firefox、WebKitといった複数のブラウザエンジンに対応し、自動待機機能も備わっているため、複雑なブラウザ操作でも確実な実行が可能です。
【サンプルコード】
# Playwrightの基本的なブラウザ操作
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.launch(headless=False)
page = browser.new_page()
page.goto('https://example.com')
print(page.title())
browser.close()
Seleniumが依存ライブラリが多く設定が複雑で実行速度が遅いという課題を抱えているのに対し、Playwrightは自動テストコード機能が実装されているため、スキルが高くない方にもテストコードのひな型作成が容易になっています。requestsとBeautifulSoupを使用した方法は静的なWebサイトからのデータ抽出に優れ、HTMLの解析が容易で軽量なアプローチですが、JavaScriptで動的に生成されるコンテンツには対応できません。
PuppeteerのPython移植版であるPyppeteerは、JavaScriptを使用して生成されるSPA(シングルページアプリケーション)などからのデータ取得が可能ですが、Pyppeteerプロジェクトは現在メンテナンス段階で積極的に維持されておらず、最新版の動作に問題があるため、現在は代替手段としてPlaywrightが推奨されています。
PythonのPlaywrightでブラウザを操作する方法
PlaywrightはMicrosoftが2020年に発表したテストツールで、Seleniumなどの従来ツールが抱える制約を克服する目的で開発され、より高速かつ信頼性の高いテスト実行をサポートしています。Playwrightにはブラウザ操作でのコード生成機能が搭載されており、実際のブラウザ操作を記録してコードを自動生成できるため、プログラミング初心者でも容易にブラウザ自動化のコードを作成できます。
【サンプルコード】
# Playwrightのコード自動生成コマンド
playwright codegen https://example.com -o test.py
# 生成されたコードの例
from playwright.sync_api import sync_playwright
with sync_playwright() as p:
browser = p.chromium.launch()
page = browser.new_page()
page.goto("https://example.com")
Playwrightでは要素が存在しないときに自動的に待ってくれる「Auto-waiting機能」があるため、明示的な待機処理を省略してシンプルな記述で高度なブラウザ操作が可能になります。PlaywrightはChromium、Firefox、WebKitの各ブラウザに対応し、ヘッドレスモードや複数のブラウザコンテキストの同時操作もサポートしているため、クロスブラウザテストや並列処理による効率的なテスト実行が行えます。
Playwrightの準備段階では認証が必要なサイトで情報を保存し、次回実行時に読み込んで復元することで再度ログインしなくても認証済の状態にする機能も利用できます。PlayWright Browser ToolkitをLangChainのAgentと組み合わせることで、静的なサイトだけではなく動的にレンダリングされるサイトも操作することが可能になり、より高度な自動化処理を実現できます。
PythonのrequestsとBeautifulSoupでブラウザを操作する方法
requestsはHTTPリクエストを簡単に送信できるライブラリで、BeautifulSoupはHTMLを解析してデータを取得するパーサーライブラリとして連携して使用されます。requestsでHTMLを取得し、Beautiful SoupでHTMLのパース処理を行うのが基本的な使い方で、ブラウザを起動することなく軽量かつ高速にWebページからのデータ取得が可能です。
【サンプルコード】
import requests
from bs4 import BeautifulSoup
url = 'https://example.com'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
titles = soup.find_all('h2')
for title in titles:
print(title.get_text())
requestsはurllib2よりも人が使いやすいように作られたエレガントでシンプルなPythonのHTTPライブラリとして評価されており、Beautiful SoupではCSSセレクターを使えばだいたいの要素の取得には対応でき、findやfind_allメソッドでHTMLタグの検索も可能です。この方法はHTTPリクエストを送信してHTMLデータを取得する静的なサイトのスクレイピングに適しているが、JavaScriptで動的に生成されるコンテンツには対応できないという制限があります。
urllib.request.urlopen関数でファイルを取得してBeautifulSoupオブジェクトを作成することで、Webページの内容を読み込んでデコードする処理を自動的に実行できます。requests.get()でWebページのHTMLを取得し、BeautifulSoupのselect()メソッドやfind_all()メソッドでDOM要素から必要な情報を抽出することによって、ブラウザを起動しない軽量なスクレイピング処理が実現できます。
※上記コンテンツの内容やソースコードはAIで確認・デバッグしておりますが、間違いやエラー、脆弱性などがある場合は、コメントよりご報告いただけますと幸いです。
ITやプログラミングに関するコラム
Gitでブランチ(branch)を作成する方法
crontabの書き方
PDFをExcelに変換する方法
Excelでプルダウンを設定する方法
エクセルでページ区切りを設定する方法
Markdownの取り消し線の書き方
ラズベリーパイでできること9選
Gitでbranch(ブランチ)を削除する方法をローカル・リモート別に解説
git addの取り消し方法を状況別に解説
CSSのstickyプロパティでWebサイトに固定要素を実装する方法
ITやプログラミングに関するニュース
アイアール技術者教育研究所がエクセルギー解析計算ウェビナーを開催、省エネと環境負荷低減に貢献
フラー株式会社がアプリ市場トレンド解説ウェビナーを3月25日に開催、成長アプリの共通項とデータ活用を解説
株式会社BOTANICOが2026年版X運用最新戦略ウェビナーを開催、成果につなげる資産型運用を解説
AIストーム株式会社がOpenClaw活用セミナーを開催、AIエージェントがビジネス現場を変革
株式会社オロが建設コンサルティング業向けウェビナーを開催、技術部門の損益可視化を支援
アルティウスリンク株式会社が経理向けBPO活用ウェビナーを開催、課題解決と業務効率化を支援
株式会社日本計画研究所がAI時代のインフラセミナー開催、GPUとデータセンターの課題を解説
株式会社カウンターワークスがリーシング業務AI活用ウェビナー開催、既存ツールでAIエージェント実践
株式会社セキドがDJI産業機セミナーを福井で開催、3Dデータ活用と機材選定を無料解説
株式会社ナビットが補助金活用ウェビナーを開催、販促費削減と集客力向上を解説
