<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Python on Xainome Blog</title>
    <link>https://xainome-blog.pages.dev/tags/python/</link>
    <description>Recent content in Python on Xainome Blog</description>
    <generator>Hugo</generator>
    <language>ja-JP</language>
    <lastBuildDate>Fri, 30 Aug 2024 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://xainome-blog.pages.dev/tags/python/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>人間っぽいふるまいをするスクレイピングを検討した話</title>
      <link>https://xainome-blog.pages.dev/posts/2024/08/web-scraping/</link>
      <pubDate>Fri, 30 Aug 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/08/web-scraping/</guid>
      <description>&lt;h2 id=&#34;前提利用規約に違反しないこと&#34;&gt;前提：利用規約に違反しないこと&lt;/h2&gt;
&lt;p&gt;前提として&lt;strong&gt;利用規約&lt;/strong&gt;に違反する行為はやめたほうが良いと考えています。&lt;/p&gt;
&lt;p&gt;法的に訴えられても文句は言えないですし。&lt;/p&gt;
&lt;p&gt;多くの人が利用している&lt;a href=&#34;https://www.amazon.co.jp/gp/help/customer/display.html?nodeId=GLSBYFE9MGKKQXXM&#34;&gt;amazonなども利用規約&lt;/a&gt;で禁止しているので、スクレイピングをする際はしっかりと利用規約を読んだうえで行ってください。許可が下りれば問題ないとは思いますが。&lt;/p&gt;
&lt;h3 id=&#34;サイト側のスクレイピング対策&#34;&gt;サイト側のスクレイピング対策&lt;/h3&gt;
&lt;p&gt;本題に入ります。&lt;/p&gt;
&lt;p&gt;サイト側でスクレイピングを弾く設定がいくつか存在します。例えばユーザーっぽくないふるまいでサイトにアクセスした場合。あるいは特定のサイトを経由しないと見れないURLに直接アクセスした場合。ゆうまでもなく連続でいろんなURLにアクセスした場合。&lt;/p&gt;
&lt;p&gt;連続でアクセスされるとサーバーに負荷がかかるので、これが弾かれるのは想像に難くないと思います。&lt;/p&gt;
&lt;h3 id=&#34;スクレイピング対策を避ける方法&#34;&gt;スクレイピング対策を避ける方法&lt;/h3&gt;
&lt;p&gt;ただ、スクレイピングするされた場合、上記のような特徴が存在します。&lt;/p&gt;
&lt;p&gt;この辺はアクセスログを監視すると見れるかと思います。おそらくですが。&lt;/p&gt;
&lt;p&gt;では人間っぽくふるまうにはどうしたらよいか調べた中で書いてみます。&lt;/p&gt;
&lt;p&gt;一応言語はpythonを使います。他の言語でもできるかと思うので参考程度にはなるかと思います。&lt;/p&gt;
&lt;h3 id=&#34;pythonでのスクレイピング基礎&#34;&gt;Pythonでのスクレイピング基礎&lt;/h3&gt;
&lt;p&gt;一般的にpythonでのスクレイピングではrequestsモジュールを使います。他にもseleniumやpyppeteerなどがありますが、一旦requestsを使っていきます。&lt;/p&gt;
&lt;p&gt;インストールはpipを使います。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;pip install requests
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;もしpythonのバージョンなどで分けてる場合はこちら&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;py -3.12 -m pip install requests
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;インストールが終わったらアクセスしてみましょう。今回は私のサイトにアクセスしてみます。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;import requests

response = requests.get(&amp;#39;https://xainome.blog/’)
print(response.text)
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;こうするとHTMLの中身を取得することができます。&lt;/p&gt;
&lt;p&gt;そこから取得したい情報があればBeautifulSoupを使って要素を取り出してみましょう。まずはインストール&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;pip install beautifulsoup4
&lt;/code&gt;&lt;/pre&gt;&lt;h3 id=&#34;実際のアクセスとhtmlの解析&#34;&gt;実際のアクセスとHTMLの解析&lt;/h3&gt;
&lt;p&gt;インストールができたらHTMLを解析します。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;from bs4 import BeautifulSoup

soup = BeautifulSoup(html_parse, &amp;#39;html.parser&amp;#39;)
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;これで解析の準備ができました。解析の話は本題とそれますのでここまでにしようと思います。&lt;/p&gt;
&lt;p&gt;解析やHTMLの情報取得に興味があれば調べてもいいですし、生成AIに聞いてみるでもいいと思います。このようなコード、銘柄、市場などが一覧で取得することができます。もちろんAPIを使うという手もありますが。&lt;/p&gt;
&lt;p&gt;&lt;img alt=&#34;東京証券取引所_銘柄一覧_グロース&#34; loading=&#34;lazy&#34; src=&#34;https://xainome-blog.pages.dev/posts/2024/08/web-scraping/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2024-08-30-091809.png&#34;&gt;&lt;/p&gt;
&lt;h3 id=&#34;リクエストヘッダーの設定&#34;&gt;リクエストヘッダーの設定&lt;/h3&gt;
&lt;p&gt;実は通常のリクエストを送る場合ユーザーではなく、言語別のリクエストを送っていることになります。&lt;/p&gt;
&lt;p&gt;リクエストにはRequests Headersというものが設定できます。これは私たちがPCやスマホでサイトにアクセスするときも送信されています。&lt;/p&gt;
&lt;p&gt;まずは設定してみます。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;headers = {
    &amp;#39;User-agent&amp;#39; = &amp;#39;Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/128.0.0.0 Mobile Safari/537.36&amp;#39;
}
response = requests.get(search_url, headers=headers)
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;こんな感じで設定します。特に何も設定しなかった場合、&amp;lsquo;python-requests/2.25.1&amp;rsquo;という設定で送られるみたいです。恐らくjsやGoとかでも似たような設定になるかと思います。&lt;/p&gt;</description>
    </item>
    <item>
      <title>pythonの仮想環境構築をいくつかやったので使ってみた感想を書く</title>
      <link>https://xainome-blog.pages.dev/posts/2024/03/python-virtual-environment-review/</link>
      <pubDate>Fri, 08 Mar 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/03/python-virtual-environment-review/</guid>
      <description>&lt;p&gt;前回の続きになります。&lt;/p&gt;
&lt;p&gt;前回は仮想環境が必要なの？というテーマで書いてみましたが、とはいえ使えるに越したことはないので実際に試してみて使った感想を残そうと思います。&lt;/p&gt;
&lt;p&gt;今回仮想環境を構築するにあたって試してみたのは以下&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;pip&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;venv&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;pyenv（環境的に使えなかった）&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;pipenv&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;poetry&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;docker（環境的に使えなかった）&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Rye（環境的に使えなかった）&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一応ざっくりと説明すると&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;ライブラリのインストール：pip、pipenv、poetry&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;仮想環境の構築：venv、pipenv、poetry、docker&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;pythonのバージョン管理：pyenv、docker&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;一般的に組み合わせとしては&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;
&lt;p&gt;pip + venv + pyenv&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;pipenv + pyenv&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;poetry + pyenv&lt;/p&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;docker + pipenv&lt;/p&gt;
&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;あたりだと思います。私も依存関係とかは詳しくないのでそうなんだという認識ですが…&lt;/p&gt;
&lt;p&gt;まずは &amp;ldquo;pip&amp;rdquo; 、pythonユーザーであれば皆さん使用してるので説明は省きますが、標準ライブラリで馴染みがあるものですね。&lt;/p&gt;
&lt;p&gt;次は &amp;ldquo;venv&amp;rdquo; 、昔はvertialenvが使われていたみたいですがそれが標準ライブラリになったものです。vertialenvとは別物ですが使い方は同じですね。&lt;/p&gt;
&lt;p&gt;仮想環境の作成や有効化ができ、標準ライブラリなので様々な教材でも使用されると思います。有効化に面倒な設定があったり、自動化やライブラリ一覧の出力にも手間がかかるので少し使いにくいですが、覚えておいた方がいいですね。vscode使うならインタープリターの選択で有効化できますが…&lt;/p&gt;
&lt;p&gt;次は &amp;ldquo;pyenv&amp;rdquo; です。私の環境ではシステム環境変数をいじれないので使えませんでした。&lt;/p&gt;
&lt;p&gt;pythonのバージョンがインストールできず、localやglobalの設定もできない状況でした。使えなくて残念ですが、vscodeのインタープリターで選択すれば問題ないのでいいかと&lt;/p&gt;
&lt;p&gt;あるいはユーザー環境変数で任意のpythonバージョンのPATHを上に移動させるとかですかね。&lt;/p&gt;
&lt;p&gt;次は &amp;ldquo;pipenv&amp;quot;です。こちらはライブラリのインストールと環境変数の作成が一体化した便利なライブラリになっています。&lt;/p&gt;
&lt;p&gt;個人的には一番使いやすく感じました。仮想環境構築のしやすさ、ライブラリ一覧の自動化は便利だなと感じました。制限がなければ &amp;ldquo;pipenv + pythonのバージョン管理&amp;rdquo; が一番楽な気はします。&lt;/p&gt;
&lt;p&gt;ただ、インストールの遅さや抱えてる問題もあるみたいなのでpipenvさえあればいいとは思いませんが、優先度は高いというイメージですね。&lt;/p&gt;
&lt;p&gt;次は &amp;ldquo;poetry&amp;rdquo; です。使う用途としては&amp;quot;pipenv&amp;quot;と同じですが、異なる点で言うとPyPIにビルド・公開ができるという点になります。&lt;/p&gt;
&lt;p&gt;PyPIにビルド・公開することはあまりないので、そうなるとpipenvとの使いやすさを比べてどうか？ということになりますが、使いやすさはpipenvに軍配が上がります。&lt;/p&gt;
&lt;p&gt;まず、poetryはpython3.9以上でしか使用できません。今の現場はpython3.7(いつか3.11になる予定)なので使えなかったりします。また、ライブラリのバージョンでも同様に使えないものがあります。&lt;/p&gt;
&lt;p&gt;他にも仮想環境の有効化がvenvと同様手間がかかったり、vscodeのインタープリター選択画面に出なかったのでパスを通す設定をしないといけないなどがあったりして使いにくさを感じました。私の環境構築方法に問題があるかもしれませんが…&lt;/p&gt;
&lt;p&gt;おまけとしてRyeはチームよりも個人開発向けなのでやろうとしたのですが、客先PCでは使わないほうがよさそうです。個人で触ってみようとは思います。&lt;/p&gt;
&lt;p&gt;それからDockerです。Desktop版をインストールしようとしましたがダメでした。とはいえAWSの実行ではdockerコンテナを利用しているので、ローカルでは使えませんが開発や本番環境では使われているのでdockerfileの中身やdocker-composeをチェックしてみます。ローカルだとどんな使いやすさなんですかね？&lt;/p&gt;
&lt;p&gt;前にも話したんですが、pythonやライブラリのバージョンが固定されているような現場では正直不要だとは思いますが、知っておいて損はないかと思いますし、知識はどこかで役立つと思います。&lt;/p&gt;
&lt;p&gt;手軽で使いやすいという点では &amp;ldquo;pipenv&amp;rdquo; &amp;gt; &amp;ldquo;poetry&amp;rdquo; &amp;gt;= &amp;ldquo;pip + venv&amp;quot;に&amp;quot;pyenv&amp;quot;を足したものかと思いますが、覚え順としては&amp;quot;pip + venv&amp;rdquo; &amp;gt; &amp;ldquo;pipenv&amp;rdquo; &amp;gt; &amp;ldquo;poetry&amp;rdquo; がいいと思います。ついでにDockerまで使えればほぼ問題ないという印象です。&lt;/p&gt;</description>
    </item>
    <item>
      <title>常駐先のPCでPythonの仮想環境構築って必要なの？</title>
      <link>https://xainome-blog.pages.dev/posts/2024/03/pc-python-virtual-environment/</link>
      <pubDate>Wed, 06 Mar 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/03/pc-python-virtual-environment/</guid>
      <description>&lt;p&gt;たまには自身の仕事の環境のことでも話をしてみるのもいいかと思って記事にしました。ただ自身の疑問や考えを整理するために書いてるので、大したことは書かないかと思います。人間っぽくていいなと思います。&lt;/p&gt;
&lt;p&gt;大前提としてpythonの仮想環境構築について知っておくに越したことはないと思います。客先に派遣される業態ではいつ使うかわかりませんし、自社開発でもライブラリの更新をした方がセキュリティ面でも安心できると思うので、安定板と更新版で使い分けができそうです。&lt;/p&gt;
&lt;p&gt;さて、最近新PCに移行することになりました。前のPCでは仮想環境を使ってこなかったので、これを機に仮想環境について調べこの記事を書くことにしました。仮想環境で何を使ったかはあまり触れないと思います。&lt;/p&gt;
&lt;p&gt;私の現場では客先常駐ではないですが、お客様先から配布されたPCを使って開発を行います。スペックは特段低いわけではないので、重たい処理や大量のデータを扱わなければ問題ない程度です。ちなみにWindowsです。&lt;/p&gt;
&lt;p&gt;ただお客様先から配布されたPCなのでセキュリティは固めです。実はpyenvを使おうとしたのですがインストールがうまくいかずpythonバージョンの使い分けができませんでした。&lt;/p&gt;
&lt;p&gt;他にもDocker Desktopをインストールしようとしましたがこちらも無理でした。申請すれば通るかもしれないですが、他にも方法はありますので一旦諦めました。ちなみにWinMerge(ファイル同士の比較)もインストールできませんでした。前のPCは標準搭載だったのですが…&lt;/p&gt;
&lt;p&gt;ここから本題なのですが、仮想環境を作る必要があるのか？ライブラリの管理をする必要があるのか？という問題です。もちろん客先によっては自由度が高いところもあるので一概には不要だとは思いません。&lt;/p&gt;
&lt;p&gt;私の話になりますが、本番環境ではAWSを使っています。開発環境もありますがスコアリングのみであればローカルでvscodeを使用しています。&lt;/p&gt;
&lt;p&gt;AWSではDockerfileでpythonとライブラリのバージョンを指定して実行しているのですが、そのバージョンが全てのプロジェクトで統一されています。pythonのバージョンであれば3.7.12、pandasであれば1.12.0という具合です。&lt;/p&gt;
&lt;p&gt;こうなるとローカルでも使用するpythonやライブラリのバージョンは固定されるので、仮想環境の構築は不要でとりあえずpipでインストールしてしまえばいい気もします。requirements.txtに吐き出していまえば他の人にも共有できて同じ環境が作れますし…&lt;/p&gt;
&lt;p&gt;整理してみましたがやはり不要な気がします。とは言え仮想環境構築で使ったvenvとpyenv(ほぼインストールのみですが…)の使い方もわかりましたし、他のライブラリであるpipenvやPoetryも触ってみようと思います。&lt;/p&gt;
&lt;p&gt;次に話すとしたら実際に仮想環境構築したことかAWSについてですかね？ではでは&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
