<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>Llama-Cpp-Python on Xainome Blog</title>
    <link>https://xainome-blog.pages.dev/tags/llama-cpp-python/</link>
    <description>Recent content in Llama-Cpp-Python on Xainome Blog</description>
    <generator>Hugo</generator>
    <language>ja-JP</language>
    <lastBuildDate>Fri, 11 Oct 2024 00:00:00 +0000</lastBuildDate>
    <atom:link href="https://xainome-blog.pages.dev/tags/llama-cpp-python/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>llma-cpp-pythonを使って今更ローカルでLLMを動かしてみるよ！</title>
      <link>https://xainome-blog.pages.dev/posts/2024/10/llma-cpp-python-llm/</link>
      <pubDate>Fri, 11 Oct 2024 00:00:00 +0000</pubDate>
      <guid>https://xainome-blog.pages.dev/posts/2024/10/llma-cpp-python-llm/</guid>
      <description>&lt;h2 id=&#34;llama-cpp-pythonのインストールとセットアップ&#34;&gt;llama-cpp-pythonのインストールとセットアップ&lt;/h2&gt;
&lt;p&gt;前回Github copilotをを使わず、vscodeでAIを動かしてコードを頼むようにしてみました。&lt;/p&gt;
&lt;p&gt;そこでローカルでllama3.2:3bが動かせるなら他のモデルでもいけるのでは？ということが気になって調べて動かしてみました。&lt;/p&gt;
&lt;p&gt;githubのライブラリは&lt;a href=&#34;https://github.com/abetlen/llama-cpp-python&#34;&gt;こちら&lt;/a&gt;になります。&lt;/p&gt;
&lt;p&gt;というわけでまずはライブラリのインストール&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;pip install llama-cpp-python
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;こちらはcpu対応になります。もしエラーが出たら下のほうも試して見てください。私はvisual sutadioが入ってるので特に問題はありませんでした。&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;pip install llama-cpp-python \ --extra-index-url https://abetlen.github.io/llama-cpp-python/whl/cpu
&lt;/code&gt;&lt;/pre&gt;&lt;p&gt;gpuを使いたい方はいろんなインストールパターンがあるので試して見てください。CUDAであればこんな感じ&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;pip install llama-cpp-python \ --extra-index-url https://abetlen.github.io/llama-cpp-python/whl/cu121
&lt;/code&gt;&lt;/pre&gt;&lt;h3 id=&#34;ダウンロードしたモデルの紹介&#34;&gt;ダウンロードしたモデルの紹介&lt;/h3&gt;
&lt;p&gt;ライブラリのインストールが完了したら今度はモデルをダウンロードしてきましょう。配置場所はどこでも構いません。&lt;/p&gt;
&lt;p&gt;私は今回2つのモデルをダウンロードしてきました。&lt;/p&gt;
&lt;p&gt;sakanaAI: &lt;a href=&#34;https://huggingface.co/mmnga/SakanaAI-EvoLLM-JP-v1-7B-gguf&#34;&gt;https://huggingface.co/mmnga/SakanaAI-EvoLLM-JP-v1-7B-gguf&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;gemma: &lt;a href=&#34;https://huggingface.co/alfredplpl/gemma-2-2b-jpn-it-gguf&#34;&gt;https://huggingface.co/alfredplpl/gemma-2-2b-jpn-it-gguf&lt;/a&gt;&lt;/p&gt;
&lt;h3 id=&#34;llama-cpp-pythonを使ってコードでのモデル呼び出し&#34;&gt;llama-cpp-pythonを使ってコードでのモデル呼び出し&lt;/h3&gt;
&lt;p&gt;インストールが完了したら実際にコードに書いていきます。一旦こんな感じ&lt;/p&gt;
&lt;pre tabindex=&#34;0&#34;&gt;&lt;code&gt;from llama_cpp import Llama

prompt = &amp;#34;(12+50)*30/5-6*(38-19) この計算結果は何？&amp;#34;
sakana_llm = Llama(model_path=&amp;#34;./models/sakana/SakanaAI-EvoLLM-JP-v1-7B-q4_K_M.gguf&amp;#34;)
gemma_llm = Llama(model_path=&amp;#34;./models/gemma/gemma-2-2b-jpn-it-Q4_K_M.gguf&amp;#34;)

sakana_response = sakana_llm.create_chat_completion(
    messages = [
        {
            &amp;#34;role&amp;#34;: &amp;#34;user&amp;#34;,
            &amp;#34;content&amp;#34;: prompt,
        }
    ]
)

gemma_response = gemma_llm.create_chat_completion(
    messages = [
        {
            &amp;#34;role&amp;#34;: &amp;#34;user&amp;#34;,
            &amp;#34;content&amp;#34;: prompt,
        }
    ]
)

print(sakana_response[&amp;#34;choices&amp;#34;][0][&amp;#34;message&amp;#34;][&amp;#34;content&amp;#34;].strip())
print(gemma_response[&amp;#34;choices&amp;#34;][0][&amp;#34;message&amp;#34;][&amp;#34;content&amp;#34;].strip())
&lt;/code&gt;&lt;/pre&gt;&lt;h3 id=&#34;llama-cpp-pythonを使った実行結果と考察&#34;&gt;llama-cpp-pythonを使った実行結果と考察&lt;/h3&gt;
&lt;p&gt;それからどのくらい時間がかかるか気になったので計測してみました。ちなみに私の環境ではこんな感じで時間がかかっています。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
