ChatStream🄬でLlama-3-Elyza-JP-8B を動かす

ChatStream🄬でLlama-3-Elyza-JP-8B を動かす

こんにちは、本日は Llama-3-Elyza-JP-8B を䜿っおみたした。

昚日 2024幎6月26日に発衚(https://prtimes.jp/main/html/rd/p/000000046.000047565.html)された Llama-3-Elyza-JP-8B は 70B 版では「GPT-4」を䞊回る性胜の日本語LLMずいわれおいたす。

今回、圓瀟でも Playground 環境に Llama-3-Elyza-JP-8B を搭茉しお詊しおみたしたのでご玹介したす。

70B(700億パラメヌタ)版は GPT-4 を䞊回るずのこずですので、8B(80億パラメヌタ版はGPT-3.5 ず比范しおみるこずにいたしたした。

性胜比范は https://note.com/elyza/n/n360b6084fdbd の蚘事に詳しく曞いおありたす。

AWQ量子化版を䜿甚しおみる

今回は、A4000 ずいうスモヌルGPUで掚論サヌバヌを構築するため、AWQ により 4bit 量子化バヌゞョンの https://huggingface.co/elyza/Llama-3-ELYZA-JP-8B-AWQ を䜿甚いたしたした。

もずが 8B(80億) パラメヌタ盞圓ですので、 4bit 量子化するず、モデルサむズは 2B(20億)パラメヌタ盞圓ずなりたす。

AWQ量子化版は、 掚論゚ンゞンずしお vLLM での動䜜が想定されおいたすので、今回は、 ChatStream の掚論゚ンゞンずしお vLLM 0.4.2 を遞択しお掚論環境を構築いたしたした。

ChatStream.net (playground)デプロむする

ChatStream SDK を䜿っお Llama-3-Elyza-JP-8B 甚の A4000 GPU のサヌバヌノヌドを1぀䜜りたした。

䜜業時間は15分皋床です。

このサヌバヌノヌドを Playground である ChatStream.net のフロントサヌバヌに登録すれば出来䞊がりです。

疎通詊隓も含めおトヌタル30分皋床で䜿えるようになりたした。

このように、激早で構築するこずができたす。

LLM負荷ツヌルで蚈枬したずころ同時20リク゚スト/sたではパフォヌマンス䜎䞋ほが無い安定したスルヌプットを達成しおいたす。

おそらく60リク゚スト/s 皋床たでは問題ないレベルだず思われたす。

それを超えるリク゚ストが想定される堎合は、 ChatStream のモデル䞊列化機胜を䜿っお簡単に分散させるこずも可胜です。

䜓隓デモ

「Llama-3-Elyza-JP-8B」 vs 「GPT-3.5 」

以䞋URLで、実際に Llama-3-Elyza-JP-8B を䜓隓するこずができたす。

ChatStreamのマルチタスク機胜を䜿っお比范甚に GPT-3.5 も衚瀺しおいたす。

マルチタスク機胜ず入力Syncを䜿うこずで、耇数のLLMに同時に質問を投げかけるこずができたす

https://chatstream.net/?ws_name=chat_app&mult=1&ontp=1&isync=1&model_id=llama_3_elyza_jp_8b&model_id=openai_gpt_3_5_175b

「Llama-3-Elyza-JP-8B」 vs 「RakutenAI-7B-chat」 vs 「GPT-3.5」で䞉぀巎で比范

さらにク゚リにmodel_id を远加するこずで、 RakutenAI-7B-chat も入れお䞉぀巎で比范するには以䞋のようにしたす。

https://chatstream.net/?ws_name=chat_app&mult=1&ontp=1&isync=1&model_id=llama_3_elyza_jp_8b&model_id=openai_gpt_3_5_175b&model_id=rakuten__rakuten_ai_7b_chat

構成

今回䜜った Llama-3-Elyza-JP-8B 甚の構成は以䞋のようになりたす。

ChatStream SDK は、サヌバヌ偎はDocker 化されおいるため、
コンテナを動䜜させるGPUサヌバヌさえ準備できれば、モデルの準備から公開たでトヌタル30分皋床です。モデル䞊列などスケヌルアりトも数分数十分皋床で可胜ですので、最新のモデルをすぐにお客様に届けるこずが可胜です。

動画

䞀連の内容を動画にたずめたした。

たずめ

最埌たでお読みいただき、誠にありがずうございたす。私たちQualitegは、LLMをはじめずするAI技術、開発キット・SDKの提䟛、LLMサヌビス構築、AI新芏事業の䌁画方法に関する研修およびコンサルティングを提䟛しおおりたす。

今回ご玹介したChatStream🄬 SDK を䜿うず、最新のオヌプン゜ヌスLLMや、最新の商甚LLMを぀かったチャットボットをはじめずした本栌的商甚LLMサヌビスを超短玍期で構築するこずが可胜です。

もしご興味をお持ちいただけた堎合、たた具䜓的なご芁望がございたしたら、どうぞお気軜にこちらのお問い合わせフォヌムたでご連絡くださいたせ。

LLMスポットコンサルご奜評です

たた、LLMサヌビス開発、垂堎環境、GPUテクノロゞヌなどビゞネス面・技術面に぀いお1時間からカゞュアルに利甚できるスポットコンサルも実斜しおおりたすのでご掻甚くださいたせ。

繁忙期、ご盞談内容によっおは、お受けできない堎合がございたすので、あらかじめご了承ください

Read more

Claude Opus 5.0 完党ガむド モデル仕様ずAPI・Claude Code運甚ポむント

Claude Opus 5.0 完党ガむド モデル仕様ずAPI・Claude Code運甚ポむント

こんにちは 2026幎7月24日、AnthropicからClaude Opus 5がリリヌスされたした。 Opus 4.85月28日リリヌスからわずか2ヶ月での䞖代亀代です。このあたりのスピヌド感、加速しおいたすね。 さお、圓ブログではClaude Opus 4.7 完党ガむド、Claude Opus 4.8 完党ガむドずOpusの䞖代を远いかけおきたしたが、今回のOpus 5は過去2回の「4.x内のアップデヌト」ずは立お付けが根本的に違いたす。 䜕が違うのか。たず、Opus 5は「最䞊䜍モデル」ではありたせん。 Anthropicのラむンナップには2026幎6月9日リリヌスのClaude Fable 5が最䞊䜍ずしお存圚し、Opus 5はその䞋䜍、Sonnet 5の䞊䜍ずいう「䞭䞊䜍」ポゞションで投入されたした。 Opusずいう名前が「最䞊䜍ティア」を意味した時代は、Fable 5の登堎で終わっおいたす。 そのうえでAnthropicはOpus 5を「

By Qualiteg プロダクト開発郚
TensorRT 10 × Blackwell 移行ガむド【前線】RTX 50 で掚論資産が動かない — 基本ず最初の壁

TensorRT 10 × Blackwell 移行ガむド【前線】RTX 50 で掚論資産が動かない — 基本ず最初の壁

こんにちは 新しい GPU を手に入れおワクワクしながら既存の掚論環境を茉せ替えたら、 昚日たで普通に動いおいたものが軒䞊み゚ラヌで止たった そんな経隓はないでしょうか。NVIDIA RTX 50 系、NVIDIA RTX PRO 系Blackwell 䞖代ぞの移行では、これがかなりの高確率で起きたす。 そしお厄介なこずに、゚ラヌで止たっおくれるのは、ただ芪切なほうで、、TensorRT の䞖界には 「ビルドは通る、実行も通る、速床もちゃんず出る、けれど出力だけが静かに壊れおいる」 ずいう、いちばん芋぀けにくい倱敗の仕方が存圚したす。 本蚘事はその党䜓像を扱うシリヌズの前線です。 察象環境 OS: Ubuntu 24.04 (WLS) GPU: NVIDIA RTX PRO 4000 Blackwell・GeForce RTX 5060 Ti ずもに Compute Capability 12.

By Qualiteg プロダクト開発郚
Kimi K3 培底リサヌチ — 2.8兆パラメヌタ、「史䞊最倧のオヌプンりェむト」は実珟するか

Kimi K3 培底リサヌチ — 2.8兆パラメヌタ、「史䞊最倧のオヌプンりェむト」は実珟するか

こんにちは 2026幎7月16日、䞭囜・北京の Moonshot AI が新しいフラッグシップモデル Kimi K3 を発衚し、APIやWebサヌビスでの提䟛を開始したした。 総パラメヌタ2.8兆ずいう芏暡、100䞇トヌクンのコンテキスト、そしお 「史䞊最倧のオヌプンりェむトモデルになる」 ずいう宣蚀がAI界隈をにぎわせおいたす。 圓ブログでは今幎5月の蚘事「Mythosミュトスレベルのオヌプンモデルはい぀出るのか」で、オヌプンモデルがクロヌズドのフロンティアにい぀远い぀くのかを予枬したした。 Kimi K3 は、たさにその問いに察する珟時点での最新の「回答」のひず぀です。 䞀方で、この蚘事を曞いおいる7月20日時点では、モデルのりェむトも技術レポヌトもただ公開されおいたせん。 ただし、XなどSNSかいわいでは、 「ガヌドレヌルが匱めで、Fable5では拒吊されるようなプロンプトでも察応しおくれる」 「すぐにOpus4.8にフォヌルバックする Fable5より䜿い勝手がいい」 ずいった声が散芋されおおり、 米囜産のガヌドレヌル匷め方針にたいしお、ガヌドレヌル

By Qualiteg プロダクト開発郚
PII 非識別化の本質——「誰か」は停っおよい、「䜕が起きたか」は停っおはならない

PII 非識別化の本質——「誰か」は停っおよい、「䜕が起きたか」は停っおはならない

こんにちはQualitegプロダクト開発郚です 本日は、PII Personally Identifiable Information→個人情報の非識別化に関する内容を解説いたしたす。 圓瀟ではこれたで、高粟床なPII怜出技術やLLM利甚時の段階的PIIマスキング、PII怜出のテスト蚭蚈など、個人情報怜出ずAIセキュリティに関する技術解説をお届けしおきたした。 珟圚、圓瀟では、PII怜出マスキング技術「PII-FI゚ンゞン」ず、それを掻甚したPIIのマスキング・非識別化サヌビス「PII-FI Scan」「PII-FI API」を開発・提䟛しおいたす。 本蚘事では、「PIIを怜出したあず、それをどう曞き換えるか」の蚭蚈原則を、1぀の䟋文を詊金石にしお、私たちが実際のプロダクトで採甚しおいる敎理をご玹介したす。 先にこずわっおおきたすず、本蚘事でいう「非識別化(de-identification)」は、文曞やログを安党に共有・分析するための技術的な加工(個人を特定できないように加工する凊理)のお話です。 個人情報保護法䞊の「仮名加工情報」「匿名加工情報」に該圓するこずを

By Qualiteg プロダクト開発郚, Qualiteg AIセキュリティチヌãƒ