ChatStream Guide

[ChatStream] クイックスタート

Qualiteg プロダクト開発部

2023年10月2日 — 3 min read

こんにちは！ (株)Qualiteg プロダクト開発部です！

まだまだ暑いですね！

早速、昨日発表しました ChatStream をつかったリアルタイムストリーミングチャットサーバーを作ってみたいと思います。

パッケージのインストール

早速 ChatStream パッケージのインストールをしていきます

pip install chatstream

必要パッケージのインストール

pip install torch torchvision torchaudio
pip install transformers
pip install "uvicorn[standard]" gunicorn

ChatStream サーバーの実装

今回は RedPajamaINCITE をLLMとしてつかったストリーミングチャットサーバーを実装します。

chatstream_server.py

import torch
from fastapi import FastAPI, Request
from fastsession import FastSessionMiddleware, MemoryStore
from transformers import AutoTokenizer, AutoModelForCausalLM

from chatstream import ChatStream,ChatPromptTogetherRedPajamaINCITEChat as ChatPrompt

model_path = "togethercomputer/RedPajama-INCITE-Chat-3B-v1"
device = "cuda"  # "cuda" / "cpu"

tokenizer = AutoTokenizer.from_pretrained(model_path)
model = AutoModelForCausalLM.from_pretrained(model_path, torch_dtype=torch.float16)
model.to(device)

chat_stream = ChatStream(
    num_of_concurrent_executions=2,# 文章生成の最大同時実行数
    max_queue_size=5,# 待ち行列の大きさ
    model=model,
    tokenizer=tokenizer,
    device=device,
    chat_prompt_clazz=ChatPrompt,
)

app = FastAPI()

# ユーザーごとの ChatPrompt を HTTP セッションに保持するため、セッションミドルウェアを指定
app.add_middleware(FastSessionMiddleware,
                   secret_key="your-session-secret-key",
                   store=MemoryStore(),
                   http_only=True,
                   secure=False,
                   )


@app.post("/chat_stream")
async def stream_api(request: Request):
    # FastAPI の Request オブジェクトを `handle_chat_stream_request` に渡すだけで自動的にキューイング、同時実行制御します
    response = await chat_stream.handle_chat_stream_request(request)
    return response


@app.on_event("startup")
async def startup():
    # Webサーバー起動と同時に `start_queue_worker` を行い、キューイングシステムを開始します
    await chat_stream.start_queue_worker()

コンストラクターパラメータでパフォーマンス調整

num_of_concurrent_executions

num_of_concurrent_executions=2 は文章生成の最大同時実行数を表しています。この数字が大きいほど、複数の文章生成を並行実行することができます。ただし、大きすぎると、トークン生成速度(トークン/秒)が遅くなるため、GPUの性能にあわせて適切な値を設定してください。たとえば、GPUが A4000 x 1枚程度の性能の場合は num_of_concurrent_executions=5～10　程度が「快適」と思える生成速度となります。

max_queue_size

max_queue_size=5 は、文章生成の同時実行が埋まっているときに、文章生成待ちをしているリクエストの最大数です。たとえば、上の例のように文章生成の同時実行数の最大数 num_of_concurrent_executions==2 に達しているとき、3番目のリクエストからは待ち行列に入ります。3番目から8番目までは、文章生成を待っている状態で、チャットUI上ではプログレスバーとなります。では、この状態で9番目のリクエストが来たらどうなるでしょうか。

その場合、9番目のリクエストには「現在、文章生成サーバーがBusyです」の旨UIに表示されます。

（ただしこのような状況はサービスとして好ましくないため、このような状況が発生しないよう複数のノードをあらかじめ準備しておくことができます。また、急遽想定以上のアクセスが発生したときに、新しいノードが立ち上がるように設定しておくこともできます。これにより、負荷が多くなったときに、新しいノードが立ち上がり、待ち時間の無いチャットサービスを提供することができます。これら、スケーリングに関する設定方法は別途投稿いたします。）

プロンプト処理クラス "ChatPrompt"を作る

ユーザーによる入力テキストをLLM用のフォーマットに書き換えるためのプロンプト処理クラスはChatPrompt クラスと呼びます。

Qualiteg では、新しい LLM が発表されるたび、そのモデル用の ChatPrompt クラスを作成・バンドルしていますが、自前で作成することもできます。

ここでは今回のサンプルで利用した RedpajamaIncite のモデル用の ChatPromptクラスをご紹介します

from chatstream import AbstractChatPrompt


class ChatPromptTogetherRedPajamaINCITEChat(AbstractChatPrompt):
    """
    togethercomputer/RedPajama-INCITE-7B-Chat
    """

    def __init__(self):
        super().__init__()  # Call the initialization of the base class
        self.set_requester("<human>")
        self.set_responder("<bot>")
        self.set_prefix_as_stop_str_enabled(True)  # enable requester's prompt suffix as stop str

    def get_stop_strs(self):
        return ['<|endoftext|>']

    def create_prompt(self, opts={}):
        """
        Build prompts according to the characteristics of each language model
        :return:
        """
        if self.chat_mode == False:
            return self.get_requester_last_msg()

        ret = self.system
        for chat_content in self.get_contents(opts):
            chat_content_role = chat_content.get_role()
            chat_content_message = chat_content.get_message()

            if chat_content_role:
                if chat_content_message:
                    merged_message = chat_content_role + ": " + chat_content_message + "\n"
                else:
                    merged_message = chat_content_role + ":"

                ret += merged_message

        return ret

    async def build_initial_prompt(self, chat_prompt):
        pass
        # If you want a common initial prompt for instructions, override this method and implement
        # chat_prompt.add_requester_msg("Do you know about the Titanic movie?")
        # chat_prompt.add_responder_msg("Yes, I am familiar with it.")
        # chat_prompt.add_requester_msg("Who starred in the movie?")
        # chat_prompt.add_responder_msg("Leonardo DiCaprio and Kate Winslet.")

単純なモデルの場合は、LLMに入力するプロンプトテキストは、テンプレートマッチングだけで表現できますが、複雑な処理が必要な場合には、このようにChatPromptクラスとして実装したほうが柔軟な処理ができます。

AIプラットフォーマーの垂直統合と、残された戦略オプション

こんにちは！ Qualitegコンサルティングチームです！ 2026年現在、LLMの最大のユースケースの一つはコーディングだと考えています。実際、Menlo Venturesの調査でもコーディングはエンタープライズAI活用の代表的ユースケースとして位置づけられています。そして、それにきづいたAIプラットフォーマー各社は自前のAIコーディングツールを次々と発表し人気を博しています。逆にいえば、そのユースケースを早期に発見しプロダクト化してきた"コーディングSaaS"の開発企業は「胴元」であるAIプラットフォーマーが自分たちのSaaS領域に進出してきているわけで気が気でないでしょう。ということで、本日はAIプラットフォーマーによる垂直統合と、私たちの取りうる戦略オプションについて考えてみたいと思います。さて、2025年は、AIコーディングエージェント市場の勢力図が決定的に書き換えられた年でした。 Anthropicの「Claude Code」は2025年2月のリサーチプレビューから始まり、わずか半年で年換算ランレート（ARR）10億ドルに到達。 2026年初頭のア

KVキャッシュのオフロード戦略とGQAの実践的理解

こんにちは！ LLM推論基盤プロビジョニング講座、今回は番外編をお届けします！第3回「使用モデルの推論時消費メモリ見積もり」では、GPUメモリ消費の二大要素としてモデルのフットプリントとKVキャッシュを紹介し、1トークンあたりのKVキャッシュサイズの計算方法を解説しました。また第4回「推論エンジンの選定」ではvLLMやDeepSpeedなど各推論エンジンの特性を比較し、第5回では量子化や並列化による最適化戦略を解説してきました。しかし、実はKVキャッシュにはまだまだ掘り下げるべきトピックがあります。 * KVキャッシュをGPUのVRAMからCPU RAMやディスクにオフロードしたらどうなるのか？どのくらい遅くなるのか？ * HuggingFace TransformersとvLLMでは、KVキャッシュの管理方針がなぜ根本的に異なるのか？ * そもそもKVキャッシュが大きくなる原因であるアテンション構造を変えてしまう GQA（Grouped-Query Attention）とは何か？第5回で紹介した量子化とは別の軸で、KVキャッシュを劇的に小さくする技術です。

Python と JavaScript で絵文字の文字数が違う！サロゲートペアが引き起こす位置ずれバグの話

こんにちは！ Qualitegプロダクト開発部です！ PII（個人情報）検出のデモアプリを開発していて、検出したエンティティの位置をハイライト表示する機能を実装していました。バックエンドは Python（FastAPI）、フロントエンドは JavaScript という構成です。ある日、テストデータにこんなメール文面を使ったところ、ハイライトの位置が途中から微妙にずれるバグに遭遇しました。鈴木一郎様いつもお世話になっております。サンプル商事の佐藤でございます。先日の件、確認が取れましたのでご連絡いたします。お忙しいところ恐縮ですが、ご確認のほど宜しくお願い致します。 💻 ＃オンラインでのお打ち合わせ、お気軽に声がけください！ ―――――――――――――――――――――――――――――― サンプル商事株式会社営業部第一課山田　太郎（Yamada　Taro）〒100-0001 東京都千代田区千代田1-1-1 サンプルビル 3F tel: 03-1234-5678 https://example.com/contact 検出結果をハイライト表示

大企業のAIセキュリティを支える基盤技術 - 今こそ理解するActive Directory 第5回ブラウザ設定と認証

こんにちは、今回はシリーズ第5回「ブラウザ設定と認証」について解説いたします！さて、前回（第4回）では、プロキシサーバーをドメインに参加させることで、ChatGPTやClaudeへのアクセスを「誰が」行ったかを確実に特定する仕組みを解説しました。「信頼の連鎖」の概念や、Windows版Squidなら1時間で構築できる環境、Negotiate/NTLM/Basicという3段階の認証フォールバック機構について理解いただけたかと思います。しかし、せっかくサーバー側で完璧な統合Windows認証環境を構築しても、ブラウザ側の設定が適切でなければ、ユーザーには毎回パスワード入力ダイアログが表示されてしまいます。「Edgeだと自動でログインできるのに、Chromeだとパスワードを聞かれる」「同じサーバーなのにURLの書き方で動作が違う」これらはヘルプデスクに寄せられる典型的な問い合わせです。（ただ、業務に好きなブラウザ使っていいよ、という企業はそんなに多くはないとおもいます）今回は、統合Windows認証がブラウザでどのように動作するのか、その仕組みから各ブラウザ（Edge/