AI tutorial - IT technology blog

llama.cppの量子化でLLMモデルをGGUF形式に変換する方法

大規模言語モデルをローカルで動かすには、品質を損なわずにファイルサイズを削減する必要があります。このガイドでは、Hugging Faceからモデルをダウンロードし、GGUF形式に変換して、Q4_K_Mなどのレベルに量子化することで一般的なハードウェアで動作させるまでのllama.cppの全パイプラインを解説します。
AI tutorial - IT technology blog

WhisperとOllamaでローカル音声アシスタントを構築する:完全オフラインの音声認識とLLM応答

Whisperで音声認識、OllamaでローカルLLM応答を行う完全オフライン音声アシスタントの構築ガイド。クラウドAPI不要、レイテンシーのオーバーヘッドなし、完全なプライバシーを実現。6ヶ月の本番運用経験に基づく実測パフォーマンスデータを含む実践的な内容。
AI tutorial - IT technology blog

LLM評価:本番環境でAIモデルの品質を測定する実践的な方法とツール

LLM評価とは、AIモデルの出力が正確で関連性があり安全かどうかを体系的に測定する実践です。単なる速度ではなく、内容の品質を問います。本ガイドでは、DeepEvalとRAGASの実践的なセットアップ、CI/CDへの統合、そして実際のデプロイ経験から得たプロダクション監視戦略を解説します。