2026-07-01から1ヶ月間の記事一覧
gemma4:e2b + YOLO ONNXで知覚システムを試してみる。 以前から、パン・チルト(PTZ)カメラと、LLM / VLM(マルチモーダル言語モデル)によるセマンティックな解釈を密に結合させた自律型エージェントに関心がありました。そこで、ネットワークWiFiカメラta…
単体のRTX 3060でGemma 4 12Bを動かした場合、フルコンテキスト(262,144)を約100 tok/sで実現できたとのことで試してみます。dockerで簡単に実施してみます。 Gemma 4 12B on a single RTX 3060: the full 262,144 context at ~100 tok/s. (config below)d…
AGENTS.mdのテンプレをまとめてみます。正解はないと思うので、自分で利用しやすいような現時点での単なるメモです。それなりにまともでしょうか・・・。こうしてみると、コーディングの基本的な教えっぽいですね。結局、大事なのは基本ということでしょう、…
PDFやOfficeファイルの前処理に有用な「Docling v2.x」を使って、それらのファイルを自分好みのmarkdownの出力にトライしていました。 bwgift.hatenadiary.jp その後もちまちまと、一歩進んで、「実際にRAG(検索拡張生成)の前処理や知識ベースとして、利用…
Hugging Faceが提供しているText Embeddings Inference (TEI)はembeddingモデルにrustを使って最適化されています。今まで知らなかった・・・。そこで、以前作成した日本語embeddingモデルでmodernBERTを採用しているRuri v3を使ったAPIサーバーに適用してみ…
bwgift.hatenadiary.jp Open GENAIがupdateしていたので、それに合わせてupdateしました。小規模組織だと十分使えます。 このブランチでは、LiteLLMを使っていること、外からのアクセス前提で実施すること、embeddingモデルをmodernBERTベースのものも使える…