新着順 人気順

AI エージェントオーケストレーションツール「TAKT」を触ってみた

はじめに こんにちは。Legalscape (採用情報) でLLMを用いたWebアプリケーションのエンジニアをやっていますhiroendoreです。 以前参加した勉強会で 実践ハーネスエンジニアリング:TAKTで実現するAIエージェント制御 / Practical Harness Engineering: AI A…

OpenTelemetryによるAI Agentの監視

AI

OpenTelemetryのGenerative AI Observability規約を使ったAI Agentの監視手法を解説。トークン使用量やレスポンス遅延を標準化されたトレース・メトリクスで可視化し、LangChain/LangGraphでの実装例、Jaeger/Prometheusによる可視化、さらにはSemantic Conv…

エージェントが読むリポジトリ知識に仕様ができ始めている - LLM Wiki・OKF・OpenWiki

こんにちは。 Legalscape (採用情報) でエンジニアをしている kazukitash です。 AI が開発の場に浸透してきてしばらく経ちました。どうでしょうか? AGENTS.md はこまめにメンテしていますか? 正直面倒くさいです。エージェントに任せる開発が増えるほど必…

エンジニアは何をレビューすれば良いのか - ハーネスという概念

AI

AI エージェント時代、レビューはコードを「読む」からハーネスを「設計する」へ。フィードフォワード × フィードバックで品質を担保し、人間は方向性の判断に集中する。

LLMコストの盲点: 日本語トークナイザー効率で変わる実質コスト比較(GPT-5, Claude Sonnet 4.5, Gemini 2.5 Pro, PLaMo 2.1 Prime)

はじめに こんにちは、LegalscapeでAIエンジニア/データサイエンティストをしている富田です。 皆さんは各LLMの本当のコストを測ったことがありますか? 1Mtokenあたり○ドルという料金表は確認されていると思いますが、実は各LLMの日本語に対するトークン効…

LLMのコンテンツフィルターについて

3行でまとめる Azure OpenAIとGeminiでは、コンテンツフィルターの挙動が異なり、エラーハンドリングの実装方法も変わってくる Azure OpenAIは400エラーで明確にブロックする場合と200で一部ブロックする場合があり、Geminiは200レスポンスでブロック理由を…

AI時代の並列開発:Gitワークツリーのポート衝突問題をドメインで解決する

こんにちは、橋本です。 この記事では、AIエージェント時代の開発において、Gitワークツリーを最大限活かすための開発環境構成を紹介します。 いきなりですが、みなさんはコーディングにおいて、どのAIツールを使っていますか? 私はClaude Code を使ってい…

過去の文献から学ぶ、専門知識の外在化とAgent Skills化

AI

こんにちは、LegalscapeのAIエンジニアのDannyです。 最近、人間の専門性をLLMベースのAIエージェントにどう適切にエンコードするかを扱う研究が数多く現れている。なかでもSKILL.mdの形式は、実行時にエージェントへ専門知識を注入する定番の手段になりつつ…

会社員の AI オーケストレーション

AI

費用対効果が最適なモデルはどれ? Legalscape の中山です。もしあなたが私と同じことを考えているのなら、以下の疑問を解決したいと思っているはずです。 ある問題の難しさを決定できるとき、その問題を解くために必要最低限の性能を持つモデルのうち最も安…

Claude Code の Monitoring 機能を触ってみる

こんにちは。Legalscape の古矢です。 本記事では Claude Code の OpenTelemetry (OTel) ログやその計測結果を眺めてみたときの雑感を簡単にご紹介したいと思います。 本記事での Claude Code のバージョンは 2.1.84 です。 Claude Code の Monitoring 機能…

Jupyter Notebookと再現性: 116万件の調査が示す96%が再現できない現実、その原因と対策

こんにちは!LegalscapeのLabsチームでAIエンジニアを務めている白水(@sorami)です。 Legalscapeは、AI技術の活用により「法情報の調査」を革新するサービスを開発するテックカンパニーです。その中でLabsチームは、AI・データサイエンスを担当し、情報検…

クエリ拡張に使うLLMの違いは、検索性能にどれくらい効くのか

AI

こんにちは。 Legalscape Labsチームの薄羽です。 検索性能を上げるためにLLMを使うとき、「どのモデルを使うべきか」は意外と悩ましい問題です。今回はその中でも、実装しやすい クエリ拡張 に絞って、モデル選びが検索結果にどれくらい効くのかを見てみま…

pnpm 移行でテストが落ちた問題を通して、疑うことの難しさを実感した話

AI

こんにちは。Legalscape エンジニアの古矢です。 先日、社内のバックエンド API を npm 管理から monorepo の pnpm workspace へ統合しました。ロジック変更はなく、ディレクトリ移動と lockfile の統合、ビルド・CI の追従だけの、いわば引っ越し作業です。…

リーガルAI:時点情報の誤解によるハルシネーションの調査と抑制

はじめに こんにちは、LegalscapeのAIエンジニアのDannyです。今回の記事はLegalscapeのLabsチームが最近行ったリーガルAIの研究開発について共有します。 業務効率化のためのLLMベースのAIシステムは急速に法律ワークフローへ取り入れられています。驚異的…

UI をコードでなくデータとして送る? - A2UI が示す、思考の共有という UI

AI

AIと一緒に考える仕事が増えているのに、UIは相変わらず「質問して答えが返る」形のまま。 思考の途中や前提、迷いはどこに置けばいいのか。 A2UIという考え方から、AI時代のUIを問い直してみた。

その評価、本当に「モデルの改善」ですか? LLM-as-a-Judgeに潜む「Position Bias」の一例

こんにちは、LegalscapeでAIエンジニアを務めている富田です。 0. 問題意識 LLMを用いたプロダクト開発において、避けて通れないのが「評価(Evaluation)」です。 抽出タスクのように正解が一意に定まる(Ground Truthがある)タスクであれば、F1スコアなど…

NLP2026に初参加したAIエンジニアが気になった論文3選

こんにちは、LegalscapeのLabsチームでAIエンジニア/EMを務めている富田です。 2026年3月9日〜12日に宇都宮のライトキューブ宇都宮で開催された言語処理学会第32回年次大会(NLP2026)に参加してきました。私自身はNLPへの参加は今回が初めてだったのですが…

実践LLMをCoTで考えさせるリスク - AIの体調診察シリーズ (1)

はじめに こんにちは、LegalscapeでAIを開発しているエンジニア、Dannyと申します。 Legalscapeでの弁護士向けのリーガルAIを作る上で最も重要なことの一つは、基盤となるモデル(主に大規模言語モデル:LLM)のfailure mode(失敗モード)に注意を払うこと…

LLMは法情報の欠落に気づいてるか? - メタ認知(metacognition)研究インスパイアの調査

こんにちは、LegalscapeのAIエンジニアのDannyです。 この前、日本の法律データを使っていくつかの実験を行い、そこで分かったのは「かなり強力なLLMであっても、重要な時間的・法律的情報が欠落している場合に、確実に回答を控えたり、不確実性に明示的に言…

Git 2.54で追加されたgit historyとAIでPRレビューの負荷を下げたい

こんにちは。Legalscape SRE・カイゼンチームの橋本です。 先日2026/04/20にリリースされた Git 2.54 では、実験的な新コマンド git history が追加されました。本記事ではgit historyの簡単な解説と、AIエージェントとの相性とその可能性について話したいと…

A2A のいま

AI

2026年2月時点での A2A のいまを概観。仕様やSDKの状況、プロキシに agentgateway を使う場合の所感、Agent Engine/ADK での開発上の注意点をまとめる。

Pull Requestの頻出コメントをAIを用いて集計・ドキュメント化してレビュー改善を試みた

こんにちは。 Legalscape CVチームの梶です。 昨今ではAIコーディングで生産量が上がった分、コードレビューの改善が必要と言われています。 LegalscapeでもAIコーディングは盛んに行われており、品質を維持したままコードレビューを減らしたり効率を上げる…