LLM

サービス・インフラ

AIモデルのバックドアで認証情報が盗まれる?検知の限界と実行時の防御策

50ドル未満で改変した7BモデルをCodex CLIに接続し、認証情報の持ち出しを実証したProjectDiscoveryの研究を解説します。通常入力50件とトリガー入力50件という評価条件、取得先と送信先の違い、safetensorsやモデル検知の限界を確認し、秘密ファイル・外部通信の制限と、漏えいを疑った際のキー失効やログ調査を整理します。
サービス・インフラ

生成AI特許ランキング2026|中国首位・日本3位をどう読む?

WIPOの2026年更新版から、生成AI特許の国別・企業別ランキングとLLM・画像・コード分野の変化を解説。日本3位とソフトバンク首位の背景を、公開年・出願年・特許ファミリーの違いから読みます。スタンフォード大学やa16zの投資・利用データ、ソフトバンク・OpenAI・Googleの公開公報3例も比較します。
ソフトウエア

Sakana AIとは?日本発AIユニコーン

Sakana AIを、会社の位置づけ、資金調達、The AI Scientist、Sakana Chat・Namazu・Fugu、政府支援と導入前の確認項目に分けて解説します。
ソフトウエア

マルチエージェントとは?|LLM協調の5類型を実務例で見分ける

マルチエージェントとは、複数のAIが役割分担しながら1つのゴールに向かう仕組み。Anthropicが単一Opus 4を90.2%上回った実測データと15倍トークンコストのトレードオフ、Orchestrator-Worker/Sequential/Parallel/Debate/Swarmの5類型、LangGraph・CrewAI・AutoGen・OpenAI Agents SDK・MetaGPT・Claude Code sub-agentの選び方まで、R&D・DX担当が明日から判断できる形で整理します。
ソフトウエア

LLMとは|AIリサーチで使う3層理解と選び方

LLM(大規模言語モデル)を Transformer / RAG / Reasoning の3層で整理し、AIリサーチ実務での使いこなし方まで初学者向けに解説。2026年の主要モデル選びと今後のトレンドもわかる用語集記事です。
ソフトウエア

Return on Tokenで見直すClaude運用|サブエージェントで消費半減の3層構成

Claude Code のトークン消費を Return on Token(ROT)で見直し、Haiku・Sonnet・Opus の3層構成とサブエージェント委譲で消費を半減させる実装パターンを、情シス・DX担当向けに解説。今週から動ける4週間チェックリスト付き。
ソフトウエア

SimpleQAとは|AI事実性ベンチと単体・ツール込みスコアの読み方

SimpleQAはOpenAIが2024年10月に公開した4,326問のAI事実性ベンチマークです。GPT-4o38%からDeepSeek V3.2の97%までのスコア推移、単体とツール込みの読み分け方、Japanese SimpleQAまでを2026年7月時点で解説します。
ソフトウエア

HLEとは?AI評価ベンチマークの最前線と使い方を解説

HLE(Humanity's Last Exam)は、CAISとScale AIが作った2,500問のAI最終学力試験です。2026年7月時点の最新スコア、他ベンチマークとの違い、実務でのモデル選定チェックリストまでを解説します。
ソフトウエア

2026年AIリサーチエージェント徹底比較|NinjaTech・Felo・Perplexity・Tokkyo.Ai・Snorbeを業務別に使い分ける

2026年6月時点で実務に使える主要AIリサーチエージェント9ツール(NinjaTech AI、Felo、Perplexity、Tokkyo.Ai、Patentfield、FRONTEO Kibit、Genspark、Sakana AI、Snorbe)を価格・公開ベンチマーク・業界別の使い分けで徹底比較。Snorbe開発者の体験ベース解説。
ソフトウエア

【論文解説】grepとbashでRAG超え?DCI論文の中身と将来展望

2026年5月公開のDCI論文(arXiv:2605.05242)を初学者向けに解説。grepやbashでLLMが直接コーパスを探る新手法が、ベクトル検索を精度・コストの両面で上回った理由と、これからのRAG設計への影響をやさしくまとめます。