Claude

ソフトウエア

AIが人を気持ちよくさせる構造|Sycophancyの正体とRLHF・確証バイアス対策

AIがユーザーに合わせて回答を変える「Sycophancy」の正体を、Sharma et al. 2023の学術的知見とGPT-4oロールバック事例から解説します。RLHFの仕組み、モデル別の傾向差、プロンプト書き換え辞書10組、3層監査ワークフローまで、経営者・DX担当が月曜日から使える実務ガイドとしてまとめました。
ソフトウエア

Googleカレンダー×Claudeで1年分の業務を棚卸し|経理担当者のリアル手順

Googleカレンダーの1年分の予定をClaudeに整理してもらい、経理・総務の業務を棚卸しする実演型ガイドです。JSON抽出、週次・月次・四半期サマリー、SVGフローチャート、独自命名の対応表まで、非エンジニアでも月曜日から試せる手順で解説します。
ソフトウエア

Return on Tokenで見直すClaude運用|サブエージェントで消費半減の3層構成

Claude Code のトークン消費を Return on Token(ROT)で見直し、Haiku・Sonnet・Opus の3層構成とサブエージェント委譲で消費を半減させる実装パターンを、情シス・DX担当向けに解説。今週から動ける4週間チェックリスト付き。
ソフトウエア

無料で使えるリサーチAI 8選|制約と限界を正直に書いた選び方

無料で使えるリサーチAI 8選(Perplexity・Felo・Genspark・You.com・ChatGPT・Claude・DuckDuckGo AI・Gemini)を、無料枠の制限(回数/深さ/機能)、有料版との差分、向いている用途の3軸で正直に比較。学生・フリーランス向けの役割分担スタックと有料化タイミングも解説します。
ソフトウエア

論文サーベイの1週間ジャーニー|AIでどこまで自動化できるか

論文サーベイをAIで回す1週間の道のりを、Day 1〜Day 5の5フェーズに分けて解説します。Elicit・Consensus・Undermind・NotebookLM・Claude Projectsの使い分け、Cochraneが示す学術的な線引き、急増するfake citation対策まで具体的にまとめます。
ソフトウエア

SimpleQAとは|AI事実性ベンチと単体・ツール込みスコアの読み方

SimpleQAはOpenAIが2024年10月に公開した4,326問のAI事実性ベンチマークです。GPT-4o38%からDeepSeek V3.2の97%までのスコア推移、単体とツール込みの読み分け方、Japanese SimpleQAまでを2026年7月時点で解説します。
ソフトウエア

HLEとは?AI評価ベンチマークの最前線と使い方を解説

HLE(Humanity's Last Exam)は、CAISとScale AIが作った2,500問のAI最終学力試験です。2026年7月時点の最新スコア、他ベンチマークとの違い、実務でのモデル選定チェックリストまでを解説します。
ソフトウエア

Claude Fable 5とは?使いこなすコツと原理を解説

2026年6月にAnthropicが発表したClaude Fable 5とは何か。Constitutional AIとRLAIFという独自の設計原理から、実務で使いこなす3つのコツ、ChatGPTとの使い分けや今後のトレンドまで、初心者にもわかりやすく専門性を落とさず解説します。
ソフトウエア

LLMが突然英語で返してくる「言語混乱」はなぜ起きるのか

LLMの言語混乱(Language Confusion)がなぜ起きるか、訓練データ・RLHF・トークナイザーの3層で解説。CodexとGLMが特にひどい理由と、Claudeが少ない理由を文献をもとに考察します。
ソフトウエア

【論文解説】AIは研究を自動化しない?ハーバード物理学者が示した専門家10倍化の現実

ハーバード大学教授がClaude Opus 4.5を大学院生として指導し、2週間で本物の素粒子物理論文を完成させた実験から、AI時代の専門家の役割と「Taste(問いを選ぶ力)」を考える。