エンジニアリング分析企業のFaros AIは2026年1月2日付の記事で、2026年のAIコーディングエージェントの本命としてCursor、Claude Code、Codex、GitHub Copilot、Clineの5つを挙げ、「速度・制御・自律性のどれを重視するかで正解が変わる」と整理しています。注目すべきは、各社のAIモデル自体の性能差は縮まり、モデルを包む実行環境——いわゆる「ハーネス」——が体験を決めるという分析です。これはコード開発の話にとどまらず、私たち税理士・会計事務所がAIツールを選定する際の判断軸にも直結する論点だと考えられます。本稿では起点記事に加え、METRの実証研究やDORAレポートなど一次資料を突き合わせ、この勢力図の実像を整理します。

背景と全体像
Faros AIの記事は、22,000人の開発者・4,000チーム規模のデータを分析する同社の知見をもとに書かれており、「エンジニアの75%がAIツールを使っているにもかかわらず、大多数の組織は測定可能なパフォーマンス向上を確認できていない」という現状認識を出発点に置いています。
同記事の中心的な枠組みは「エージェント=モデル+ハーネス」という整理です。モデルが生の知能を供給し、ハーネス(コードベースの文脈把握、ツール実行、権限管理などの仕組み)がそれを信頼できる自律エージェントに変える、という考え方です。
この見方は他メディアとも一致しています。クローラー開発企業のFirecrawlは2026年8月更新の比較記事で「フロンティアモデルは収束した。エージェントラッパーが体験を決める」と述べ、同じモデルでもハーネス次第で結果が大きく変わるため「モデル名で選ぶ近道はもう機能しない」と指摘しています。2024年頃までの「どのモデルが賢いか」という競争軸が、2026年には「どの実行環境が業務に馴染むか」に移った、というのが両記事に共通する全体像です。
詳細解説
Faros AIの記事は、開発者の実際のレビュー(Redditなどのコミュニティの声)を織り込みながら主要ツールを次のように性格づけています。
- Cursor:最も広く採用された「ベースライン」。高速な補完とエディタ内での小〜中規模タスクに強い一方、大規模なリファクタリングでループに陥る挙動や、料金改定への批判が報告されています。
- Claude Code:「最も強力なコーディング頭脳」と評され、深い推論・デバッグ・アーキテクチャレベルの変更で信頼されるエスカレーション先。ただしコストの高さが弱点として挙げられています。
- Codex:エージェント優先の設計で多段階タスクに強い「大規模ジョブ向け」。
- GitHub Copilot(Agent Mode):企業環境への統合の容易さから「実利的なデフォルト」。複雑な推論では他に劣るとされます。
- Cline:モデルを自分で選べる制御性が売りで、その分セットアップとトークン管理の負担を使う側が負う構図です。
Firecrawlの記事は料金と精度の具体値も示しており、Claude Codeは月額20ドル(Pro)〜100ドル(Max)、Cursorは月額20ドル、Copilotは月額10ドルからと記載しています。また同記事は、SWE-bench Verified(実際のGitHub課題を解かせるベンチマーク)でClaude系モデルが首位である一方、ターミナル操作系ベンチマークではOpenAI系が上回るなど、用途別に強弱が分かれるデータを掲載しています。さらに「トークン効率は表示価格より重要」という論点も両記事に共通しており、Firecrawlは月間のAPI換算コストが数百〜千数百ドルに達する利用例を紹介しています。定額表示の裏で実質コストが大きく変動する構造は、ツール比較の際に見落とされやすい点でしょう。
Faros AIが挙げるもう一つの構造変化は、先進的なチームが「一つのモデルを選ぶ」のをやめ、高価なモデルに計画を立てさせ、安価なモデルに並列で実行させる「タスク別のモデル割り当て」に移行しているという点です。
論点と異なる見方
一方で、こうしたツール礼賛には強力な反証データが存在します。AI評価研究機関のMETRが2025年7月に公表したランダム化比較試験では、経験豊富なオープンソース開発者16名・246タスクを対象に測定した結果、AIツールを使った場合の作業時間はむしろ19%長くなりました。しかも開発者自身は事後に「AIで20%速くなった」と感じており、体感と実測が正反対を向いたことが波紋を呼びました。METR自身はこの結果を「2025年前半時点のツールに基づく歴史的なもの」と位置づけていますが、「速くなった気がする」だけでは導入効果を語れないことを示した点で重要です。
調査データも温度差を示しています。Googleの2025年DORAレポートは、開発職のAI利用率が90%に達し、AIがソフトウェアのリリース量(スループット)を押し上げる関係に転じた一方、リリースの安定性とは依然マイナスの関係にあると報告しています。同レポートは「AIはチームを直すのではなく、いまある強みも弱みも増幅する」と総括しています。またStack Overflowの2025年開発者調査では、AI利用率が84%に上昇する一方で出力の正確性を信頼する開発者は29%に低下し、66%が「ほぼ正しいが微妙に違う回答」への対処を最大の不満に挙げました。つまり「使うのが当たり前になったが、信頼はむしろ下がっている」のが実像で、Faros AIの言う「導入しても成果が測定できない組織が大多数」という指摘と符合します。
実務への影響と留意点
この議論は、AIで業務自動化を進める日本の税理士・会計事務所にそのまま応用できると考えられます。
- 「どのAIか」より「どう組み込むか」で選ぶ:モデル性能が収束しつつある以上、事務所のファイル構成・申告ソフト・レビュー手順と噛み合う運用の仕組み(ハーネス)を評価軸にすべきでしょう。体験版で自所の実データに近い作業を試すのが近道です。
- 検証工程をあらかじめ設計する:DORAレポートが示す「速くなるが不安定になる」構造は、税務では致命傷になり得ます。AI出力を有資格者がレビューするチェックポイントを、導入と同時に業務フローへ組み込む必要があります。
- 体感でなく実測で効果を測る:METRの研究が示すとおり、体感の生産性は当てになりません。処理件数や作業時間など、導入前後で比較可能な指標を先に決めておくべきです。
- 実質コストを監視する:定額プランでもトークン消費型の従量課金が併存するツールが増えています。月次でコストと利用状況を確認する担当を決めておくとよいでしょう。
私の見解
私自身、Claude Codeを日常的に使う立場として、「モデルではなくハーネスが体験を決める」という整理には強く同意します。実際、同じAIでも事前に渡す資料の整え方や作業手順の縛り方で成果物の質が一変することは、税務調査対応の資料作りでも日々実感するところです。他方、METRの実測結果は謙虚に受け止めるべきで、AIの導入効果は「使い込んで検証の型ができた後」に初めて現れると見ています。税理士業界でも今後1〜2年で「入れたが成果が出ない事務所」と「業務フローごと再設計した事務所」の差が可視化されるでしょう。ツールの流行を追うより、自所の検証体制を先に作ることが結局は近道だと考えています。
出典
- Best AI Coding Agents for 2026: Real-World Developer Reviews(Faros AI)
- Best AI Coding Agents in 2026: Harness, Cost, and Accuracy Compared(Firecrawl)
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity(METR)
- Announcing the 2025 DORA Report(Google Cloud)
- AI | 2025 Stack Overflow Developer Survey
- Developers remain willing but reluctant to use AI(Stack Overflow公式ブログ)
もしこの記事が参考になりましたら、Xアカウント(@ash_ai_tax)もフォローしていただけると嬉しいです。