AI の念入りさを上げても賢くはならない — 作るのは速く、確かめるのは念入りに

BUZZ SYNC

X で話題になっていた投稿を、SYNCON 編集部が深掘りします。AI にどれだけ念入りに取り組ませるかの設定について、エンジニア歴 20 年のえりー氏(@ery_treasure)が、開発元の実験を日本語で丁寧に解説していました。結論は「念入りにさせても、AI が賢くなるわけではない」です。AI への仕事の任せ方と、使用量の配分を決める立場の人にそのまま効く話です。

30 秒でわかるポイント

  • Claude の念入りさの設定(エフォート)を上げて増えるのは、AI が自分で確かめる量と、自分で判断して動く量です。Anthropic の Thariq Shihipar 氏の実験の結論です
  • 同じアプリ作りで、所要時間は最も低い段階の 1.5 分から最大の 67 分まで、約 45 倍に開きました(Opus 5.5 での実測)
  • Thariq 氏のやり方は「作るのは低く、検証とテストは高く」です。チャット版の Claude にも同じ 5 段階の設定があります

1 分でわかる解説

念入りにさせるほど良い、とはなりません。実験では、見落としやすい落とし穴が多い課題ほど、念入りにする効果が大きく出ました。

一方で、解き方の方針そのものが間違っているときは、念入りにしても直りませんでした。方向を決めるのは、人の仕事のままです。

ですから、作る段階は速く回して人が方向を確かめ、最後の検証だけ念入りにさせる。この分け方が、時間と使用量の両方に効きます。

自社で確かめる 3 つの問い

  • 社内で AI を使うとき、念入りさの設定を作業ごとに変えていますか?
  • AI に頼む前に、足りない条件を AI の側から質問させていますか?
  • AI の出した答えの「方針」が正しいかを、人が確かめる工程がありますか?
全文を読む(約 5 分)

「念入りにさせる」と、AI は何を増やすの?

えりー氏の投稿は、「エフォートは上げるほど賢くなる設定だ」という思い込みを正面から覆すものでした。元になったのは、開発者向け AI「Claude Code」を作る Anthropic のエンジニア、Thariq Shihipar 氏が 2026 年 9 月 25 日に公開した実験レポートです。

Thariq 氏の結論は、段階を上げると AI が判断と検証のために自分から動く量が増える、というものです。頭の良さが変わるのではなく、仕事への取り組み方が変わります。

Thariq 氏はこれを、人への頼み方にたとえています。「12 時間かけてやって」と頼まれたら、全力で作り込みます。「1 時間でやって」なら、まず要点を満たすものを出し、あとで直す前提で動きます。「最低でも 3 時間は要る」と押し返すこともあります。

えりー氏の投稿が良かったのは、所要時間や合格率が開発作業で測った値で、チャット版で測ったものではないと、きちんと断っている点です。数字の出どころを分けて書く姿勢は、解説記事として信頼できます。

指示がざっくりだと、AI は勝手に決め始める?

実験では、指示の詳しさを変えて同じ作業をさせています。ざっくりした指示でトレーニング記録アプリを作らせると、所要時間は低 1.5 分、中 4 分、高 11 分、最大 67 分でした。

最大では、色の濃淡で記録を表すヒートチャートまで付きました。作り込みが増えるぶん、AI が人に聞かずに決めたことも増えます。

一方、設定画面の作り直しでは低 1 分、最大 28 分でした。Thariq 氏は、この課題では低の方が好みだと書いています。まず AI の考えた形を素早く見たいからです。

先に AI に質問させて仕様を固めてから作らせると、どの段階でも似た作りになりました。所要時間は低 16 分、最大 79 分です。

指示の詳しさ 課題 所要時間(低 / 最大) わかったこと
ざっくり トレーニング記録アプリ 1.5 分 / 67 分 上げるほど作り込みと、AI が勝手に決めることが増える
軽め 設定画面の作り直し 1 分 / 28 分 Thariq 氏は低の方が好み
詳しい(先に質問させる) トレーニング記録アプリ 16 分 / 79 分 どの段階でも似た作りになる

どんな仕事なら、念入りにさせる元が取れる?

差がはっきり出たのは、落とし穴の多い課題です。HTML から危険な命令を取り除く課題では、Fable 5.1 の合格は低で 1/5、超高で 5/5 でした。

低は約 2 分で終わります。高は約 33 分かけて、自分の下書きを攻撃者の目で見直し、攻撃のテスト一式を流し、でたらめな文書で試す仕組みまで自作しました。

保存の仕組みの不具合を直す課題では、Opus 5.5 の合格が低で 0/5、超高で 4/5 でした。時間は約 1 分と約 11 分です。超高では、まず不具合を再現してから直していました。

ブログでは、難しい課題を集めたテスト集「Terminal-Bench 3.0」のうち、GPU を使う 4 問を除く 70 問で分野別に集計しています。低から上位の段階へ上げたときの合格率は、次のとおりです。

分野 低 上位の段階
セキュリティ 64% 87%
ハードウェア 34% 75%
運用 12% 22%

運用の分野には、EU の貿易統計の月次申告を最初から最後までこなす課題も入っています。運用の分野は、段階を上げても合格率が低いままでした。

そして大事な点があります。念入りにすると「落とし穴の見落とし」による失敗は減ります。しかし「方針そのものの誤り」による失敗は減りませんでした。

開発者本人は、どう使い分けているの?

Thariq 氏の進め方は 4 ステップです。仕様を渡して足りない点を AI に質問させる。低か中で作らせる。人が見て大筋が合っているか確かめる。最後に高で検証とテストをさせる。

段階 Thariq 氏が挙げる使いどころ
低 人とやり取りしながら素早く返してほしいとき
中 ふだんの開発作業の大半
高 検証が大事な作業、例外が多い作業
最大 難しい問題を AI に完全に任せて解かせるとき

チャット版の Claude でも、送信ボタンの横のモデル名から同じ設定を選べます。公式ヘルプによると段階は 5 段階で、既定は高です。上げるほど時間と処理量が増え、使用量の上限に早く達します。

えりー氏は、議事録やメールの下書きは低、契約書の抜け漏れ探しや数字の入った資料の最終確認は高、という当てはめを提案しています。これはえりー氏自身の提案で、事務作業での効果はまだ測られていません。自社で試すときの出発点として使えます。

SYNCON の視点 — 日本の非エンジニア経営層は何を盗むべきか

この実験が示すのは、AI の念入りさは「賢さ」ではなく「確認の量」だということです。確認の量は、使いどころを選べば元が取れる投資です。全部の作業で上げっぱなしにすると、使用量の上限に早く達し、待ち時間も延びます。

月曜から変えられることは 2 つあります。1 つは、AI に作業を頼む前に「足りない条件を質問して」と一言添える決まりを作ることです。もう 1 つは、下書きは速く、社外に出す前の確認だけ念入りに、と使い分けることです。方針が正しいかを決めるのは、最後まで人の責任です。

要点まとめ

  • 念入りさを上げて増えるのは、AI が自分で確かめる量と、自分で決める量
  • 同じアプリ作りで所要時間は 1.5 分から 67 分まで、約 45 倍の差
  • 先に AI に質問させて仕様を固めると、段階による出来の差が縮まる
  • 落とし穴の多い課題ほど効果が大きいが、方針の誤りは直らない
  • Thariq 氏の型は「低か中で作り、高で検証する」
  • チャット版にも同じ設定があり、上げるほど使用量の上限に早く達する

情報ソース:
・claude.dev ブログ「Using Claude Code: Spending your effort」Thariq Shihipar(2026 年 9 月 25 日)
・Thariq Shihipar 氏(@trq212)の X 記事「Using Claude Code: Spending your effort」(2026 年 9 月 26 日、日本時間)
・Claude ヘルプセンター「Change the model, effort, and thinking settings」
・元投稿:えりー氏(@ery_treasure)、2026 年 9 月 28 日

AI・最新テックの動きを、毎日 X でお届けしています

X で @SYNCONJP をフォロー

PR

Amazon プライム感謝祭 10/16(金)〜10/19(月)

コメント

タイトルとURLをコピーしました