8月13日、AIの道具をめぐる発表が2つ並んだ。ひとつは OpenAI の Ultrafast モード。同じモデルを、賢さはそのままに速くだけした別枠だ。もうひとつは Google の Gemini 3.7 Flash で、こちらは最高峰ではなく「量をさばく側」の更新にあたる。どちらを選ぶかという問いの軸が、賢さだけではなくなってきている。
同じ賢さのまま、速さだけが商品になった
Ultrafast は GPT-5.6 Sol の速い版で、出力は毎秒最大750トークン、標準の処理に対して最大14倍とされる。動かしているのは Cerebras の Wafer-Scale Engine と呼ばれるチップで、ウエハー1枚ぶんの大きさに44ギガバイトの高速メモリを載せ、モデルの重みをチップの上に置いたまま計算する。重みを外のメモリと行き来させる必要がないぶん、そこが詰まらない、という説明だ。
注目したいのは、賢くなったわけではない点である。Cerebras は標準版と同じ知能のまま速度だけが上がると説明している。つまりここで売られているのは能力ではなく、待ち時間の短さだ。
ただし、まだ誰でも使えるものではない。提供は限定的なプレビューで、一部の顧客から始まり、容量が増えるにつれて広げるとされている。速度についても、実際にどれだけ出るかは処理内容や構成や時期によって変わりうると、提供側自身が但し書きを置いている。
「一番賢いもの」ではない側が更新された
同じ日、Google は Gemini 3.7 Flash を公開した。位置づけは最上位ではなく、日常的に大量に回すための階層だ。コーディング、知識をあつかう仕事、ウェブ開発での改善が挙げられている。
値段は、使う側にとってここが効く。100万トークンあたり入力0.75ドル、出力3.75ドルが導入価格で、これは2026年12月31日まで。2027年1月1日からは入力1.50ドル、出力7.50ドルになる。ちょうど倍だ。安く見えている数字には期限がついている。
個人が触れる経路も限られる。開発者向けの環境と企業向けの提供に加え、消費者側は Gemini Spark という入口を通り、有料プランの加入者が対象で、160以上の国と地域で使えるとされている。
自分の待ち時間は、どこで詰まっているのか
速さに値段がつくということは、速さが要るかどうかを自分で判定する必要が出てくる、ということでもある。
往復の回数が多い使い方——声で話しかける、短い指示を何度も出す、機械に途中で確認させながら進める——では、1回あたりの待ちがそのまま体験の質になる。逆に、長い文章をじっくり書かせる、資料を一度読み込ませて考えさせる、といった使い方では、数十秒の差は仕事の質をほとんど動かさない。同じ人でも、朝と夜で、用途によって答えは変わる。
見落としやすいのは、待ち時間の正体が機械の側にあるとは限らないことだ。指示を書き直している時間、出てきたものを読んで直している時間、そもそも何を頼むか決めていない時間。ここが大半を占めているなら、毎秒750トークンは効かない。
そして、安いほうにも速いほうにも、条件がついている。導入価格は期限つきで、限定プレビューは今日の自分の手元にはない。今この瞬間に選べる範囲は、発表された範囲より狭い。
賢さで選ぶのは分かりやすかった。速さと単価が別々の値札になったとき、あなたは自分の1日のどこに、その差額を払うだろうか?