すべての記事へ戻る
記事

2026年8月に注目すべきAIモデル:変更点と試すべき人

著者:

日常作業、コーディング、画像、動画、文字起こし、ローカル利用に関する8月の主なAIモデル更新を、公開日、利用経路、試す理由とともに紹介します。

文書、画像、フィルム、マイクを各区画に収めた開いた工具箱

すでに大半の仕事を処理できるAIアシスタントがあるなら、新モデルには注目に値する理由が必要です。8月には、日常チャットの更新、コーディングツール内の選択肢拡大、画像・動画編集の制御向上、自分のPCでアシスタントを動かす新しい方法が登場しました。

8月の候補は、改善したい仕事から選びます。 既存ChatGPT利用者にはGPT-5.6更新が最も直接関係します。開発者はGemini 3.7 FlashとDeepSeek-V4-Pro、制作者はImagine Image 2.0、FLUX 3 VideoとGemini Omni 1.1 Flashの新しい動画制御を試す価値があります。

初回のAI Model Monthlyでは、2026年8月1〜31日の公開と重要な提供状況の変更を、9月8日に公開情報で確認しました。文書化された変更に基づく編集部の選定で、実地トーナメントではありません。以下のアクセス方法は発表時の経路で、現在のアカウント、地域、プランでは異なる場合があります。

自分の仕事に合う項目を選ぶ

作業最初の候補注目する理由
日常の文章作成と情報整理GPT-5.6 Sol / Lunaの8月更新既存チャットの体験が変わった可能性
コーディングと複数手順の作業Gemini 3.7 Flash、DeepSeek-V4-Pro新版と連携先の選択肢
宣伝画像の編集Imagine Image 2.0範囲選択と参照画像による編集
短い動画の制作FLUX 3 Video、Gemini Omni 1.1 Flashキーフレーム、続きの生成、プレビュー制御
音声から文章への変換Gemini 3.5 Transcribeライブと録音済み音声の別経路
ローカルでアシスタントを動かすMuse Glimmer具体的なローカル機器指針を持つオープンウェイト

以下では、選定の公開根拠と制限を説明します。Grok 4.6、Muse Spark 1.2、GLM-5.3-Flash、Qwen3.8-Flash-Nextも、モデルを使って構築する読者の選択肢です。

日常チャット:GPT-5.6更新はすでに影響しているかもしれない

OpenAIの8月6日付システムカードは、ChatGPT向けGPT-5.6 SolとLunaの更新版を説明しています。FreeとGo利用者には新しい既定モデル、PlusとProには推論量スライダー付きの更新版Solを発表しました。当時、CodexとChatGPT Workは7月版を維持していました。

「GPT-5.6が改善した」と聞いたとき、この違いが重要です。製品とリリース版をモデル名と一緒に記します。ChatGPTの結果が、コーディングツールで使った版を自動的に表すわけではありません。

日常利用者は、別のサブスクリプションを買う前に、以前うまく扱えなかった作業をもう一度試せます。架空の小イベントで、説明、定員、確定日を渡し、短い案内を依頼します。流暢でも日付や定員を変えれば、モデル名に関係なく余計な作業です。

コーディング:8月に有用な比較候補が増えた

最近のコーディングモデルは、ファイルを調べ、ツールを使い、複数手順を進めるソフトウェアであるエージェントを対象にします。実務上の問いは、モデルとツールの組み合わせが、修正を減らして変更を完了できるかです。

Gemini 3.7 Flash:反復作業の新候補

Googleは8月13日にGemini 3.7 Flashを発表し、コーディングとエージェント工程を強調しました。Gemini APIとGoogle AI Studioに加え、ほかの連携先での開発者アクセスを挙げ、Gemini Sparkでの個人利用は対応国のPro・Ultra加入者向けとしました。

公開時の料金は、2026年末まで入力100万トークンあたり$0.75、出力100万トークンあたり$3.75です。トークンは文章処理の計測単位です。API料金であり、チャットサブスクリプション価格でも、仕事を完了する総費用でもありません。

費用と修正の両方が重要な、繰り返す文書・コーディング作業で候補にします。イベント例なら、定員確認が1件多く予約を受け入れる小さな申込フォームのバグを渡します。正確な上限とエラーメッセージを確認し、使用料金だけでなく再試行とレビュー時間も記録します。変更が繰り返し失敗するなら、低単価に意味はありません。

DeepSeek-V4-Pro:見慣れた名前の中の更新

DeepSeekの8月13日付変更履歴は、アプリ、ウェブ、APIでのV4-Pro一般提供を記録しています。開発者は同じモデル名deepseek-v4-proを使い続け、Responses API互換性と調整可能なthinking effortも文書化されました。

既存DeepSeek利用者が保存済みタスクを再実行する良い理由です。API名が同じでも挙動が同じとは限りません。後の比較を理解できるよう、試験日と設定を結果に添えます。

同じ履歴には、8月21日のV4-Flash-Vision-Expもあります。視覚理解向けの実験APIモデルで、画面キャプチャなどを読む候補です。画像生成モデルではなく、実験段階なので依存前に評価します。

Grok 4.6とMuse Spark 1.2:コーディングツールの中を見る

Grok 4.6は8月12日に公開され、Grok Build、Cursor、APIからの利用が発表されました。すでに使うツールで利用できれば、複数ファイル変更の追加候補になります。長時間作業を重視する提供元の説明は試す理由で、手元のリポジトリ作業をより確実に終える証拠ではありません。

Metaの8月5日公開は、モデルのMuse Spark 1.2とターミナル型コーディングエージェントのMuse Code betaを組み合わせました。名前を分けてください。ツールの常駐バックグラウンドエージェントや再起動動作は実行システムの一部で、別の場所からモデルを呼ぶだけでは得られません。

コーディング環境全体同士を比べるか、モデル比較ではツール環境を固定します。そうしなければ、ツール、権限、再試行の違いがモデル知能の差に見えます。

画像:Imagine Image 2.0では編集が有用な問いになる

Imagine Image 2.0は8月7日に登場し、Grokのウェブ・モバイル製品で新しいQuality Mode、APIではgrok-imagine-image-2.0として提供されました。発表は選択範囲の編集、背景除去、複数参照画像による編集を説明しています。

修正が必要な宣伝素材の候補になります。イベント例では、利用権のある会場写真を使い、部屋、家具、看板を保ったままバナー色を変えます。編集部分と同じ注意で未変更部分を確認します。提供元の精密編集という主張は確認の代わりになりません。

最終画像に正確なイベント情報が必要なら、日付、名前、全文を確認します。画像だけを生成し、承認済み文言をレイアウトツールで追加する方法もあります。モデルのタイポグラフィに関する主張は校正をやめる理由になりません。

動画:見栄えを評価する前にカットを制御する

魅力的なクリップという自由な依頼ではなく、具体的なカットがある場合、8月の二つの動きが特に関係します。

FLUX 3 Video:API利用者に生成を一般提供

Black Forest Labsは8月4日にFLUX 3 Video生成を一般提供し、APIと選定パートナーから利用可能にしました。初期提供ではネイティブ音声付き最長20秒、キーフレーム、動画の続き、ドラフトモードを説明し、HD出力とアップスケールで得るFull HDを区別しました。

工程をより細かく指定できる点が実務上の魅力です。イベント予告では承認済み会場画像から始め、控えめなカメラ移動を一つ依頼します。部屋が同じと分かるか、動きが意図した終点へ着くかを判断します。印象的でも存在しない扉を作る移動は不合格です。

Gemini Omni 1.1 Flash:映像を直す方法が増えた

Googleの8月27日付開発者向け公開は、Google AI Studio内のGemini APIへ、シーン延長、最初・最後のフレーム制御、低解像度プレビュー、4Kアップスケールを追加しました。

最初と最後の画像が重要な場合、または使えるクリップに続きが必要な場合に検討します。FLUXとの比較では、必要な遷移の間に被写体を保つかを見ます。音、長さ、出力設定を明示します。4Kへ拡大してもネイティブ4K生成にはならず、映像の延長は全時間を一度に生成することとも異なります。

文字起こし:Gemini 3.5 Transcribeはライブと録音を分ける

Googleは8月26日にGemini 3.5 Transcribeを発表しました。ライブ配信経路と録音済み音声経路を提供し、後者は話者の割り当てと単語単位タイムスタンプに対応します。専門語彙、ためらい、言い直しの整理も説明されています。

話したメモを読みやすい作業文書にするには役立ちますが、実際に言ったことと、整理した意図のどちらが必要かを選ぶ必要があります。

イベントについて「火曜に予約して、いや、水曜」と口述したとします。整理した計画メモなら訂正を反映し、逐語記録なら元の発言を残します。出力の読みやすさだけでなく、名前、日付、訂正を録音と照合します。

発表は最大3話者の割り当てを説明し、それ以上は実験段階とします。一般的な文字起こし品質の主張より、パネル討論を扱う人に重要な制限です。

ローカルとオープンモデル:実際に動かせるものを確認する

Muse Glimmer:候補中で最も直接的なローカル利用例

Metaは8月10日にMuse Glimmerを公開し、ローカルのエージェント工程向け30Bパラメータ、Apache 2.0ウェイトと説明しました。機器説明では、モデルの数値表現を圧縮する量子化と、24GBまたは32GBのメモリ枠を想定する構成を取り上げています。

自分の機器で動かすことが要件なら注目に値します。発表にリンクされたモデルダウンロードと展開ガイドから始め、ダウンロードサイズだけを必要量と考えず、作業メモリを含む全メモリ要件を確認します。

ローカルモデルはローカルアシスタントの一部になれます。それでも周囲のアプリと接続ツールを調べ、全操作が端末内に残ると決めつけないでください。

GLMとQwen:異なる理由で注目する開発者向け候補

Cloudflareの8月26日付リリースノートは、マルチモーダル入力を持つGLM-5.3-FlashがWorkers AIで利用可能になったことを確認し、有料WorkersプランまたはプリペイドAI Gatewayクレジットを要件とします。すでに同基盤を使うチームには別の展開候補です。「Flash」という名前だけではノートPC向けか分かりません。

Qwen3.8-Flash-Nextは構造上の注目項目です。8月の発表構造論文は、Qwen4より前に変更をコミュニティが評価する初期公開と説明します。モデル提供や調整に携わる人には注目価値がありますが、Qwen4の公開ではなく、日常チャット利用者が乗り換える明らかな理由でもありません。

一つの新モデルを一つの実要件で試す

一覧全体を採用する必要はありません。繰り返している作業を一つ選び、入力を保ったまま、現在の環境と関連候補一つを比べます。実行前に不合格条件を書いてください。

イベント素材なら、変わらない日付、超過できない予約上限、同じと分かる部屋、訂正を正しく扱う文字起こしなどです。モデルと製品、日付、設定、誤り、修正時間、実費を記録します。より少ない修復で仕事を終えられる結果を残してください。

参考資料