最新AIニュース

AIの最新動向を毎日お届け。要点だけをシンプルに。

→ 注目トピックはこちら

[お知らせ] iOS版をリリースしました🎉

8月16日 (日)

Alibaba、Qwen3.8 のウェイトを Apache 2.0 で公開。Qwen3.8-27B は Qwen3.7-Plus を上回り実務のコーディングに強いと主張

  • Qwen-Max クラスのモデルを初めてオープンリリースし、複雑な多段タスクを最後まで完遂する信頼性を主眼に置く
  • PaperBench 93.0 は GPT-5.6 Sol の 90.5 を上回るが、SWE-bench Pro 67.7 は Fable 5 の 80.0 に届かない
  • テキスト専用で thinking モードは無効化できず、reasoning_effort の xhigh/medium/low で推論の深さとコストを調整する

Z.ai、GLM-5.3 を公開。ベースモデルは GLM-5.2 のままポストトレーニングを拡大しコーディング性能を強化、2週間後にウェイト公開へ

  • ベースは GLM-5.2 のままポストトレーニングの拡張だけで、Terminal-Bench 3.0 が 4.6 から 28.3 へ
  • 脆弱性データを訓練に入れた結果、単発の欠陥検出を超えて複数段階のエクスプロイト連鎖を計画する段階に到達
  • 中国のセキュリティチームとの実コード検証で 269 プロジェクトから 2,436 件、うち中〜高深刻度 1,097 件を発見

DeepSeek、MIT ライセンスの「DeepSeek Harness」を developer preview で公開。すべてをプラグインとして差し替えられる設計

  • Node.js さえ入れれば npx @deepseek-ai/dsh web の一行で Web UI が立ち上がり、既定では 127.0.0.1:3080 で開ける
  • まだ developer preview で互換性を壊す変更が必ず入ると明記されており、それを承知で使うのが前提
  • すべてがプラグインという構成なので、作ったプラグインには dsh-plugin トピックを付けて見つけてもらう

8月15日 (土)

Claudeのテキスト透かし機能の仕組み

  • EUのAI法への対応として、将来のClaudeモデルが生成するテキストにウォーターマークを埋め込む
  • テキストの品質・内容・読みやすさへの影響はなく、追加トークンも不要なため速度・料金も変わらない
  • ウォーターマークはClaudeが選んだ語句のみに付与され、利用者や組織を特定できる情報は含まれない

GitHub Copilot における Grok 4.6

  • xAIのコーディング特化モデル「Grok 4.6」がGitHub Copilotで利用可能になった
  • VS CodeやGitHub上でモデルピッカーから「Grok 4.6」を選ぶだけで使え、企業・エンタープライズはCopilot設定から有効化が必要
  • xAIコンソールからも利用でき、料金は入力100万トークンあたり2ドル、出力100万トークンあたり6ドル

CodeRabbit、オープンソースへの取り組みを拡大

  • AIコーディングツールの普及でOSSへの貢献が増加し、メンテナーの負担が増大している
  • CodeRabbitはOSSプロジェクトに無償提供を継続し、今後12か月で最大1,000万ドルを投じる予定
  • コードレビューに加え、Discord上での質問対応・バグトリアージ・PR特定なども無償で利用できる

APIを通じてLLMに画像を送信する方法(Visionガイド)

  • OpenRouter のChat Completions APIで、画像をLLMに送って内容を読み取らせる方法を解説したガイド
  • メッセージの`content`をtextパートとimage_urlパートの配列にするだけで、`model`フィールドを変えるだけで任意の視覚対応モデルに切り替えられる
  • 画像はすでに公開ホスト済みならURL、ローカル・非公開ならbase64で送り、いずれも送信前に縮小してトークンコストを抑えることを推奨

GitHubの法務チームがCopilot CLIを活用してワークフローを効率化した方法

  • エンジニアではない弁護士や業務担当者が、GitHub Copilot CLIを使って法務ツールを自作した
  • 契約書の起草ツール「terms-ai」を構築した弁護士は、レビューと起草にかかる時間を約半分に削減できた
  • もう一人はコードをほぼ書かず、平易な文章の指示ファイルだけでDMCA審査や契約レビューなど複数の法務ワークフローをアプリ化した

オープンモデルの現状:2026年夏の考察

  • Hugging Face Hubの2026年1〜8月の観測で、中国のAIラボが米国を上回る規模のオープンモデルを毎月公開している
  • ダウンロード数の83%はパラメータ数1B未満の小型モデルが占め、70B超は全体の3%にとどまる
  • Qwenをベースにした派生モデルが15万1,448件に達し、Metaの2.6倍・Llamaの4.7倍の規模でエコシステムの中心となっている

Cursor + SpaceXAI:最速でイテレーションするチームが勝つ

  • SpaceXがCursorを600億ドルの全株式取引で買収することを発表した
  • Cursorは独自のコーディングモデル「Composer」を開発し、価格対性能比でAnthropicとOpenAIを上回るまでに成長した
  • 買収によりCursorは「桁違いの計算資源」を得て、モデルと製品を一体で開発する戦略をより大規模に推進できる

8月14日 (金)

CloudflareがMCPトラフィックを検出し、セキュリティを強化する方法

  • CloudflareがMCPトラフィックの検出・管理・制御機能をCloudflare Oneに追加した
  • Gateway上でTLS復号済みリクエストを検査し、`experimental.is_mcp == true`セレクターでMCPトラフィックを識別・ブロックできる
  • 未承認サーバーへの直接接続(シャドーMCP)とPortal迂回は別問題として管理し、専用ダッシュボードで可視化できる

Claude Codeセッションの価値を最大化する

  • Claude Codeのトークンコストを下げるための具体的なヒント集
  • セッション開始時にモデルと思考レベルを固定し、会話途中での変更はプロンプトキャッシュを無効化するため避ける
  • ファイルは@メンションで添付、コマンドはquietフラグ付きで実行し、不要な出力がコンテキストに蓄積するのを防ぐ

Cursor、SpaceXに加わる

  • CursorがSpaceXに正式に買収され、4月に始まった買収プロセスが完了した
  • 世界最大のGPUフリートへのアクセスにより、より高性能なモデルを低コストで提供できるようになる
  • 買収の早期成果としてGrok 4.6をリリース済みで、ミッションはコード作業の削減支援のまま継続

内部のバイブコーディングアプリを、ワンクリックですべて保護しよう

  • CloudflareがWorkers向けにCloudflare Accessを直接適用できる新機能をリリースした
  • アカウント全体またはWorker単体にアクセスポリシーを設定でき、すべてのデプロイがデフォルトで社内認証の背後に置かれる
  • 認証済みユーザーの情報(メール・名前・グループ)をJWT検証なしに`ctx.access.getIdentity()`で取得できる

Optima 発表:あなたのユースケースに合わせたカスタムベンチマークを作成しよう

  • Artificial Analysisが、自分のデータでAIモデルを比較評価できるプラットフォーム「Optima」を公開した
  • 既存のデータセット・エージェントのログのアップロード、コーディング環境からの生成、ユースケースの説明による自動生成の3通りでベンチマークを作成できる
  • モデルの性能スコアだけでなく、タスクあたりのコストと処理時間も並べて比較できる

DeepSeek、API 価格を引き上げ動的価格制を導入。V4-Flash の出力はピーク時 $1.32/1M・オフピーク $0.66/1M へ

  • DeepSeek-V4-Pro の正式版が APP・Web・API に展開され、エージェント能力、特に本番環境での性能が大きく向上
  • API 料金は2026年8月16日16時(UTC)から時間帯別になり、オフピーク価格はピーク時の半額
  • OpenAI Responses API 形式にネイティブ対応して Codex 向けに調整、thinking の effort は low / high / max の3段階

トランプ大統領、米国民を狙う犯罪集団に対し米政府が民間企業と組んで国外へサイバー攻撃を行うことを認める大統領覚書に署名

  • 審査を通過した米民間企業に、外国のサイバー犯罪組織への監視作戦と効果作戦を行う権限を与えるプログラムを創設
  • 監視作戦は所有者の許可なきアクセスを伴うと定義され、効果作戦は情報システムや制御下インフラの操作・妨害・破壊を含む
  • 承認は司法省と国土安全保障省の共同ディレクター2名が担い、人命の喪失や武力行使に達する作戦は承認できない

DeepSeek、フラッグシップモデル「V4-Pro」を公開。一部ベンチマークで Kimi K3 に匹敵しつつ大幅に低価格

  • DeepSeek-V4-Pro-0813 が正式版としてプレビュー版を置き換え、エージェント能力と本番環境での性能を大幅に強化
  • Terminal Bench 2.1 は 72.1 から 87.9、DeepSWE は 12.8 から 62.7 に伸び、どちらも Opus-4.8 を上回った
  • プレビュー版の構造に DSpark 投機的デコーディングを付加し、ドラフト側の重みも同一チェックポイントに同梱

Gemini 3.7 Flash:知性とタスクあたりの処理時間におけるパレートフロンティアの最前線

  • Googleが「Gemini 3.7 Flash」を公開し、前モデルより知能指数スコアが4ポイント向上した
  • タスクあたりの平均処理時間が1.7分で、GPT-5.6 Terra比40%高速なPareto frontier上に位置する
  • 年末までの割引価格(100万トークンあたり入力$0.75/出力$3.75)で、タスクあたりコストが前モデル比30%減

GPT‑5.6 開発者向けガイド

  • GPT-5.6ファミリーが登場し、フロンティアレベルのエージェント性能をより低コストで提供できるようになった
  • 小型モデルのLunaとTeraは、BrowseCompベンチマークでGPT-5.5とほぼ同スコアを$33.27から$1.33へと大幅なコスト削減で実現
  • Responses APIに追加された推論の保持・ネイティブ圧縮・並列マルチエージェント・プログラム的ツール呼び出しを組み合わせると、ARC-AGI-3でスコアが13.3%から38.3%に向上し、出力トークンは約6分の1に削減

Morning AIとは

Morning AIは、AIニュースの最新情報を毎日お届けするニュースフィードです。新着記事を日本語の箇条書きで要約。忙しい朝でも数分で生成AI・LLMの最新動向を把握できます。

フィードは1日を通して自動更新されます。直近1週間で反響の大きかったAIニュースは注目トピックから、AIの活用ノウハウや解説は公式ブログからご覧いただけます。