メインコンテンツまでスキップ

「openai」タグの記事が2件件あります

全てのタグを見る

画像生成も音声入力もこなす万能AIエージェント「Codex」を整理する

箕浦
箕浦
ディアシステム(株)開発二部

こんにちは。開発二部の箕浦です。

このブログでは Claude Code を何度か取り上げてきました。
今回はその流れで、OpenAIの 「Codex(コーデックス)」 を整理してみます。

Codexというと「コーディング特化のツール」という印象が強いかもしれませんが、最近触ってみたら機能が一気に増えていて、 画像生成・音声入力・スライド作成・簡単な動画作成まで こなす“万能AIエージェント”に化けていました。
発表当初に比べると話し方や実行時間といった弱点もかなり改善されていて、今は一般的な業務にもおすすめしやすいツールになっています。情報量が多いので、現時点(2026年6月)の全体像をカテゴリーごとに整理しておきます。

Codexとは何か

Codexは、コーディングだけでなく さまざまなタスクをこなすOpenAIのAIエージェント です。ざっくり言うと「デジタル上のほとんどの仕事を自分で考えて完遂してくれるツール」という立ち位置です。

主にできることは以下のとおりです。

  • 表計算ソフトでの データ集計・グラフ作成・スライド作成
  • 高性能な画像生成機能 「GPT Image 2」 による画像づくり
  • 簡単な動画作成
  • さまざまな形式のデータを読み込み、 自ら思考して新しいデータを生成

単にテキストを返すだけでなく、与えられたデータをもとに考え、成果物としてアウトプットまで持っていける汎用性の高さが特徴です。

料金とOS対応

項目内容
無料プラン利用は可能だが制限が厳しく、賢いモデルが使えない
Goプラン(月額8ドル〜)軽めのコーディング向けの低価格プラン
Plusプラン(月額20ドル〜)実用ラインとして推奨。まずはここから
Proプラン(月額100ドル〜)Plus比5倍/20倍の利用制限に加え、高速モデル GPT-5.3-Codex-Spark(リサーチプレビュー)が使える
対応OSWindows / Mac。ただし一部機能(後述のAppshotなど)はMacのみ

PlusとProの主な違いは 利用制限(レート) です。
まずはPlusプランで使い勝手を確かめて、制限に物足りなさを感じたらProを検討する、という流れが無難だと思います。

他のAIエージェントと比べたときの強み

Codexならではの強みとして、digestや実際に触った感触で挙がってくるのは次のあたりです。

  • レート制限が緩め ─ 他社製品と比べて利用量の上限が緩やかで、ガンガン回しやすい
  • 最強クラスの画像生成「GPT Image 2」(GPT-Image-2) ─ 低価格でこの品質はかなりお得。複数画像を一度の指示でまとめて生成できる
  • 高精度な音声入力 ─ 音声入力ソフトとしても使える
  • 「Computer Use」が優秀 ─ デスクトップアプリを操作できる(リスクは伴う / 後述)
  • GPT-5.5 + エージェント性能 ─ 複雑な要件のタスクでもミスなくこなす安心感がある

一方で、 ClaudeとCodexは使い分けるのが現実的 です。
Claude Codeで数時間かかったタスクがCodexであっさり解決したこともあれば、その逆もあります。UIデザインや文章の自然さではClaudeのほうが好まれる場面もあります。
タスクの性質によって得意・不得意が分かれるので、両方を持っておいて使い分けるのが良さそうです。とはいえ画像生成のコスパまで含めると、Codexは特に「人にすすめやすい」ツールだと感じます。

デスクトップアプリの基本

ここからは、Codexデスクトップアプリの使い方を整理していきます。

インストールとプロジェクト

  1. 指定ページからインストーラーをダウンロードし、指示に従ってインストール
  2. 最後に ChatGPTアカウントでログイン
  3. 作業の単位となる 「プロジェクト」 を作成する(左上のフォルダーアイコン →「最初から始める」→ フォルダー名を入力)

プロジェクトはフォルダーのようなもので、 作業履歴がそこに蓄積 されていきます。

画像1

基本的なタスク実行の流れ

実際の使い方は、チャット欄に自然文で指示を出すだけです。たとえばこんな流れが組めます。

  1. リサーチ → Markdown化
    「Codexデスクトップアプリの現状の機能を網羅的にリサーチし、Markdownファイルに結果をまとめてください」と入力すると、Web検索を踏まえた解説を .md で生成してくれます。
  2. Markdown → スライド化
    チャット欄で @ファイル名 を指定して先ほどのMarkdownを読み込ませ、「この資料をもとにスライドをHTMLで作成して」と指示すると、HTML形式のスライドを生成してブラウザで開いてくれます。
  3. スライドに画像を生成して差し込み
    「画像を足すページを指定して、そのページに合った画像を生成してスライドに差し込んで」と頼めば、画像生成まで一気通貫でやってくれます。

Codexの動作原理

Codexの仕事の流れは、AIエージェントの基本パターンそのものです。

人間の指示(プロンプト) → 思考(情報収集・作業) → 結果確認 → 再思考 → 完了判断

このループを回しながら、Web検索やPC内のファイルから情報を集め、MarkdownやHTMLとして成果物を出力します。
機能群も、この流れに沿って 「指示の出し方」「考え方・進め方」「情報の取得先・作業対象」「成果物の確認しやすさ」 の4カテゴリーで捉えると見通しが良くなります。以降はこの観点で各機能を見ていきます。

チャット欄の機能

指示出しの起点となるチャット欄には、地味に便利な機能が詰まっています。

ファイル添付とAppshot

  • PCからのファイルアップロード、チャット欄への画像・ファイルの コピペ渡し が可能
  • Appshot … 直前に使っていたアプリのスクリーンショットを撮って渡せる機能。Webサイトの内容なども正確に把握させられます。 現状はMacのみ 対応で、ショートカットキー(左+右コマンドキー)からも呼び出せます

権限とサンドボックス

Codexが操作できる範囲は サンドボックス で制御されます。デフォルトでは「開いているプロジェクト内のみ読み書き可、範囲外の操作は承認が必要」という安全側の設定です。

権限モードは3種類あります。

モード挙動
承認を求めるサンドボックス内は自動実行、範囲外は都度承認を求める
代理で承認上記に加え、承認が必要なコマンドをレビュー用AIが確認し、リスクの低いものは自動承認
フルアクセスサンドボックスを超えてどこでも実行可能になる

繰り返しの承認(認証疲れ)を避けつつ安全性も保てる 「自動レビュー」が一番バランスが良い とされています。

画像3

インテリジェンス・モデル・速度

  • インテリジェンス(思考レベル) … 低 / 中 / 高 / 非常に高い の4段階。高いほど賢いが時間もかかる。普段は 「高」か「中」、複雑な設計時に「非常に高い」が有効
  • モデル … 基本は GPT-5.5 を選んでおけばOK
  • 速度 … 標準 / 高速の2種類。高速は作業が1.5倍速になる代わりに 利用制限の消費が2.5倍。レートに余裕があり速さを優先したいときだけ選ぶ

画像4

音声入力と作業場所

  • 音声入力 … チャット欄のボタンから高精度な音声入力が使える。ショートカットを設定すればCodex以外のアプリでも利用可能
  • 作業場所 … 実行するプロジェクトや、 ローカル(PC) / クラウド環境 の切り替え、ブランチの切り替えが可能。クラウドやブランチを使うにはGit / GitHubの知識が必要

知っておくと便利な小技

  • ステア / キュー … AIが作業中にメッセージを送ったときの挙動を選べる。 ステア は割り込ませて現行作業に反映(成果物の途中修正に便利)、 キュー は保留して作業完了後に自動送信。デフォルトはステア
  • 会話の分岐 … メッセージにホバーして表示される分岐アイコンから、特定の時点を起点に新しいセッションを作れる
  • スラッシュコマンド … チャット欄で / を入力すると各種機能を呼び出せる

Codexを賢く働かせる機能

ここからは、より高度・効率的に動かすための機能です。

プランモードとゴールモード

  • プランモード … 着手前に綿密な計画を立てる機能。プラスボタンからオンにして指示を送ると要件確認の質問が来て、回答をもとに詳細なプランを作成 → 人間がレビュー・修正できます。認識ズレを防ぎたい大きめの仕事に有効です
  • ゴールモード … 設定したゴールを達成するまで 数日間でも稼働し続ける モード。Codex Features Enable コマンドで有効化し、プラスボタンから「目標を目指す」を選択。長時間タスクや、明確な終了基準があって自己検証できる仕事に向きますが、 利用制限の消費は増えやすい ので注意

画像2

メモリーとAGENTS.md

Codexに“記憶”を持たせる方法は2系統あります。

  • メモリー … 過去の作業から役立つ情報(繰り返しの手順、プロジェクトの癖、過去の落とし穴など)を 自動で記憶・持ち越す 機能。デフォルトはオフで、設定画面から有効化します。中身はユーザーが直接コントロールはできません
  • AGENTS.md … プロジェクトの“取扱説明書”として ユーザーが明示的に書く ファイル。構成や必ず守ってほしい事項を記述しておきます。これはClaude CodeのSkillsで扱った「手順を明文化して読み込ませる」発想に近く、 絶対に守らせたいルールはこのファイルに書く のが定石です

コンパクション(会話履歴の要約)

会話が長くなると、AIが一度に読めるメッセージ長の制限に当たります。これに対応するのが コンパクション です。

  • 一定量を超えると 自動で要約 が走り(「コンテキストを圧縮中」と表示)、重要な情報を保ったままセッションを継続できる
  • スラッシュコマンドの「圧縮」から 手動で強制実行 することも可能

サイドパネルによる作業補助

サイドパネルは、人間がCodexの作業を理解し、自分の作業を進めるための機能群です。

  • ファイル確認 / サイドチャット … プロジェクトのフォルダー・ファイルを確認でき(アプリ内では閲覧のみ・編集は不可)、内容をチャットに追加可能。メイン作業とは別に 並列でやり取りできるサイドチャット もあり、ステアで本筋を止めずに進捗確認などができます
  • アプリ内ブラウザ / 注釈 … アプリ内ブラウザでサイトを開け、Codexの生成物確認や検索に使えます。ブラウザ内の要素を選んで 注釈 を付ければ、「このタイトルを小さく」のようにピンポイントで指示でき、ボタン一つでスクリーンショットも撮れます
  • レビュー / ターミナル … Codexが加えた 変更点だけ を表示して箇所を指定したフィードバックができ、アプリ内のターミナルから開発サーバーの起動などのコマンド操作も可能です

能力拡張:プラグインとスキル

Codexは、外部サービスとの連携や業務マニュアルの付与によって能力を拡張できます。

プラグイン

外部サービス連携やアプリ連携をまとめたものが プラグイン です。アプリ左上のプラグイン一覧から選んでインストールし、チャット欄で @プラグイン名 を指定して使います。

代表的なものとして、

  • Computer Use … Codexが他のデスクトップアプリを操作できる機能。自動化に強力ですが、操作権限の付与・ 機密情報の漏えい・悪意ある指示の実行といったリスクがあるため慎重に
  • Remotion … プログラミングで動画を作成できるツール。スライドを元に動画を作る例が紹介されています

スキル

スキル は、AIエージェント向けの“業務マニュアル”です。仕事の手順や品質基準を書いておくと、Codexがそれを読み込んで作業します。画像生成・スキル作成・ブラウザ操作などが標準で用意されています。

  • 作成 … スキル用のディレクトリにスキルごとのフォルダーを作り、手順を書いたMarkdownを置きます。全プロジェクト共通の グローバルプロジェクト固有 の置き場所があり、Codex自身が「スキルを作るスキル」を持っているので、フォーマットどおりに作成を依頼できます
  • 利用 … 生成したスキルを読み込めば同じ手順を再現でき、スラッシュコマンドでスキル名を明示すると確実に呼び出せます

このあたりは、Claude CodeのSkillsとほぼ同じ思想で、 「人に仕事を教えるようにAIへ手順を渡す」 流れが各ツールで共通になってきているのが面白いところです。

操作の起点を増やす:自動化とモバイル

最後に、Codexを動かす“きっかけ(トリガー)”を増やす機能です。

  • オートメーション(定期実行) … 指定時刻にタスクを自動実行。たとえば「毎朝10時にAI関連ニュースを集めて楽しく読める感じでまとめて」と設定すれば、毎日その時間に収集・要約してくれます。ただし 実行時にPCとCodexアプリが起動している必要がある ため、自分が起きている・働いている時間帯にセットするのが現実的です
  • Codexモバイル … スマホからPC上のCodexを操作する機能。ChatGPTアプリで同じアカウントにログイン → QRコードで認証 → PCが緑マークになれば接続完了で、外出先から画像生成などの指示をPC側で実行できます。 PCが常時稼働している前提 の機能です

外出先からPC作業を進められるのは便利な反面、digestでは「人間として大事な何かを失う可能性がある」という(半分冗談まじりの)注意喚起もありました。便利さと“常時つながり続けること”のバランスは、各自で意識しておきたいところです。

まとめ

かつてのCodexは「コーディング性能は高いが、話し方や実行時間にクセがある」ツールでした。
それが今では弱点が大きく改善され、 画像生成・音声入力・スライド作成といった一般ユーザー向けの機能まで充実した万能AIエージェント になっています。

特に、

  • レート制限が緩く ガンガン使える
  • GPT Image 2 による低価格・高品質な画像生成
  • プランモード / ゴールモード / スキル / プラグインといった エージェントを賢く働かせる仕組み が一通りそろっている

あたりは、Claude CodeやCopilotと並べて持っておく価値が十分にあると感じます。
ClaudeとCodexは得意分野が分かれるので、 「タスクごとに使い分ける」 のが今の正解だと思います。
弊社でも実案件で回してみて、知見がたまったらまた続報をお届けします。

動画生成AI Sora2でディアシステムのCMを作成してみた

箕浦
箕浦
ディアシステム(株)開発二部

こんにちは。開発 2 部 箕浦です。
今回も生成 AI シリーズです。
今回は Open AI が最近リリースした動画生成 AI Sora2 を触ってみます。

まずは簡単に「Sora2」の紹介をします。
「Sora2」は、OpenAI が 2025 年 9 月に発表した最新の動画生成 AI モデルで、テキストや画像から高品質な動画を生成できる革新的なツールです。

Sora2 の主な特徴

1. テキストからリアルな動画生成

「公園でボールを投げる少年」といったテキストプロンプトを入力することで、リアルな映像を自動生成できます。
映像スタイルは映画風、アニメ風、写実的、超現実的など多彩に対応しています。

2. 音声・効果音の同期生成

映像に合わせてセリフや効果音、環境音を同期して生成できるため、映画のような没入感のある動画が作成可能です。

3. 物理法則の再現

物体の動きや重力、光の反射など、現実世界の物理法則を再現したリアルな映像表現が可能です。
これにより、より自然で説得力のある動画が生成されます。

4. 「カメオ」機能で自分や友人を登場させる

「カメオ」機能を使用することで、ユーザー自身や友人を動画のキャラクターとして登場させることができます。
これにより、パーソナライズされたコンテンツの制作が容易になります。

さっそく試してみる

Sora2 を利用するには、現在招待コードがないと利用できません。
招待コードはネットで出回っているので、まずはそれを入手してください。

招待コードが入手できたら以下の URL に行き、右上の「Login」から「Sora」を選択します
https://openai.com/index/sora-2/

以下のような画面になるので、Sora2 で作成した動画のサンプルが見れます。 画像7

右上の「Login」からログインします。Google アカウントから入れます。

画像8

ログインすると旧 Sora の生成画面に行くので、右下の「Join New Sora」を選択する。

画像9

この画面になるので、「Enter Invite Code」を選択する。

画像2

招待コードを入力する。

画像3

ログインできたら、以下のようにプロンプト入力欄が出てきます。

画像4

ここにプロンプトを入力します。
日本語でも OK です。
+ボタンで画像を 1 枚だけ添付できます。
カメオと呼ばれるキャラクターを動画に登場させたいときは、この中から選びます。
スマホアプリ版では、自分をカメラで撮影し、カメオとして登録して使うこともできるみたいです。

画像10

設定は、現時点では縦長か横長を選択するのみです。

画像11

試しに以下のプロンプトを入れてみます

画像12

入力すると以下のボタンから動画が見れます。
生成されるまで 2 ~ 3 分ほどかかります。

画像13

生成された動画がこちら
ちなみに無料版ではウォーターマークが入ります。

現在、無料版では 10 秒ほどの動画しか作成できないようです。

もう一つ、次は以下のプロンプトを試します。

画像14

生成された動画がこちら

それに近い動画が簡単に作れるのはすごいですね。

ディアシステムの CM を作ってみる

ディアシステムの CM 作成にトライしてみましょう。
まずは、どんな CM にするか ChatGPT に案を出してもらいます。
ディアのホームページにある画像を使ってみたいので以下の画像を添付して、

画像5

この画像を使って 動画生成AI Sora2でディアシステム株式会社のCMを作りたい。
8秒に収まるようにプロンプトを考えてください
https://www.dsic.jp/

と聞いてみます。
以下のように回答もらえました。

画像6

これをベースに以下のように変更して Sora2 のプロンプトに入れてみます。

(マルチカット、動きのあるように)
未来都市の朝焼けの中、背中にリュックを背負った少年が輝く都市を見つめている。
空には光が広がり、ガラスのようなひびが世界の変革を象徴している。
少年が空に向かって手を伸ばす。
ナレーション(優しく力強い声):「思い、Webテクノロジー 情報システムを変革し、未来の景色を変える。ディアシステム株式会社」
シーンがフェードアウトし、**「ディアシステム株式会社」**の文字が表示される。

映像全体は約8秒、静かなピアノと希望に満ちたサウンドトラックで締めくくる。
映像の雰囲気:温かく透明感のある光、未来と希望を感じさせるトーン。

完成した動画がこちらです。

別で実写版を作成してみました

いかがでしょうか

まとめ

Sora2 は短時間で高品質な映像と音声を同時に生成でき、物理表現やキャラクター活用(カメオ)など実用性の高い機能を備えています。
今回は基本的な操作を確認しつつ、企業イメージを 8 秒に凝縮する形で CM 試作まで行えました。
無料版では制約(尺・透かし・解像度など)はあるものの、コンセプト検証やイメージ共有には十分活用可能です。
試行回数を重ね、どの程度プロンプトで演出意図を再現できるか検証していきたいと思います。

未経験から始める
システムエンジニア

一生モノのITスキルを身につけよう

あなたの経験とスキルを
ディアシステムで発揮してください!