2026年7月11日の記録
##
AIの価値は、単体の賢さだけでは決まらない。
何とつなぎ、何を見せるかで変わる。
100日チャレンジ43日目。今日は新しいAI機能を試したり、Claudeのワークスペースを育てたり、ChatGPTとGeminiのアップデートを確認したりと、いくつかのAIを横断した一日だった。
一見すると別々のことをやっていたように見える。でも振り返るとすべてに共通していたことがあった。
AIは単体で使うより、資料やサービス、画面、カメラとつながったときに、本当の価値が見えてくるということだ。
スマホで無理に進めないという判断
今日は最初に、案内が届いていた新しいAI機能を設定しようとした。
ただ設定画面を開いてみると、スマホで急いで進めるよりPCでしっかり確認しながら設定した方がよさそうだった。
少し前の自分なら、そのままスマホで何とか進めようとしていたかもしれない。でも今日は途中で止めた。
「今できるか」じゃなくて「どの環境でやるのが最も確実か」で判断できるようになってきた気がする。
無理に進めるより、適切な環境に切り替える。これも最近少しずつ身についてきた判断だ。
既存資料が、AIワークスペースの土台になった
今日の中心は、引き続きClaudeのAIワークスペース構築だった。
これまで進めてきた薬剤やプロダクトの情報に加えて、カウンセリング、施術の流れ、技術資料、既存の社内データ、Pono独自の判断基準などを整理していった。
今回はすでに持っていた資料を、そのままClaudeへ読み込ませた。一からすべて説明し直すのではなく、既存資料をまとめて渡して、そこから追加質問に答えていく。この方法が思っていた以上に効率的だった。
過去に作った資料は、AI時代になるともう一度価値を持つんだなと今日改めて感じた。
資料があるから、AIの質問も深くなる
資料を読み込ませたあと、Claudeから追加の質問を受けた。
そこに答えていくことで、資料だけでは説明しきれていないことや、自分の頭の中にしかなかった判断、例外として対応しているケースが少しずつ補完されていく。
資料を渡して終わりじゃない。AIに資料を読んでもらって、不足している部分を質問してもらって、その回答をまた知識として蓄積する。この往復によって、ワークスペースの質が上がっていく。
AIに正解を作ってもらっているというより、AIとの対話を通して自分たちの基準を発見しているという感覚に近いかもしれない。
アプリを更新しただけで、使える世界が変わった
今日はYouTubeを見ていて、ChatGPTとCodex周辺の仕様が変わったという情報を目にした。
気になったので実際にアプリを確認してみると、ChatGPTとGeminiの両方にアップデートが来ていた。更新してみたところ、今まで使えなかった新しい音声機能が利用できる状態になった。
話してみると、以前より会話が自然でテンポも滑らかに感じる。歩きながら考えを整理したり、移動中に壁打ちしたりする場面ではかなり使えそうだ。
ただスマホ一台だと、別のチャットや資料を確認しながら会話するのが難しい。歩きながら軽く壁打ちする、思いついたことを言語化する、もう一台の端末で資料を見ながら使う。そういう場面で特に活きそうだ。
音声AIが便利になるほど、今度は「どの状況で使うか」という設計が重要になると感じた。
ChatGPTが「会話する場所」から「仕事をつなぐ場所」へ
アプリを確認していて、Google DriveやNotionなど外部サービスとの連携が増えていることにも気づいた。
これまでのChatGPTは「質問する場所」という感覚が強かった。でも外部サービスとつながることで、Google Driveから資料を探して、ドキュメントを要約して、スプレッドシートを分析して、そのまま次の作業を考える、という流れが一つの場所で進めやすくなる。
つまりChatGPTは、答えを返すAIから仕事の情報をつなぐハブへ変わり始めているんだと思う。
Gemini Liveで「見せながら話す」を試した
Gemini側では、Gemini Liveの画面共有とカメラ機能を試した。
画面共有ではスマホに表示している内容をGeminiへ見せながら質問できるし、カメラでは目の前にあるものを映しながら会話できる。
実際に使ってみると画面共有はかなり便利だった。言葉だけで説明するより「今ここを見ている」「この画面のこの部分が分からない」と、同じものを見ながら話した方が圧倒的に早い。
これは人に操作方法を教えてもらうときと同じだ。電話で画面を説明するより、隣で同じ画面を見てもらう方が早い。AIにも目の代わりとなる情報を渡すことで、やり取りの精度が上がる。
「マルチモーダル」という言葉を初めて理解した
Geminiに得意なことを聞くと「マルチモーダル理解」という言葉が出てきた。
言葉自体は聞いたことがあっても、きちんと説明できるほど理解していなかった。マルチモーダルとは、テキストだけじゃなくて音声、画像、動画、カメラ、画面、ファイルなど、複数の形式の情報を組み合わせて理解することだ。
画面を見せながら声で質問する。写真を見せながら状況を説明する。資料と会話の両方から内容を判断する。こうした使い方がマルチモーダルなAI活用だ。
今日実際に試したことで「マルチモーダルとは何か」を知識じゃなくて体験として理解できた。
今日一日を通して感じたのは、AIへすべてを文章で説明する必要はないということ。
Claudeには既存資料を渡す。ChatGPTにはGoogle DriveやNotionをつなぐ。Geminiには画面やカメラを見せる。音声AIには、その場で考えていることを話す。
それぞれAIが理解しやすい形で情報を渡せばいい。人に仕事を頼むときも、口頭説明だけでなく資料や画面、現物を見せた方が伝わる。AIも同じだ。
プロンプトを長くすることだけが、AIへの伝え方じゃない。資料を渡す、画面を見せる、声で補足する。この組み合わせによって、AIとのやり取りはもっと自然になっていく。
今日は新しいAI機能の設定を途中で止めて、Claudeへ既存資料を読み込ませて、ChatGPTの音声と外部サービス連携を確認して、Gemini Liveで画面共有とカメラを試した。
一つひとつは別の作業だ。でもすべてに共通していたのは、AIへどのように情報を渡すかということだった。
テキストだけで伝える時代から、資料を読み、画面を見て、声を聞き、複数の情報を組み合わせて理解する時代へ。
AIの進化を追うだけじゃなくて、そのAIに何を見せ、何をつなぎ、どんな役割を与えるのか。そこまで考えることで、AIはようやく実際の仕事に近づいていくんだと思う。
初出:note「DAY43|AIは、単体の賢さより「つながり方」で価値が変わる」