OpenAI ChatGPT: 画像を聞き、話し、応答するようになりました

2023 年 9 月 25 日

人気のAIチャットボットであるOpenAIのChatは、音声言語を使って会話することを学習しました。 シリ (NAIST) と アレクサ、AIコミュニケーションにおける大きな飛躍を示しています。

この新開発により、ユーザーは音声によるインタラクションでチャットを利用できるようになり、より使いやすく、多用途に活用できるようになります。サンフランシスコを拠点とするAIスタートアップ企業OpenAIは、このバージョンのチャットボットを最近リリースし、AIコミュニケーションの限界を押し広げました。

もう一つの新機能として、チャットが画像に応答できるようになりました。例えば、ユーザーが冷蔵庫内の写真をアップロードすると、チャットボットが利用可能な食材に基づいて料理の候補を提案してくれます。この革新的な機能により、チャットはより使いやすく、より有益なものになります。

OpenAIはAIツールを急速に拡張しています。最近、DALL-E画像ジェネレーターのバージョンを発表し、Chatに組み込みました。11月のリリース以来、Chatは数億人のユーザーを獲得し、他社による同様のサービス開発のきっかけとなっています。

この新しいボットは、Google Bardのようなライバルを凌駕する性能を発揮すると同時に、AlexaやSiriといった長年のテクノロジーにも挑戦しています。これらのデジタルアシスタントは、従来、音声によるデバイスとの対話を支援してきました。しかし、ChatやGoogle Bardのような新しいチャットボットは、優れた言語能力を誇り、メールを生成したり、詩を書いたり、ほぼあらゆるトピックについて瞬時に議論したりすることができます。

OpenAIの最新製品は、これら2つのコミュニケーション方法を効果的に融合しています。同社は、音声によるコミュニケーションこそが、チャットボットとのより直感的なインタラクション方法だと考えています。5種類のオプションが用意されたChatの合成音声は、一般的なデジタルアシスタントの音声よりも優れていると同社は主張しています。

この新しいチャットボットは、月額20ドルのChat Plusサービスの全加入者に、今後2週間以内に利用可能になります。ただし、このボットはiPhone、iPad、Androidデバイスでのみ音声で応答します。

Chatの音声インターフェースは従来のアシスタントを彷彿とさせるかもしれませんが、それを支える技術は根本的に異なります。Chatは主に、インターネット上の膨大な量のテキストを分析して言語を生成する大規模言語モデル(LLM)によって駆動されています。

チャットは事実上あらゆる質問に数秒で応答できます。これは、限られた数のタスクしか実行できなかったり、プログラムされた質問の限定されたリストにしか答えられなかった Alexa や Siri などの従来のデジタル アシスタントとは対照的です。

OpenAI が Chat を Alexa や Siri に似たものに進化させているのに伴い、Amazon や Apple などの企業も自社のデジタル アシスタントを Chat に似たものへと変革しつつある。

Amazonは最近、新しいLLMによって部分的に推進され、「あらゆるトピック」についてより流動的な会話を目的とした、更新されたAlexaシステムをプレビューしました。 一方、内部関係者によると、Appleは将来の製品に向けてLLMのプロトタイプをテストしているという。

新しいチャットは、Web経由だけでなく、iPhone、iPad、Androidデバイスでも画像に反応できます。この機能は、視覚に障害のあるユーザーにとって非常に役立つでしょう。

OpenAI は当初この画像ツールを春にデモしましたが、その潜在的な悪用の可能性をよりよく理解するまで一般公開を延期しました。たとえば、写真に写っている人物を素早く識別するために使用される顔認識サービスとして機能する可能性があるという懸念がありました。

このような進歩にもかかわらず、ボットにはまだ改善の余地があります。 たとえば、同音異義語に対処することはできますが、それ自体を修正することができ、ボットの高度な学習能力を示しています。

結論として、OpenAIの最新バージョンのChatは、AIコミュニケーションにおける大きな飛躍を示し、ユーザーインタラクションと汎用性を向上させています。AIが進化を続ける中で、AmazonやAppleのような巨大企業がこれらの進歩にどのように対応するのか、興味深いところです。