グーグル、初の「ビーム・ビデオエージェント」を公開
5 月 19 日、Google はカリフォルニア州マウンテンビューの自社工場で「Beam ビデオエージェント」を初めて公開し、AI エージェントがテキストベースのインターフェースから「顔と表情を持つ」物理的な対話形態へと進化することを示した。 このエージェントの名前はソフィーで、黒いタートルネックを着た女性のアバターである。彼女は Google のビームリアルタイムプロジェクション技術を通じてユーザーと会話を行い、複数言語に対応している。また、スマートフォンや紙、本上の文字を読み取り、地図検索やレストラン推薦、天気確認など Google サービスを活用できる。音声はテキスト駆動型で生成され、口元はリップシンク処理が行われ、身体動作は補助的に重ねて表示される。 しかし現在の体験には明らかな欠陥がある。ソフィーは応答する前に長い沈黙があり、発言長さが非常に均一であり、身振り手振りが繰り返されて単調だ。英語アクセントも「標準米語」と「南東部訛り」の間を行き来している。製品マネージャーのパワン・クマー氏は、「今回のデモは Google I/O 参加者を対象に 5 分間の制限付きで行われた初期実験段階のものである」と説明した。 Beam ハードウェア自体は、Google が開発した裸眼立体視対応のリモート会議ソリューションであり、最初の製品は 6 つのカメラを搭載してボリューメトリック 3D ヒューマンプロジェクションを作成する価格 2 万 5000 ドルの HP ディメンションである。今回はグループ通話を初公開し、従来の端末からの参加をサポートするとともに、位置追従オーディオを導入した。 現時点では Google はいかなる発売計画も発表しておらず、ターゲットユーザーについても明確にしていない。経営陣のアンドリュー・ナートカー氏によると、VR 版の社内デモンストレーションは進行中であり、将来的には異なるサイズの「ウィンドウ」形状へ展開していく予定だという。業界関係者は、このアプローチがオフィス、小売、教育などのシーンに適していると見ている一方、技術の成熟度と市場受容性についてはさらなる検証時間を要すると指摘している。
