OpenAI's ChatGPT: Bây giờ Nghe, Nói và Phản hồi Hình ảnh

Tháng Chín 25, 2023

Chat của OpenAI, một chatbot AI phổ biến, hiện đã học cách trò chuyện bằng ngôn ngữ nói, giống như SiriAlexa, đánh dấu một bước nhảy vọt đáng kể trong giao tiếp AI.

Với sự phát triển mới này, người dùng có thể tương tác với Chat thông qua tương tác bằng giọng nói, giúp ứng dụng này dễ tiếp cận và linh hoạt hơn. Công ty khởi nghiệp AI có trụ sở tại San Francisco, OpenAI, vừa ra mắt phiên bản chatbot này, mở rộng ranh giới của giao tiếp AI.

Một tính năng mới mẻ khác là Chat giờ đây có thể phản hồi hình ảnh. Ví dụ, người dùng có thể tải lên ảnh chụp bên trong tủ lạnh, và chatbot có thể gợi ý các món ăn tiềm năng dựa trên các nguyên liệu có sẵn. Tính năng cải tiến này nhằm mục đích giúp Chat trở nên thân thiện và hữu ích hơn với người dùng.

OpenAI đã nhanh chóng mở rộng các công cụ AI của mình. Gần đây, công ty đã công bố phiên bản trình tạo hình ảnh DALL-E và tích hợp nó vào Chat. Kể từ khi ra mắt vào tháng 11, Chat đã thu hút hàng trăm triệu người dùng và truyền cảm hứng cho các dịch vụ tương tự từ các công ty khác.

Bot mới này vượt trội hơn các đối thủ như Google Bard, đồng thời cũng thách thức các công nghệ lâu đời như Alexa và Siri. Các trợ lý ảo này trước đây thường chỉ hỗ trợ tương tác với thiết bị bằng giọng nói. Tuy nhiên, các chatbot mới hơn như Chat và Google Bard lại sở hữu kỹ năng ngôn ngữ vượt trội, cho phép tạo email, viết thơ và thảo luận hầu như mọi chủ đề ngay lập tức.

Sản phẩm mới nhất của OpenAI kết hợp hiệu quả hai phương thức giao tiếp này. Công ty coi việc nói chuyện là một cách trực quan hơn để tương tác với chatbot. Họ tuyên bố rằng giọng nói tổng hợp của Chat, với năm tùy chọn khác nhau, vượt trội hơn hẳn giọng nói được sử dụng trên các trợ lý kỹ thuật số phổ biến.

Chatbot mới sẽ có sẵn cho tất cả người dùng Chat Plus, một dịch vụ có giá 20 đô la một tháng, trong vòng hai tuần tới. Tuy nhiên, bot chỉ có thể phản hồi bằng giọng nói khi sử dụng trên iPhone, iPad và thiết bị Android.

Mặc dù giao diện giọng nói của Chat có thể gợi nhớ đến các trợ lý ảo trước đây, nhưng công nghệ đằng sau nó lại hoàn toàn khác biệt. Nó chủ yếu được điều khiển bởi một mô hình ngôn ngữ lớn (LLM) tạo ra ngôn ngữ bằng cách phân tích một lượng lớn văn bản từ khắp nơi trên Internet.

Chat có thể trả lời hầu hết mọi câu hỏi chỉ trong vài giây, trái ngược với các trợ lý kỹ thuật số cũ như Alexa và Siri, vốn chỉ có thể thực hiện một số lượng tác vụ hạn chế hoặc trả lời một danh sách hữu hạn các câu hỏi được lập trình.

Khi OpenAI phát triển Chat thành thứ gì đó tương tự như Alexa hoặc Siri, các công ty như Amazon và Apple đang chuyển đổi trợ lý kỹ thuật số của họ để giống với Chat.

Amazon gần đây đã xem trước một hệ thống Alexa cập nhật nhằm mục đích trò chuyện trôi chảy hơn về “bất kỳ chủ đề nào”, một phần được thúc đẩy bởi LLM mới. Trong khi đó, theo những người trong cuộc, Apple đang thử nghiệm nguyên mẫu LLM của mình cho các sản phẩm trong tương lai.

Tính năng Chat mới cũng có thể phản hồi hình ảnh khi sử dụng qua web cũng như trên các thiết bị iPhone, iPad và Android. Tính năng này có thể rất hữu ích cho người dùng khiếm thị.

OpenAI ban đầu đã trình diễn công cụ hình ảnh này vào mùa xuân nhưng đã trì hoãn việc phát hành công khai cho đến khi họ hiểu rõ hơn về khả năng sử dụng sai mục đích của nó. Ví dụ, có lo ngại rằng nó có thể hoạt động như một dịch vụ nhận dạng khuôn mặt được sử dụng để xác định mọi người trong ảnh một cách nhanh chóng.

Bất chấp những bước tiến này, bot vẫn còn những điểm cần cải thiện. Ví dụ: nó có thể gặp khó khăn với các từ đồng âm, nhưng nó có thể tự sửa, thể hiện khả năng học tập nâng cao của bot.

Tóm lại, phiên bản Chat mới nhất của OpenAI đánh dấu một bước tiến đáng kể trong giao tiếp AI, mang đến khả năng tương tác và tính linh hoạt cao hơn cho người dùng. Khi AI tiếp tục phát triển, sẽ rất thú vị khi xem những gã khổng lồ như Amazon và Apple phản ứng như thế nào với những tiến bộ này.