Khung chat là lớp giao tiếp với người dùng
Khi người dùng nhập câu hỏi vào ChatGPT, Claude hoặc Perplexity, phần họ tiếp xúc trước tiên là giao diện hội thoại. Giao diện này tiếp nhận yêu cầu, hiển thị kết quả và duy trì mạch trao đổi để người dùng tiếp tục làm rõ vấn đề.
Chatbot vì vậy mô tả cách con người giao tiếp với hệ thống. Phía sau khung trò chuyện có thể là một mô hình AI, nhiều mô hình được lựa chọn tự động hoặc một hệ thống kết hợp tìm kiếm, xử lý tệp và các công cụ khác.
OpenAI giới thiệu ChatGPT là trợ lý AI có khả năng trả lời câu hỏi, soạn thảo, dịch, phân tích hình ảnh và xử lý tệp. Người dùng trả phí có thể lựa chọn giữa nhiều mô hình nền tảng, trong khi các công cụ như tìm kiếm web và nghiên cứu sâu được cung cấp theo gói dịch vụ và chế độ làm việc. ChatGPT do đó là một sản phẩm hoàn chỉnh, không đồng nhất với một mô hình duy nhất.
Một chatbot cũng chưa đương nhiên là AI agent. Nếu hệ thống chỉ tiếp nhận câu hỏi rồi tạo phản hồi, nó vẫn hoạt động chủ yếu ở lớp hội thoại, dù mô hình phía sau có năng lực suy luận cao.
Mô hình AI quyết định năng lực xử lý
Mô hình AI là thành phần phân tích dữ liệu đầu vào và tạo kết quả. Đây là nơi hệ thống xử lý văn bản, hình ảnh hoặc dữ liệu để đưa ra phản hồi phù hợp với yêu cầu.
Một mô hình có thể được sử dụng trong nhiều sản phẩm. Cùng một dòng mô hình có thể xuất hiện trong chatbot dành cho người dùng phổ thông, giao diện lập trình dành cho doanh nghiệp hoặc hệ thống tự động xử lý công việc.
Ngược lại, một sản phẩm có thể sử dụng nhiều mô hình. Mô hình nhanh phù hợp với câu hỏi đơn giản; mô hình có năng lực suy luận cao hơn được dành cho bài toán phức tạp; mô hình nhỏ có thể xử lý những nhiệm vụ lặp lại với chi phí thấp hơn.
Tên và phiên bản mô hình thay đổi thường xuyên. Vì vậy, người dùng cần lựa chọn theo tính chất công việc, độ chính xác, thời gian xử lý và chi phí thay vì mặc định phiên bản mới hơn sẽ phù hợp với mọi yêu cầu.
Mô hình AI cũng không đại diện cho toàn bộ trợ lý. Lịch sử hội thoại, tệp đã tải lên, bộ nhớ, nguồn web và quyền truy cập ứng dụng thường do lớp sản phẩm bao quanh mô hình quản lý.
AI agent điều phối công cụ để thực hiện nhiệm vụ
Ranh giới của AI agent nằm ở khả năng điều phối công việc. Thay vì chỉ tạo một phản hồi, agent có thể chia mục tiêu thành nhiều bước, lựa chọn công cụ, đọc kết quả sau mỗi bước và tiếp tục cho đến khi hoàn thành nhiệm vụ hoặc gặp điều kiện phải dừng.
Theo hướng dẫn của OpenAI, một agent gồm ba thành phần cơ bản: mô hình để suy luận và ra quyết định; công cụ để lấy dữ liệu hoặc thực hiện hành động; hướng dẫn để xác định cách vận hành và giới hạn phải tuân thủ. Một ứng dụng chỉ gọi mô hình để trả lời một lượt chưa được xem là agent.
Anthropic phân biệt quy trình định sẵn với agent. Trong quy trình định sẵn, mô hình và công cụ đi theo đường xử lý đã được lập trình. Với agent, mô hình chủ động hơn trong việc lựa chọn bước tiếp theo và công cụ cần sử dụng để đạt mục tiêu.
Một chatbot có thể giải thích cách lập báo cáo thị trường. Hệ thống nghiên cứu sâu có thể tìm nhiều nguồn, đọc tài liệu và tổng hợp báo cáo có dẫn nguồn. Agent được cấp thêm công cụ có thể tiếp tục tạo bảng tính, lưu tài liệu hoặc cập nhật dữ liệu vào ứng dụng của doanh nghiệp.
Mức độ tự chủ không phải lựa chọn tuyệt đối. Một hệ thống có thể chỉ được phép tìm kiếm và đọc dữ liệu; hệ thống khác được phép tạo tệp nhưng phải chờ người dùng duyệt trước khi gửi, đăng hoặc thay đổi thông tin bên ngoài.
ChatGPT, Claude và Perplexity có cấu trúc khác nhau
ChatGPT, Claude và Perplexity đều cho phép người dùng đặt câu hỏi bằng ngôn ngữ tự nhiên, nhưng cấu trúc phía sau không giống nhau.
ChatGPT là sản phẩm trợ lý AI của OpenAI. Bên trong sản phẩm có các mô hình với mức tốc độ và suy luận khác nhau, cùng những công cụ dành cho tìm kiếm, nghiên cứu, xử lý tệp và thực hiện công việc.
Claude vừa là tên sản phẩm trợ lý AI, vừa xuất hiện trong tên các dòng mô hình của Anthropic. Câu “dùng Claude” vì thế có thể nói đến ứng dụng Claude hoặc mô hình Claude được tích hợp trong một phần mềm khác. Tìm kiếm web, suy luận mở rộng và Research tiếp tục tạo thêm các cấp độ xử lý bên ngoài tên mô hình.
Perplexity tự giới thiệu là công cụ trả lời dựa trên tìm kiếm web theo thời gian thực. Hệ thống có mô hình Sonar do Perplexity phát triển, đồng thời có thể định tuyến câu hỏi qua mô hình của OpenAI, Anthropic và các nhà cung cấp khác. Vì thế, GPT hoặc Claude xuất hiện trong Perplexity không phải mô hình do Perplexity sở hữu.
Việc chỉ hỏi sản phẩm AI nào mạnh nhất chưa phản ánh đầy đủ năng lực của hệ thống. Kết quả còn phụ thuộc vào mô hình được sử dụng, công cụ được cấp, nguồn dữ liệu, thời gian suy luận và quyền hành động.
Năng lực tự chủ đòi hỏi cơ chế kiểm soát
Sai sót của chatbot thường dừng ở một phản hồi cần sửa. Sai sót của agent có thể trở thành hành động thực tế như cập nhật nhầm dữ liệu, gửi sai nội dung hoặc thao tác trên tài khoản không đúng mục tiêu.
Mức kiểm soát phải tăng cùng quyền hạn của hệ thống. Agent chỉ đọc thông tin có mức rủi ro khác với agent được phép ghi dữ liệu, gửi thư, đặt hàng hoặc thực hiện giao dịch.
OpenAI cho biết hệ thống dùng trình duyệt đám mây có thể đọc trang web, nhập thông tin và thực hiện nhiều bước, nhưng phải dừng để người dùng xác nhận trước những hành động có thể tạo cam kết tài chính, pháp lý hoặc khó đảo ngược. Cơ chế xác nhận tạo điểm kiểm soát trước khi hành động được thực hiện nhưng không loại bỏ hoàn toàn rủi ro.
Chatbot giúp người dùng giao tiếp với AI; mô hình quyết định phần lớn năng lực xử lý; agent sử dụng mô hình cùng công cụ để theo đuổi mục tiêu qua nhiều bước. Ba khái niệm liên quan chặt chẽ nhưng không thể dùng thay thế cho nhau.