Chào bạn, Thiện Mỹ đây. Hẳn bạn đã từng hỏi chatbot một câu và nhận được câu trả lời nghe rất thuyết phục, rồi sau đó mới phát hiện nó sai bét. Tập này mình nói vì sao chuyện đó xảy ra.
Câu trả lời gọn: chatbot được huấn luyện để viết ra câu chữ trôi chảy và hợp lý, không được huấn luyện để tự biết giới hạn hiểu biết của mình. Giọng văn chắc nịch là thói quen của cách viết, không phải bằng chứng cho sự chính xác.
Máy đoán chữ chứ không tra sổ
Khi bạn hỏi một câu, chatbot không mở một cuốn sổ nào ra để tra. Nó tạo câu trả lời bằng cách đoán từng chữ tiếp theo dựa trên những gì đã học. Mỗi chữ được chọn vì nó nghe hợp với những chữ trước đó.
Với những điều phổ biến, được viết đi viết lại hàng nghìn lần trong dữ liệu, cách đoán này cho ra kết quả đúng. Thủ đô của một nước, công thức một món ăn quen thuộc, những thứ đó máy gần như luôn trả lời trúng.
Nhưng với những chi tiết hiếm, như số hiệu một văn bản, một ngày tháng cụ thể, tên một bài báo khoa học, máy có ít ví dụ để dựa vào. Lúc đó nó vẫn phải đoán, và đoán ra thứ nghe giống thật.
Đó chính là thứ người ta gọi là ảo giác. Một trích dẫn có tên tác giả, tên tạp chí, năm xuất bản nghe rất ổn, nhưng khi tra thì không tồn tại. Máy không gian dối, máy chỉ ghép chữ cho hợp lý.
Hiểu được điều này, bạn sẽ thấy một nguyên tắc rõ ràng: chi tiết càng cụ thể, càng hiếm, càng phải kiểm lại.
Vì sao giọng nó lại chắc chắn thế
Phần lớn văn bản máy được học là văn bản viết ra để thông tin, giải thích, hướng dẫn. Kiểu văn đó thường dùng giọng khẳng định. Máy học luôn giọng ấy, nên trả lời câu nào cũng như một chuyên gia đang giảng bài.
Thêm vào đó, các công ty làm chatbot thường tinh chỉnh để câu trả lời dễ đọc, gọn gàng, ít ậm ừ. Người dùng thích câu trả lời dứt khoát hơn câu trả lời toàn chữ có lẽ, có thể. Vô tình điều này làm máy càng nghe chắc chắn.
Con người thì khác. Một người biết ít thường nói ngập ngừng, một người biết nhiều thường nói chắc. Mình quen dùng giọng nói để đoán độ tin cậy. Với chatbot, thói quen đó không còn đúng nữa.
Vì vậy đừng để giọng văn lừa mình. Một câu trả lời sai và một câu trả lời đúng có thể được viết bằng cùng một giọng tự tin y hệt nhau.
Có một mẹo nhỏ: hỏi lại chatbot rằng chỗ nào nó không chắc. Nhiều chatbot hiện nay khi được hỏi thẳng sẽ chỉ ra phần nó suy đoán, phần cần kiểm chứng.
Những chỗ chatbot hay sai nhất
Số liệu và con số cụ thể là chỗ dễ sai nhất. Giá cả, thống kê, mức phạt, lãi suất, dân số của một vùng nhỏ, nếu chatbot đưa con số mà không nói nguồn thì bạn đừng dùng ngay.
Thông tin mới cũng là chỗ yếu. Mỗi mô hình chỉ học dữ liệu tới một thời điểm nào đó. Chuyện xảy ra sau thời điểm ấy, máy hoặc không biết, hoặc đoán dựa trên thông tin cũ.
Luật lệ và thủ tục hành chính ở Việt Nam là vùng đặc biệt cần cẩn thận. Văn bản thay đổi thường xuyên, mỗi địa phương có hướng dẫn riêng, và dữ liệu tiếng Việt máy học ít hơn tiếng Anh nhiều.
Sức khoẻ và thuốc men là vùng nguy hiểm nhất. Máy có thể giải thích chung về một bệnh, nhưng liều thuốc, tương tác thuốc, có nên ngưng thuốc hay không là những câu phải hỏi bác sĩ, dược sĩ.
Ngược lại, những việc như viết lại cho dễ hiểu, gợi ý cấu trúc bài viết, liệt kê ý tưởng thì máy làm tốt và ít rủi ro. Dùng đúng việc là đã tránh được phần lớn sai sót.
Kiểm lại câu trả lời như thế nào
Cách đầu tiên là hỏi nguồn. Đề nghị chatbot cho biết thông tin lấy từ đâu, rồi bạn tự mở nguồn đó ra xem. Nếu nguồn không tồn tại hoặc không nói điều đó, bạn biết ngay câu trả lời có vấn đề.
Cách thứ hai là đối chiếu với nơi chính thức. Với chuyện thủ tục, hãy xem trang của cơ quan nhà nước. Với chuyện sức khoẻ, hỏi người có chuyên môn. Với chuyện sản phẩm, xem hướng dẫn của nhà sản xuất.
Cách thứ ba là hỏi lại theo cách khác. Nếu hai lần hỏi cùng một ý mà ra hai đáp án khác nhau, đó là dấu hiệu máy đang đoán, không phải đang biết.
Cách thứ tư là tự suy luận một chút. Một con số nghe quá đẹp, quá tròn, hay một kết luận nghe quá dễ dàng thường đáng ngờ. Trực giác của bạn vẫn là công cụ kiểm tra có giá trị.
Không cần kiểm mọi thứ. Một gợi ý tên cho món ăn thì sai cũng chẳng sao. Nhưng thứ gì bạn sẽ gửi cho khách, nộp cho cơ quan, hay dùng để quyết định tiền bạc, sức khoẻ thì phải kiểm.
Sống chung với một trợ lý biết nhiều mà hay nhầm
Hãy hình dung chatbot như một người thực tập sinh rất chăm, đọc rất nhiều, viết rất nhanh, nhưng đôi khi nhầm và ít khi tự thú nhận mình nhầm. Bạn sẽ giao việc cho người đó thế nào?
Chắc chắn bạn vẫn giao, vì người đó giúp được rất nhiều. Nhưng bạn sẽ đọc lại trước khi gửi đi, bạn sẽ không để người đó ký thay mình, và bạn sẽ dặn kỹ những việc quan trọng.
Với chatbot cũng vậy. Thói quen tốt nhất là coi mọi câu trả lời là bản nháp. Bản nháp tốt giúp bạn đi nhanh hơn, nhưng bản cuối cùng vẫn do bạn chịu trách nhiệm.
Theo thời gian, các mô hình sẽ bớt ảo giác hơn, nhiều công cụ cũng đã biết tra cứu nguồn trước khi trả lời. Nhưng nguyên tắc kiểm lại thông tin quan trọng sẽ không bao giờ lỗi thời.
Câu hỏi mình gửi bạn: lần gần nhất bạn tin ngay một câu trả lời của máy mà không kiểm, nếu nó sai thì hậu quả sẽ là gì?
Câu hỏi thường gặp
Ảo giác của AI là gì?
Đó là khi AI tạo ra thông tin nghe hợp lý nhưng không đúng sự thật, như trích dẫn không tồn tại hay con số bịa. Nguyên nhân là máy đoán câu chữ hợp lý thay vì tra cứu dữ liệu đã kiểm chứng.
Làm sao biết chatbot đang đoán hay đang biết?
Hỏi nó chỗ nào không chắc, hỏi lại cùng ý theo cách khác, và yêu cầu nguồn. Nếu đáp án thay đổi giữa các lần hỏi hoặc nguồn không kiểm được, nhiều khả năng máy đang đoán.
Chatbot có tra cứu internet không?
Tuỳ công cụ và tuỳ chế độ. Một số chatbot có thể tìm trên mạng trước khi trả lời và hiện nguồn, số khác chỉ dựa vào dữ liệu đã học. Bạn nên xem công cụ mình dùng có hiện nguồn hay không.
Có nên dùng chatbot để tra luật không?
Dùng để hiểu khái niệm chung thì được, nhưng điều khoản cụ thể, mức phạt, thủ tục phải đối chiếu văn bản chính thức hoặc hỏi luật sư, vì văn bản thay đổi thường xuyên và máy hay nhầm chi tiết.
Câu trả lời dài và chi tiết có đáng tin hơn không?
Không hẳn. Độ dài và độ chi tiết là đặc điểm của cách viết, không phải của độ chính xác. Một câu trả lời rất chi tiết vẫn có thể chứa một con số bịa nằm lẫn trong đó.