- Một nghiên cứu mới cho thấy chatbot AI tâng bốc người dùng, không khuyến khích giải quyết xung đột.
- Các nhà nghiên cứu cho biết hành vi này củng cố khả năng phán đoán kém.
Một nghiên cứu gần đây cho thấy các mô hình trí tuệ nhân tạo phổ biến của Mỹ và Trung Quốc có xu hướng tâng bốc người dùng quá nhiều và hành vi này có thể khiến mọi người ít sẵn sàng giải quyết tranh chấp cá nhân hơn. Những phát hiện này làm tăng thêm mối lo ngại rằng các mô hình ngôn ngữ lớn có thể mang lại sự đồng thuận về độ chính xác, đặc biệt là trong các cuộc Chat về tình cảm hoặc cá nhân.
Theo báo cáo của Bưu điện buổi sáng Nam Trung QuốcCác nhà nghiên cứu từ Đại học Stanford và Đại học Carnegie Mellon đã kiểm tra cách 11 mô hình ngôn ngữ lớn xử lý các yêu cầu tư vấn về các vấn đề cá nhân, bao gồm cả các trường hợp liên quan đến hành vi không trung thực. Công trình nêu bật cách ngôn ngữ và giọng điệu của các chatbot AI này có thể ảnh hưởng đến cách mọi người hiểu về xung đột và trách nhiệm.
Trong lĩnh vực AI, kiểu đồng ý quá nhanh này với người dùng được gọi là sự nịnh bợ. Mẫu V3 của DeepSeek, ra mắt vào tháng 12 năm 2024, đã cho thấy một số mức độ cao nhất của hành vi này, nâng mức độ chấp thuận của người dùng cao hơn 55% so với con người. Trên tất cả các mô hình được thử nghiệm, mức trung bình cao hơn 47%. Các nhà nghiên cứu cảnh báo rằng điều này có thể định hình cách người dùng nhìn nhận bản thân và người khác nếu các phản hồi củng cố những lựa chọn sai lầm.
Để so sánh với phản ứng của con người, các nhà nghiên cứu đã rút ra từ các bài đăng trên diễn đàn Reddit “Tôi là kẻ khốn nạn”, nơi mọi người chia sẻ những xung đột cá nhân và yêu cầu người khác đánh giá xem ai là người có lỗi. Nhóm đã lấy các bài đăng mà cộng đồng đồng ý rằng tác giả đã sai, sau đó kiểm tra xem các chatbot AI có phản hồi giống như vậy hay không. Điều này cho phép họ đo lường xem liệu các mô hình có đứng về phía người dùng ngay cả khi con người thì không.
Qwen2.5-7B-Instruct của Alibaba Cloud, được phát hành vào tháng 1, cho thấy xu hướng đứng về phía tác giả mạnh mẽ nhất. Nó không đồng ý với đánh giá của cộng đồng 79%. DeepSeek-V3 theo sau với 76%. Gemini-1.5 của Google DeepMind ít có khả năng tâng bốc người dùng nhất, chỉ có 18% đi ngược lại phán quyết của cộng đồng. Nghiên cứu này vẫn chưa trải qua quá trình đánh giá ngang hàng.
Chỉ có hai mẫu được thử nghiệm đến từ Trung Quốc: Qwen và DeepSeek. Phần còn lại được phát triển bởi các công ty Hoa Kỳ OpenAI, Anthropic, Google DeepMind, Meta Platforms và Mistral có trụ sở tại Pháp. Kết quả cho thấy tình trạng cộng hưởng xuất hiện ở các khu vực và phong cách phát triển hơn là trong một hệ sinh thái cụ thể.
Mối lo ngại về tính cộng hưởng lan rộng vào tháng 4 năm ngoái khi một bản cập nhật được xây dựng trên mô hình GPT-4o của OpenAI khiến chatbot trở nên háo hức hơn. Theo mặc định, bản cập nhật đó làm cho âm thanh của bot trở nên dễ chịu hơn. Trong một bài đăng trên blog, công ty đã viết rằng “các tương tác đồng bộ có thể gây khó chịu, bất ổn và gây khó chịu” và giải thích rằng thử nghiệm nội bộ không xem xét thói quen của người dùng thay đổi như thế nào theo thời gian. Công ty cho biết các tín hiệu xếp hạng ngắn hạn, chẳng hạn như phản hồi đồng tình, đã đẩy mô hình đến những câu trả lời thân thiện nhưng không chân thành.
OpenAI cho biết mục tiêu của họ là làm cho giọng điệu mặc định của ChatGPT trở nên hữu ích và tôn trọng. Nhưng khi các đặc điểm hỗ trợ mở rộng trên cơ sở người dùng khổng lồ, những tác động không mong muốn có thể xuất hiện. Với hơn 500 triệu người dùng hàng tuần, công ty cho biết một cá tính duy nhất không thể phù hợp với sở thích của mọi người.
Để giải quyết vấn đề này, OpenAI có kế hoạch điều chỉnh các phương pháp đào tạo và lời nhắc nhằm ngăn chặn những lời xu nịnh, đồng thời mở rộng các tùy chọn phản hồi của người dùng. OpenAI cho biết điều này làm dấy lên mối lo ngại về sức khỏe tâm thần và hứa sẽ cải thiện việc kiểm tra hành vi này trước khi phát hành trong tương lai.
Trong nghiên cứu mới, các nhà nghiên cứu cũng quan sát cách người dùng phản ứng với những lời khuyên tâng bốc. Mọi người tin tưởng những phản hồi này hơn và cảm thấy ít có động lực hơn để giải quyết tranh chấp một cách hòa bình. Điều này cho thấy ngôn ngữ thân thiện từ các chatbot AI, ngay cả khi bị hiểu sai, có thể khuyến khích người dùng tránh phản ánh hoặc tránh trách nhiệm. Trong bối cảnh xung đột, điều này có khả năng củng cố những thành kiến, khơi dậy mối hận thù hoặc thao túng khen thưởng.
Các tiêu chuẩn mới được trình bày tại các hội nghị AI gần đây cho thấy tình trạng nịnh nọt có thể khó phát hiện hơn dự kiến. Một bài báo được chia sẻ tại AIES 2025, có tên SycEval, đã phát hiện ra rằng các câu trả lời dựa trên thỏa thuận không chỉ xuất hiện trong các câu hỏi xã hội mà còn trong các chủ đề khoa học và y tế, ngay cả sau khi các phương pháp điều chỉnh mới được áp dụng. Một nhóm xuất bản khác trong Những phát hiện của NAACL 2025 đã báo cáo rằng các công cụ không chắc chắn phổ biến không thể nắm bắt được các phản hồi đồng bộ, tạo ra điểm mù cho các công ty phụ thuộc vào điểm tin cậy.
Công việc tiếp theo trong Phát hiện của ACL 2025 đã nghiên cứu các cuộc hội thoại qua một số tin nhắn và nhận thấy rằng các mô hình có xu hướng phản ánh ý kiến của người dùng nhiều hơn theo thời gian, đặt mối quan hệ lên trên độ chính xác. Các thử nghiệm ban đầu với các cuộc thảo luận giữa nhiều tác nhân cho thấy xu hướng tương tự: ít nhất một mô hình thường chuyển sang hướng đồng thuận quá sớm. Các nhà nghiên cứu cho rằng việc rèn luyện tính lịch sự có thể khuyến khích sự tôn trọng chiến lược trong các cuộc Chat dài hơn.
Các nhà nghiên cứu viết: “Những sở thích này tạo ra những động cơ sai lầm khiến mọi người ngày càng dựa vào các mô hình AI đồng bộ và việc đào tạo mô hình AI để ủng hộ tính đồng bộ”. Họ cảnh báo rằng hành vi này có thể trở nên tồi tệ hơn khi các mô hình trở nên dễ Chat hơn và được tích hợp vào các công cụ hàng ngày.
Jack Jiang, giáo sư quản lý thông tin và đổi mới tại trường kinh doanh của Đại học Hồng Kông và là giám đốc Phòng thí nghiệm đánh giá AI của trường, cho biết điều này cũng tạo ra rủi ro trong môi trường làm việc. Ông lưu ý rằng các nhóm dựa vào AI để nhận phản hồi có thể phải đối mặt với áp lực tinh tế trong việc chấp nhận những ý tưởng không bao giờ bị thách thức.
Ông nói: “Chẳng hạn, sẽ không an toàn nếu một mô hình liên tục đồng ý với kết luận của nhà phân tích kinh doanh.

Bạn muốn trải nghiệm toàn bộ quá trình đổi mới công nghệ của doanh nghiệp? Tham gia TechEx ở Amsterdam, California và London. Bao gồm AI, Dữ liệu lớn, An ninh mạng, IoT, Chuyển đổi kỹ thuật số, Tự động hóa thông minh, Điện toán biên và Trung tâm dữ liệu, TechEx tập hợp các nhà lãnh đạo toàn cầu để chia sẻ các trường hợp sử dụng trong thế giới thực và hiểu biết sâu sắc. Bấm vào đây để biết thêm thông tin.
TechHQ được cung cấp bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới khác tại đây.



