- Nghiên cứu mới cho thấy việc cung cấp cho các tác nhân AI các kỹ năng của tác nhân AI – các hướng dẫn có cấu trúc được viết bởi các chuyên gia trong lĩnh vực – có thể tăng gấp đôi tỷ lệ thành công của họ đối với các nhiệm vụ phức tạp
- Các mô hình AI nhỏ hơn, rẻ hơn được trang bị các kỹ năng tác nhân AI phù hợp có thể hoạt động tốt hơn các mô hình đắt tiền hơn nhiều khi không có chúng
Hãy coi một đặc vụ AI giống như một nhân viên mới thông minh. Xuất sắc về nhiều mặt, nhưng vào ngày đầu tiên đến bệnh viện, nhà máy hoặc bàn giao dịch, họ sẽ gặp khó khăn nếu không có sự hướng dẫn phù hợp. Nói cho họ biết chính xác mọi thứ hoạt động như thế nào trong môi trường đó – các quy trình, công cụ, lối tắt quan trọng – và đột nhiên họ hoạt động như một chuyên gia dày dạn kinh nghiệm.
Đó thực chất là những gì kỹ năng của đặc vụ AI làm. Và theo một chuẩn mực mới học được xuất bản vào tháng 2 năm 2026, sự khác biệt giữa một đặc vụ có kỹ năng tốt và một đặc vụ không có kỹ năng có thể rất lớn.
Nghiên cứu có tên SkillsBench: Đo điểm chuẩn các kỹ năng của nhân viên hoạt động tốt như thế nào trong các nhiệm vụ đa dạng, được thực hiện bởi 40 nhà nghiên cứu từ các tổ chức bao gồm Amazon, Đại học Carnegie Mellon, Stanford, UC Berkeley và Đại học Oxford. Họ đã thử nghiệm bảy cấu hình tác nhân AI hàng đầu—các công cụ như Claude Code của Anthropic, Gemini CLI của Google và Codex CLI của OpenAI—trên 84 tác vụ trong thế giới thực và hơn 7.300 lần thử riêng lẻ.
Ba điều kiện đã được kiểm tra cho từng nhiệm vụ: các đặc vụ không được hướng dẫn, các đặc vụ được cung cấp các kỹ năng được viết bởi chuyên gia và các đặc vụ được yêu cầu tự tìm hiểu. Kết quả thật ấn tượng.
Chính xác thì kỹ năng của đặc vụ AI là gì?
Tác nhân AI là một mô hình, chẳng hạn như Claude hoặc GPT, đã được cấp quyền truy cập vào các công cụ và phần mềm, cho phép nó tự thực hiện các nhiệm vụ theo từng bước thay vì chỉ trả lời các câu hỏi. Các tác nhân này ngày càng được sử dụng để xử lý các công việc phức tạp trong nhiều ngành: phân tích báo cáo tài chính, xử lý dữ liệu y tế, quản lý kiểm tra an ninh mạng, v.v.
Vấn đề là, dù nhìn chung các nhân viên này có năng lực đến mấy thì họ vẫn thường thiếu bí quyết cụ thể cần thiết cho công việc chuyên môn. Họ có thể biết rộng rãi cách phân tích dữ liệu, nhưng không biết phương pháp chính xác mà bệnh viện sử dụng để hài hòa các kết quả phòng thí nghiệm trên các hệ thống khác nhau hoặc phương pháp kỹ thuật cụ thể cần thiết để tối ưu hóa lịch trình sản xuất của nhà máy.
Kỹ năng của đặc vụ AI thu hẹp khoảng cách đó. Mỗi kỹ năng về cơ bản là một tài liệu tóm tắt có cấu trúc—một tập hợp các hướng dẫn, ví dụ mã và tài liệu tham khảo—cho tổng đài viên biết cách tiếp cận một loại nhiệm vụ cụ thể trong một miền cụ thể. Không cần đào tạo lại. Người đại diện chỉ cần đọc kỹ năng và áp dụng nó.
Những con số quan trọng đối với Châu Á Thái Bình Dương
Trên tất cả các cấu hình tác nhân AI được thử nghiệm, việc cung cấp cho các tác nhân kỹ năng viết chuyên nghiệp đã cải thiện tỷ lệ thành công trung bình của họ thêm 16,2 điểm phần trăm. Tuy nhiên, một số lĩnh vực đã đạt được mức tăng lớn hơn nhiều so với các lĩnh vực khác – và mô hình này có liên quan trực tiếp đến các ngành thúc đẩy việc áp dụng AI cho doanh nghiệp trên toàn khu vực.
Nhiệm vụ chăm sóc sức khỏe đã cải thiện 51,9 điểm phần trăm với các kỹ năng. Sản xuất tăng 41,9 điểm phần trăm. An ninh mạng đạt 23,2 điểm, nhiệm vụ lĩnh vực năng lượng tăng 17,9 điểm.
Lý do là trực quan. Các mô hình AI được đào tạo dựa trên lượng lớn dữ liệu chung từ internet và các nguồn đã xuất bản. Nhưng các quy trình từng bước được sử dụng trong quản lý dữ liệu lâm sàng, lập kế hoạch nhà máy hoặc vận hành lưới điện không được công bố rộng rãi trên mạng – chúng nằm trong đầu các chuyên gia và trong tài liệu nội bộ. Nếu không có kỹ năng nắm bắt kiến thức đó, về cơ bản, tác nhân sẽ phải ứng biến.
Một ví dụ từ nghiên cứu này làm cho điều này trở nên sống động. Các cơ quan được giao nhiệm vụ phân tích rủi ro lũ lụt – xác định trạm giám sát nước nào có nguy cơ dựa trên dữ liệu dòng chảy – đạt tỷ lệ thành công chỉ 2,9% khi để thiết bị của riêng họ.
Khi được trang bị kỹ năng xác định phương pháp thống kê chính xác (phân phối Log-Pearson Loại III, là phương pháp tiêu chuẩn được các cơ quan quản lý nước của Hoa Kỳ sử dụng) cùng với hướng dẫn cách áp dụng phương pháp đó, tỷ lệ thành công đã tăng lên 80%. Nhiệm vụ tương tự. Mô hình AI tương tự. Sự khác biệt duy nhất là một tài liệu tóm tắt được viết tốt.
Những mô hình nhỏ hơn có thể đánh bại những mô hình lớn hơn – với kỹ năng phù hợp
Một trong những phát hiện thực tế hữu ích nhất của nghiên cứu là kỹ năng tác động như thế nào đến phương trình chi phí.
Các mô hình AI có giá thành khác nhau đáng kể. Các mẫu lớn hơn, có khả năng hoạt động cao hơn sẽ tính phí nhiều hơn cho mỗi lần sử dụng. Đối với các doanh nghiệp điều hành đại lý ở quy mô lớn, điều đó sẽ tăng lên. Giả định chung là nếu bạn muốn có kết quả tốt hơn, bạn phải trả tiền cho một mô hình lớn hơn.
Dữ liệu SkillsBench làm phức tạp thêm giả định đó. Claude Haiku 4.5 của Anthropic—mô hình nhỏ nhất, giá cả phải chăng nhất đã được thử nghiệm—đạt được tỷ lệ thành công 27,7% khi được cung cấp các kỹ năng tuyển chọn. Không có kỹ năng, nó chỉ quản lý được 11%. Phần đáng chú ý: kết quả Haiku được trang bị kỹ năng đó đánh bại Claude Opus 4.5 – một mô hình đắt hơn đáng kể – chạy không có kỹ năng, đạt được 22%.
Nói cách khác, một mô hình nhỏ hơn được tóm tắt tốt sẽ hoạt động tốt hơn một mô hình lớn hơn được để lại cho các thiết bị của riêng nó.
Đối với các tổ chức quản lý chi phí triển khai AI, điều này sẽ thay đổi cách tính toán. Câu hỏi không còn chỉ là “chúng ta nên sử dụng mô hình nào?” mà còn là “chúng tôi giới thiệu cho các đại lý của mình tốt đến mức nào và liệu các kỹ năng tốt hơn có thể cho phép chúng tôi sử dụng một mô hình hợp lý hơn không?”
Giữ nó tập trung, không đầy đủ
Nghiên cứu này cũng giải quyết một câu hỏi thiết kế mà nhiều nhóm gặp phải khi xây dựng quy trình làm việc của tổng đài viên: một kỹ năng nên chứa bao nhiêu thông tin? Hóa ra, câu trả lời ít hơn những gì hầu hết mọi người nghĩ. Các nhiệm vụ được trang bị hai hoặc ba mô-đun kỹ năng tập trung cho thấy kết quả tốt nhất, cải thiện tỷ lệ thành công trung bình 18,6 điểm phần trăm.
Nhiệm vụ có bốn kỹ năng trở lên khiến con số đó giảm xuống chỉ còn 5,9 điểm phần trăm. Và các nhiệm vụ được giao các gói tài liệu toàn diện, rất dài thực sự hoạt động kém hơn so với khi chúng được cung cấp hướng dẫn ngắn hơn, có mục tiêu hơn.
Các tác giả nói rõ ràng: các kỹ năng quá dài “có thể tiêu tốn ngân sách theo ngữ cảnh mà không đưa ra hướng dẫn hữu ích”. Một nhân viên đang chìm đắm trong đống tài liệu phải đối mặt với vấn đề tương tự khi một nhân viên mới được giao một cuốn sổ tay 300 trang vào buổi sáng đầu tiên của họ – việc biết phải làm gì đã khó hơn chứ không phải dễ hơn.
Hướng dẫn ngắn gọn, từng bước kèm theo ví dụ hoạt động luôn hiệu quả hơn tài liệu đầy đủ.
Tại sao chuyên môn của con người vẫn đặt trần
Điều kiện cuối cùng được thử nghiệm là điều kiện có ý nghĩa nhất đối với cách các doanh nghiệp nghĩ về quyền tự chủ của AI. Các đặc vụ được yêu cầu tạo ra các kỹ năng của riêng họ trước khi thực hiện nhiệm vụ – về cơ bản là để tự tóm tắt trước khi bắt tay vào làm việc.
Nhìn chung, điều này khiến mọi việc trở nên tồi tệ hơn một chút chứ không tốt hơn. Các kỹ năng tự tạo tạo ra sự thay đổi -1,3 điểm phần trăm so với các tác nhân không có kỹ năng nào cả. Chỉ có một mô hình cho thấy sự cải thiện có ý nghĩa.
Hầu hết đều đưa ra hướng dẫn mơ hồ, thiếu chính xác hoặc không nhận ra rằng ngay từ đầu họ cần có kiến thức chuyên môn và chỉ đơn giản là thúc đẩy các phương pháp tiếp cận chung.
Kết luận mà các nhà nghiên cứu rút ra rất có ý nghĩa: “Các kỹ năng hiệu quả đòi hỏi chuyên môn về lĩnh vực do con người quản lý mà các mô hình không thể tự tạo ra một cách đáng tin cậy”.
Đây không phải là một phát hiện bi quan về AI. Đó là một trong những làm rõ. Đặc vụ AI có thể làm được những điều đáng chú ý khi được trang bị phù hợp. Bản thân việc trang bị – công việc nắm bắt kiến thức của tổ chức, các quy trình trong lĩnh vực và chuyên môn chuyên môn ở dạng có cấu trúc, có thể tái sử dụng – là nơi mà sự phán đoán của con người vẫn rất cần thiết.
Đối với các doanh nghiệp trên khắp Châu Á Thái Bình Dương, nơi kiến thức vận hành chuyên sâu thường nằm trong tay các đội ngũ giàu kinh nghiệm hơn là trong tài liệu chính thức, việc xây dựng khả năng mã hóa kiến thức đó ngày càng là một câu hỏi mang tính cạnh tranh.
Các tổ chức thực hiện đúng điều này sẽ không chỉ có các tác nhân AI tốt hơn. Họ sẽ có một lợi thế về cấu trúc thực sự khó có thể tái tạo được.

Bạn muốn tìm hiểu thêm về AI và dữ liệu lớn từ các nhà lãnh đạo ngành? Hãy xem AI & Big Data Expo diễn ra ở Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác, hãy nhấp vào đây để biết thêm thông tin.
Tin tức AI được cung cấp bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới khác tại đây.



