Tuần trước, khi lướt Twitter, tôi thấy một dòng tweet từ một dev DeFi kỳ cựu: “Nếu Claude có thể ghi lại màn hình và tự động hóa quy trình làm việc, tại sao tôi không thể dùng nó để chạy bot thanh khoản? Và nếu nó ghi lại cả phím tắt, ai sẽ chịu trách nhiệm khi bot đó vô tình gửi toàn bộ LP token vào địa chỉ sai?” Câu hỏi đó khiến tôi dừng lại. Trong 7 năm làm việc với hợp đồng thông minh, tôi chưa từng thấy một bước nhảy vọt nào về UI automation lại có thể phá vỡ lớp bảo mật mong manh của các giao thức DeFi nhanh đến vậy. Và bây giờ, cả Anthropic và OpenAI đều tung ra cùng một tính năng: ghi lại kỹ năng (Record a Skill). Đây là câu chuyện về sự giao thoa giữa AI Agent và chuỗi khối, nơi mà mỗi lần nhấp chuột đều có thể trở thành một giao dịch on-chain tiềm ẩn rủi ro.
Để hiểu được tác động thực sự, chúng ta cần nhìn lại bối cảnh. Tính năng “Ghi lại kỹ năng” cho phép người dùng ghi lại toàn bộ thao tác trên máy tính: di chuyển chuột, nhấp chuột, gõ phím và thậm chí giọng nói. Sau đó, AI sẽ biến đoạn ghi hình đó thành một “kỹ năng” có thể chạy lại tự động. Về mặt kỹ thuật, đây là sự kết hợp giữa Behavior Cloning (học bắt chước hành vi) và mô hình đa phương thức. Ứng dụng tức thì trong blockchain là rất rõ ràng: một nhà phát triển có thể ghi lại quy trình deploy hợp đồng, verify trên explorer, rồi thêm thanh khoản trên Uniswap, và chỉ với một cú nhấp chuột, toàn bộ quy trình đó được lặp lại. Trước đây, để tạo một kỹ năng như vậy, người dùng phải viết tay file SKILL.md và script phức tạp. Giờ đây, chỉ cần “show” cho AI cách làm. Điều này giống như việc đào tạo một người thực tập mới, chỉ khác là người thực tập đó có thể xử lý hàng trăm tài khoản cùng lúc.
Cốt lõi của vấn đề nằm ở cách mà tính năng này tương tác với các lớp cơ sở hạ tầng blockchain. Hãy tưởng tượng một chuỗi giao dịch điển hình: mở ví, kết nối MetaMask, chọn token, approve, swap, confirm. Mỗi bước đều có thể được ghi lại. Nhưng ở đây xuất hiện một trade-off quan trọng: tốc độ tự động hóa đánh đổi bằng tính bảo mật. Khi tôi audit hợp đồng ICO TokenHub năm 2017, tôi phát hiện một lỗi cho phép kẻ tấn công rút token trước khi phân phối. Lỗi đó nằm ở logic approve không kiểm tra số dư đầy đủ. Với tính năng ghi kỹ năng, một kỹ năng được tạo ra từ giao dịch approve có thể vô tình ghi lại cả private key nếu người dùng không cẩn thận (dù MetaMask ẩn password, nhưng vị trí nhấp chuột và thời gian vẫn có thể bị phân tích). Điểm mù lớn nhất không đến từ AI, mà từ thói quen của người dùng khi cho phép ghi lại toàn bộ màn hình.

Một phân tích kỹ thuật sâu hơn: Cả Claude và Codex đều sử dụng mô hình ngôn ngữ lớn để phân tích đầu vào từ màn hình và tạo ra các lệnh thực thi. Trong bối cảnh blockchain, điều này có nghĩa là AI phải hiểu được giao diện của các dApp (ví dụ: layout của Uniswap, các nút approve/swap). Nếu dApp thay đổi giao diện (ví dụ Uniswap V4 cập nhật UI), kỹ năng đã ghi sẽ thất bại. Đây là lý do tại sao tính ổn định của kỹ năng phụ thuộc vào tần suất cập nhật giao diện của dApp. Theo kinh nghiệm của tôi, các giao thức DeFi thường thay đổi giao diện mỗi 2-3 tháng để cải thiện UX, đồng nghĩa với việc các kỹ năng ghi lại có tuổi thọ rất ngắn. Ngược lại, các công cụ dòng lệnh như cast (Foundry) hay web3.py vẫn hoạt động ổn định bất chấp UI thay đổi. Vì vậy, tôi cho rằng sự phụ thuộc vào UI automation là một sai lầm chiến lược đối với các nhà phát triển blockchain chuyên nghiệp, dù nó có thể hữu ích cho người dùng mới.

Góc nhìn trái ngược: Hầu hết mọi người cho rằng ghi kỹ năng là một bước tiến về năng suất. Nhưng tôi thấy nó mở ra một lỗ hổng bảo mật hoàn toàn mới: tấn công chuỗi cung ứng kỹ năng. Hãy tưởng tượng một kẻ tấn công tạo ra một kỹ năng “Deploy token ERC-20 an toàn”, ghi lại các bước nhưng chèn thêm một bước ẩn: chuyển quyền sở hữu cho chính họ. Người dùng không có kiến thức chuyên môn sẽ tải về, chạy kỹ năng đó, và mất toàn bộ quyền kiểm soát token. Điều này tương đương với việc tải smart contract template từ GitHub mà không audit — nhưng còn nguy hiểm hơn vì kỹ năng có thể ẩn giấu các hành động ngoài ý muốn. Trong báo cáo nội bộ dài 50 trang về đề xuất ZK-rollup năm 2022, tôi đã chỉ ra rằng bất kỳ hệ thống nào cho phép thực thi mã từ bên thứ ba mà không có cơ chế sandbox đều dẫn đến thảm họa. Tính năng ghi kỹ năng hiện tại không có cơ chế kiểm tra bảo mật tự động nào cho các kỹ năng chia sẻ — một điểm mù nghiêm trọng.
Phán đoán có tính tiến bộ: Trong vòng 12 tháng tới, chúng ta sẽ chứng kiến sự ra đời của một loại hình tấn công mới: “Skill-jacking” — nơi kẻ tấn công phát tán các kỹ năng độc hại nhắm vào người dùng DeFi. Các sàn giao dịch phi tập trung sẽ phải tích hợp cơ chế xác thực giao dịch dựa trên intent, tương tự như giải pháp của CowSwap, để chống lại việc thực thi mù quáng các bước được ghi lại. Liệu các đội ngũ phát triển có kịp chuẩn bị trước khi làn sóng đầu tiên của Skill-jacking ập đến? Tôi sẽ theo dõi chặt chẽ các dấu hiệu bất thường trong mã nguồn của các kỹ năng được chia sẻ trên các diễn đàn cộng đồng.
