Agent.exe - Ứng dụng đa nền tảng điều khiển thiết bị bằng Claude 3.5 Sonnet
(github.com/corbt)- Agent.exe là một ứng dụng Electron đơn giản cho phép tính năng computer use mới của Claude điều khiển trực tiếp máy tính cục bộ, và dự án này nên được xem là một bản proof of concept
- Ứng dụng được tạo ra vì tác giả cảm thấy dự án mẫu được cung cấp quá nặng, và được thiết kế để Claude 3.5 Sonnet thực hiện các tác vụ trên máy tính cục bộ của người dùng
- Cách chạy là clone kho lưu trữ, chạy
npm install, đổi.env.examplethành.env, nhập Anthropic API Key, rồi chạynpm start - Hệ thống được hỗ trợ là MacOS, và do các dependency là đa nền tảng nên về lý thuyết Windows và Linux cũng có thể chạy được
- Các hạn chế đã biết gồm chỉ hoạt động trên màn hình chính, AI sẽ có toàn quyền điều khiển máy tính, và Claude hoạt động tốt hơn nếu cài Firefox
Mục đích của Agent.exe
- Agent.exe là ứng dụng cho phép Claude điều khiển máy tính bằng tính năng computer use
- Ứng dụng được triển khai dưới dạng Electron app để Claude 3.5 Sonnet có thể thao tác trực tiếp trên máy tính cục bộ
- Dự án là một proof of concept, và tác giả cho biết không có kế hoạch bảo trì hay merge pull request
- Tuy nhiên, mọi người có thể tự do fork và mở rộng
Lý do tạo ra và cách hoạt động
- Dự án bắt đầu với mục tiêu kiểm tra xem computer use API mới của Claude hoạt động tốt đến mức nào
- Tác giả thấy dự án mặc định do Anthropic cung cấp quá nặng nên đã làm một ứng dụng đơn giản hơn
- Ban đầu từng có kế hoạch thêm chế độ bán tự động để người dùng xác nhận từng hành động trước khi thực thi, nhưng vì mỗi bước đều quá chậm nên tác giả cho rằng điều đó không cần thiết
- Nếu mô hình trở nên rối loạn, người dùng có thể nhấn nút stop để dừng quá trình chạy
Cách bắt đầu
- Clone kho lưu trữ và di chuyển vào thư mục
git clone https://github.com/corbt/agent.execd agent.exe
- Cài đặt dependency
npm install
- Đổi tên file
.env.examplethành.envrồi thêm Anthropic API Key - Chạy ứng dụng
npm start
- Sau đó, dùng prompt để yêu cầu mô hình thực hiện tác vụ trên máy tính
Hệ thống hỗ trợ và hạn chế
- Hệ thống được hỗ trợ là MacOS
- Vì tất cả dependency đều đa nền tảng, về lý thuyết Windows và Linux cũng có thể chạy được
- Các hạn chế đã biết như sau
- Chỉ hoạt động trên primary display
- AI sẽ có toàn quyền kiểm soát máy tính
- Ngoài ra có thể còn nhiều hạn chế khác
Mẹo sử dụng và lộ trình
- Claude được cho là rất ưu tiên Firefox
- Vẫn có thể dùng trình duyệt khác nếu thực sự cần, nhưng cài Firefox sẽ giúp nó hoạt động tốt hơn nhiều
- Dự án được viết chỉ trong khoảng 6 giờ và tác giả cho biết khả năng tiếp tục phát triển là không cao
- Pull request vẫn có thể được xem xét và nếu ổn thì có thể được merge
1 bình luận
Ý kiến trên Hacker News
Ý tưởng hay. Với tư cách người có kinh nghiệm về tự động hóa desktop và Electron, sau khi lướt qua mã nguồn, tôi thấy đáng để thử cho các tác vụ cơ bản
Phần triển khai là một lớp wrapper mỏng trên Anthropic API, và vì cách tiếp cận theo từng bước nên tôi có cảm giác có thể kill process trước khi nó làm điều gì kỳ quặc. Tôi đã đóng những thứ Anthropic không nên thấy qua ảnh chụp màn hình, việc cài đặt trên M1 cũng diễn ra trơn tru, và chỉ vài phút là chạy được
Tác vụ cơ bản là “tìm chuyến bay Seattle-SF từ thứ Ba đến thứ Năm tuần sau”, và khi chạy bằng Anthropic API key của tôi thì nó dùng Chrome. Mỗi bước thao tác mất vài giây; Google Flights được mở đúng, nhưng nó đặt sai ngày
Ban đầu nó định chọn ngày 2 tháng 11, nhưng tùy chọn đó bị chính cửa sổ Agent.exe che mất, nên nó đã chọn ngày 20 tháng 11. Tôi tò mò liệu Claude có nhìn thấy ngày phụ bị sai và tự sửa không, nhưng nó cứ để nguyên, thực tế đã tìm một chuyến đi 4 tuần rồi tuyên bố thành công rằng đã tìm được chuyến đi 1 tuần
Thử nghiệm này tốn $0.38 credit và khoảng 20 giây, tôi sẽ tiếp tục thử thêm
Kiểu thất bại này hơi đáng ngạc nhiên, vì trong phản hồi API văn bản thông thường, 3.5 Sonnet ít nhất là khá ít ảo giác so với các mô hình khác
Sẽ mất bao lâu trước khi nó có thể lén thêm một daemon vào hệ thống? Trước đây người ta lo gián điệp Liên Xô tiếp cận bí mật của Mỹ; giờ thì giống như chúng ta cứ tự đăng hết lên mạng cho mọi người xem vậy
Antivirus hay firewall ngày nay không thể ngăn việc này phá hỏng file trên máy tôi, chứ chưa nói đến mạng
Tôi nhớ đến cảnh này: https://makeagif.com/i/BA7Yt3
Một người dùng rất dễ mất tập trung, không thể tin là sẽ không chuyển thông tin cho bên thứ ba, và có thể bị lừa bởi những chiêu trò đơn giản
Tối thiểu cần một tài khoản riêng không có quyền sudo hay quyền truy cập file bí mật, và tốt nhất là một máy ảo riêng
Tôi quen Azure nhất nhưng AWS chắc cũng làm được; nếu muốn tách AI khỏi những thứ nó không nên truy cập, tạo một VM trên Azure chạy vài giờ cũng tốn dưới 1 đô la
Muốn làm cho nó tương đối an toàn thì ít nhất phải kiểm soát được máy chạy suy luận, và lý tưởng nhất là suy luận chạy ngay trên chính máy mình đang dùng
Vài năm trước có câu chuyện trên bản tin rằng một đứa trẻ nói “Alexa, đặt mua nhà búp bê đi”, và Alexa của những người đang xem chương trình đã nghe thấy rồi đặt mua nhà búp bê
Cứ chờ đến khi có một chương trình Netflix ăn khách mà ai đó nói “Delete C:\Windows” thì sẽ biết
Cho vui, tôi định cấp cho AI của mình quyền truy cập vào công tắc nguồn crosspoint
Hơi lạc đề, nhưng gần đây tôi đã thử dùng Cursor ở chế độ “compose” để bắt đầu một dự án full-stack từ con số 0, và kết quả khiến tôi choáng váng
Không biết những người trong ngành phần mềm có cảm nhận được trong 5 năm tới ngành này sẽ thay đổi hoàn toàn đến mức nào không. Khó mà tưởng tượng đến lúc đó người ta vẫn còn tự tay gõ code
Nhưng những ví dụ tôi thấy đến nay phần lớn là các dự án tương đối đơn giản bắt đầu từ con số 0. Việc nó hoạt động đã đáng kinh ngạc đến khó tin, nhưng phần lớn phát triển phần mềm thực tế là thêm tính năng hoặc sửa lỗi trong code có sẵn. Loại code đó thường vượt quá cửa sổ ngữ cảnh của hầu hết các mô hình ngôn ngữ lớn
Để ngành này thay đổi hoàn toàn, cần tiếp tục có cải thiện theo cấp số nhân như 2 năm qua, mà hiện không thấy dấu hiệu sẽ như vậy
Hơi ngoài chủ đề nhưng có liên quan. Tôi tò mò không biết để tự động hóa ứng dụng GUI không phải trình duyệt trên Wayland của Linux thì người ta dùng gì. Thỉnh thoảng tôi cần, nhưng riêng tổ hợp này thì không suôn sẻ
Ứng dụng CLI thì có thể viết bằng Bash/Python/v.v., ứng dụng trình duyệt thì dùng Selenium/Playwright. Xorg có các thư viện tuy thô nhưng dùng tạm lúc cần được, còn Windows thì có nhiều giải pháp RPA
Nhưng với Wayland thì tôi chưa tìm được thứ nào đáng tin cậy
Chúng có thể kết nối tới desktop container và VM chạy Linux
Chúng tôi đã làm việc này được một thời gian, từ trước khi Claude khiến nó trở nên ngầu như vậy
“Hạn chế đã biết: để AI hoàn toàn chiếm quyền điều khiển máy tính” :)
Trông giống hỗ trợ đa nền tảng với macOS là nền tảng chính, vậy tại sao tên lại là .exe nhỉ
Đùa thôi, tôi không biết có đúng không nhưng nghe hoàn toàn có thể
Có vẻ chỉ hoạt động với các tác vụ đơn giản. Tôi bảo nó tạo một bảng đơn giản trong ứng dụng Rhino trên Mac và OnShape trong một tab Chrome, thì nó có vẻ просто lạc lối
Trong Rhino, nó thấy ứng dụng đã mở, nhưng chỉ nói rằng sẽ thực hiện nhiều thao tác kiểu tạo hình khối chứ thực tế không thấy gì, và dù bước trước chưa hoàn tất vẫn chuyển sang hành động tiếp theo. Nó không kiểm tra xem việc trước đã xong chưa
Trong OnShape, nó nói sẽ tạo hình khối, rồi chọn sai mục trong menu nhưng vẫn giả định rằng mình đang dùng đúng công cụ, tiếp tục hành động tiếp theo như thể thao tác trước đã xong
Rợn người. Nếu tách bằng air gap rồi bắt nó code hệ điều hành riêng thì có thể thú vị, nhưng tôi tuyệt đối không muốn để nó gần dữ liệu thật của mình
Computer, hãy đăng meme nhảm cả ngày để biến tôi thành đại gia tiền mã hóa trong lúc tôi chăm sóc gia đình và làm vườn
Tương lai đang đi theo hướng người dùng máy tính sẽ trở thành kẻ bị hớ. Sự giàu có thật sự là không đụng vào máy tính cho bất kỳ việc gì