1 điểm bởi GN⁺ 2024-02-07 | 1 bình luận | Chia sẻ qua WhatsApp
  • Đây là một thí nghiệm so sánh LLM với Junior Lawyer và dịch vụ gia công quy trình pháp lý (LPO) trong rà soát hợp đồng; lấy phán đoán của Senior Lawyer làm chuẩn đáp án để đánh giá đồng thời việc xác định vấn đề, nhận diện vị trí, tốc độ và chi phí
  • Trong xác định vấn đề pháp lý, GPT4-1106 đạt F-score 0,871, gần như tương đương LPO 0,874 và cao hơn Junior Lawyer 0,860; nhưng ở nhận diện vị trí, LPO đạt 0,770, vượt GPT4-32k 0,740
  • Thí nghiệm sử dụng 10 hợp đồng mua sắm đã được ẩn danh; NDA bị loại vì tài liệu ngắn, không phù hợp để đánh giá phức tạp; đồng thời bao gồm cân bằng các hợp đồng thuộc thẩm quyền tài phán của Mỹ và New Zealand
  • Về tốc độ rà soát, LLM vượt trội rõ rệt: thời gian trung bình của Junior Lawyer là 56,17 phút, LPO 201 phút, trong khi GPT4-1106 là 4,70 phút, GPT4-32k 2,11 phút, Palm2 text-bison 0,73 phút
  • Chi phí mỗi hợp đồng được tính là 0,02 USD với Claude 2.0·Claude 2.1 và 0,25 USD với GPT4-1106, cho thấy mức tiết kiệm chi phí tối đa 99,97% so với Junior Lawyer 74,26 USD và LPO 36,85 USD

Đã so sánh những gì trong rà soát hợp đồng

  • Mục tiêu là đánh giá liệu LLM có thể vượt trội hoặc tương đương Junior Lawyer và LPO trong công việc rà soát hợp đồng quy mô lớn về độ chính xác, tốc độhiệu quả chi phí hay không
  • Công việc được so sánh là xác định các vấn đề pháp lý trong hợp đồng và tìm vị trí của các điều khoản hợp đồng ảnh hưởng đến phán đoán đó
  • Kết quả do Senior Lawyer đưa ra được dùng làm chuẩn đáp án để so sánh kết quả của LLM, Junior Lawyer và LPO
  • Câu hỏi nghiên cứu được tóm lược thành ba điểm
    • LLM có tốt hơn Junior Lawyer và LPO trong việc xác định vấn đề pháp lý và nhận diện vị trí trong hợp đồng hay không
    • LLM có thể rà soát hợp đồng nhanh hơn hay không
    • LLM có thể rà soát hợp đồng với chi phí thấp hơn hay không

Bộ dữ liệu và thiết kế thí nghiệm

  • Bộ dữ liệu gồm 10 hợp đồng mua sắm lấy từ các hợp đồng pháp lý thực tế và đã được ẩn danh để bảo mật
  • Hợp đồng mua sắm được chọn vì đây là loại hợp đồng có khối lượng rà soát lớn trong thực hành pháp lý; NDA được đánh giá là thường ngắn, không đủ để đánh giá năng lực của LLM trong việc xác định các vấn đề pháp lý phức tạp
  • Phạm vi thẩm quyền tài phán bao gồm cân bằng các hợp đồng của Mỹ và New Zealand
    • Mỹ được xem là hệ thống kết hợp giữa luật thành văn và thông luật
    • New Zealand được xem là hệ thống dựa trên thông luật
  • Mỗi hợp đồng được phân tích theo cấu trúc 2 thành phần gồm kịch bản tài liệu và playbook rà soát hợp đồng
    • Kịch bản tài liệu cung cấp bối cảnh về thẩm quyền tài phán, lịch sử, quy mô tổ chức, sản phẩm·dịch vụ của các bên trong hợp đồng
    • Playbook rà soát cung cấp các hạng mục kiểm tra được chuẩn hóa, phái sinh từ các trường hợp thực tế
  • Senior Lawyer đánh giá liệu từng hợp đồng có đáp ứng các tiêu chí được định nghĩa trước hay không, đồng thời tìm và ghi lại các phần cụ thể của hợp đồng có ảnh hưởng đến phán đoán
    • Trường hợp thông tin liên quan không có trong hợp đồng nên tiêu chí không được đáp ứng cũng được ghi nhận rõ ràng
    • Kết quả của nhiều Senior Lawyer được tổng hợp theo nguyên tắc đa số
  • Nghiên cứu được thực hiện theo các tiêu chuẩn đạo đức của Onit Inc., bao gồm thông báo cho người tham gia, quyền rút lui, ẩn danh hóa, khử định danh dữ liệu hợp đồng, cùng sự tham gia và kiểm toán của hội đồng đạo đức

Lựa chọn mô hình và prompt

  • Các mô hình được chọn dựa trên nhà cung cấp lớn trong lĩnh vực LLM, kết quả thử nghiệm sơ bộ và kích thước context window
  • Các mô hình không xử lý được từ 16.000 token trở lên bị loại vì được xem là khó bao quát toàn bộ ngữ cảnh hợp đồng
    • LLaMA2 và Amazon Titan phải chia tài liệu thành nhiều phần, và ở mỗi phần phải lặp lại kịch bản·playbook·các điều khoản định nghĩa
    • Các kỹ thuật như RAG cũng được xem xét, nhưng trong đánh giá sơ bộ, việc hiểu ngữ cảnh hợp đồng bị gián đoạn nên không phù hợp để so sánh với mức độ hiểu của luật sư con người
  • Các mô hình và thiết lập được đưa vào đánh giá như sau
    • GPT4 32k: temperature 0.2, đầu vào 32.768 token, dữ liệu huấn luyện đến tháng 9/2021
    • GPT4-1106: temperature 0.2, đầu vào 128.000 token, dữ liệu huấn luyện đến tháng 4/2023
    • GPT3.5-turbo-16k: temperature 0.2, đầu vào 16.385 token, dữ liệu huấn luyện đến tháng 9/2021
    • Claude 2.1: temperature 0.2, đầu vào 200.000 token, dữ liệu huấn luyện đến đầu năm 2023
    • Claude 2.0: temperature 0.2, đầu vào 100.000 token, dữ liệu huấn luyện đến đầu năm 2023
    • Palm2 Text-bison-32k-2: temperature 0.2, đầu vào 32.768 token, dữ liệu huấn luyện đến giữa năm 2021
  • Prompt được cấu thành từ vai trò, nhiệm vụ và ngữ cảnh
    • Vai trò yêu cầu mô hình đi theo persona luật sư
    • Nhiệm vụ là rà soát hợp đồng theo các tiêu chí đã cho, rồi xác định có vấn đề hay không và vị trí của vấn đề
    • Ngữ cảnh được cấu thành tương tự các chỉ dẫn cung cấp cho luật sư, LPO và người rà soát hợp đồng, như độc giả mục tiêu của hợp đồng, nền tảng các bên, kịch bản đàm phán

Độ chính xác: xác định vấn đề thì sát nhau, nhận diện vị trí còn có khoảng cách

  • Mức độ đồng thuận giữa các nhóm chuyên gia pháp lý được đánh giá bằng Cronbach’s Alpha
    • Mức độ đồng thuận của toàn bộ người tham gia là 0,923366, ở mức cao
    • Mức độ đồng thuận giữa các Senior Lawyer là 0,719308, thấp nhất
    • Junior Lawyer là 0,765058
    • LPO đạt 1,0, thể hiện sự trùng khớp hoàn toàn trong câu trả lời
  • Trong xác định vấn đề pháp lý, kết quả cao nhất theo F-score là LPO và GPT4-1106
    • LPO: precision 0.933, recall 0.823, F-score 0.874
    • GPT4-1106: precision 0.835, recall 0.910, F-score 0.871
    • Junior Lawyer: precision 0.876, recall 0.845, F-score 0.860
    • Claude 2.0 và GPT4-32k lần lượt ghi nhận F-score 0.817 và 0.820
    • GPT3.5 đạt 0.657, Palm2 text-bison đạt 0.708, tương đối thấp
  • Trong nhận diện vị trí vấn đề, LPO ghi nhận F-score cao nhất
    • LPO: precision 0.915, recall 0.666, F-score 0.770
    • GPT4-32k: precision 0.847, recall 0.660, F-score 0.740
    • Claude 2.1: precision 0.911, recall 0.569, F-score 0.701
    • GPT4-1106: precision 0.857, recall 0.575, F-score 0.686
    • Junior Lawyer: precision 0.866, recall 0.542, F-score 0.667
    • Palm2 text-bison có F-score 0.452, thấp nhất
  • LLM có thể tương đương hoặc tốt hơn Junior Lawyer và LPO trong xác định vấn đề, nhưng ở tác vụ chỉ ra chính xác vị trí điều khoản, chênh lệch theo từng mô hình là lớn và không phải lúc nào cũng vượt qua người làm pháp lý

Tốc độ·chi phí và các hạn chế khi triển khai

  • Thời gian rà soát hợp đồng trung bình của LLM ngắn hơn rất nhiều so với người làm pháp lý
    • Senior Lawyer: 43,46 phút
    • Junior Lawyer: 56,17 phút
    • LPO: 201,00 phút
    • GPT4-1106: 4,70 phút
    • GPT4-32k: 2,11 phút
    • GPT3.5: 1,44 phút
    • Claude 2.1: 2,05 phút
    • Claude 2.0: 1,63 phút
    • Palm2 text-bison: 0,73 phút
  • Palm2 text-bison, LLM nhanh nhất, được tính là hoàn thành tác vụ rà soát hợp đồng nhanh hơn LPO 276 lần và nhanh hơn Junior Lawyer 77 lần
  • Việc thiết lập, kiểm thử, tinh chỉnh và xác minh system prompt của LLM mất trung bình 16 giờ, tương đương thời gian dùng để giao việc tương tự cho Junior Lawyer và LPO
  • Chi phí trung bình mỗi hợp đồng cho thấy chênh lệch lớn giữa người làm pháp lý và LLM
    • Senior Lawyer: 75,92 USD
    • Junior Lawyer: 74,26 USD
    • LPO: 36,85 USD
    • GPT4-1106: 0,25 USD
    • GPT4-32k: 1,24 USD
    • GPT3.5: 0,05 USD
    • Claude 2.1: 0,02 USD
    • Claude 2.0: 0,02 USD
    • Palm2 text-bison: 0,03 USD
  • Tính toán chi phí dựa trên thời gian trung bình và đơn giá theo giờ của người làm pháp lý, cũng như số token đầu vào·đầu ra trung bình và giá theo token của LLM
    • Palm2 text-bison được tính giá dựa trên số ký tự, không phải token
  • Những LLM có hiệu năng nhận diện vị trí vấn đề thấp có thể bị hạn chế khi tự mình đánh dấu hợp đồng, nên trong công việc pháp lý, lựa chọn mô hình cũng quan trọng không kém hiệu năng và chi phí

1 bình luận

 
GN⁺ 2024-02-07
Ý kiến trên Hacker News
  • Tôi đang vận hành một startup tạo hợp đồng pháp lý biến các hợp đồng do luật sư soạn thành mẫu, và cũng đã thử xây dựng một phần tính năng phân tích bằng GPT để người thường có thể đọc hợp đồng và đặt câu hỏi.
    Trong việc rà soát hợp đồng, GPT mạnh về phân tích tài liệu hơn là tạo tài liệu, và bài báo này cũng củng cố điểm đó. Tuy nhiên, khi dùng thử nhiều startup rà soát tài liệu bằng AI, hầu hết đều sụp đổ ngay khi bị hỏi sâu để lấy câu trả lời cụ thể. Bài báo này có vẻ chỉ dừng ở mức tìm các điều khoản liên quan, chứ không phải kiểu đối thoại qua lại giữa luật sư và khách hàng.
    GPT không có trách nhiệm pháp lý ngay cả khi trả lời sai, nên nó hữu ích khi một người thông minh tự nghiên cứu. Điều này giống như trước đây người thông minh cũng có thể tự tra cứu bằng Google.
    Về tạo hợp đồng, trong đa số trường hợp tôi cho rằng một kho hợp đồng chuẩn được soạn thảo và rà soát tốt sẽ hữu ích hơn việc GPT tạo ra một hợp đồng riêng biệt mới mỗi lần ngay tại chỗ. Luật sư nắm giữ hợp đồng rất chặt, và quá trình tìm luật sư chịu viết hợp đồng để chúng tôi biến thành mẫu cũng cực kỳ khó khăn. Rốt cuộc, việc đó làm giảm nguồn doanh thu tương lai của chính họ và cộng đồng chuyên môn của họ. Việc huấn luyện GPT-4 tốn hàng trăm triệu đô la, nhưng nếu chỉ dùng 10 triệu đô la để xây dựng một kho hợp đồng được rà soát kỹ, thì có lẽ nó đã hữu ích hơn việc dùng cùng số tiền đó để huấn luyện một mô hình tạo hợp đồng.
    Mọi người đặt ra khá nhiều câu hỏi đa dạng về những gì họ muốn làm với tài liệu, nhưng GPT vẫn chưa làm tốt. Trong tương lai gần, có vẻ công việc của luật sư vẫn còn.

    • Hiện tượng luật sư giữ chặt hợp đồng không buông cũng thấy ở các ngành chuyên môn khác, đặc biệt nổi bật trong những lĩnh vực đòi hỏi đầu tư lớn cho giáo dục từ trước.
      Ví dụ khoảng 20 năm trước, ít nhất ở nơi tôi sống, các kiến trúc sư cũng không muốn tạo ra các bản thiết kế để bán rẻ cho nhiều người. Họ nghĩ những thiết kế như vậy sẽ làm thu hẹp thị trường sản phẩm kiến trúc. Nhưng rất dễ thấy rằng phần lớn mọi người thật ra không cần một thiết kế độc nhất.
      Cuối cùng thị trường cũng không quá bận tâm, và khi ai đó có thể tạo ra một thư viện thiết kế cùng mô hình kinh doanh đủ dùng, vấn đề tự được giải quyết. Từ góc nhìn của kiến trúc sư, lựa chọn chỉ còn là hợp tác để giữ lại được phần nào, hoặc mất hết.
      Tôi nghĩ luật sư cũng sẽ đi theo con đường tương tự. Khi những việc dễ nhất và sinh lời tốt nhất bị tự động hóa, họ sẽ trải qua một giai đoạn khó khăn; thị trường dịch vụ pháp lý sẽ thu hẹp, và phần việc còn lại sẽ là những nhiệm vụ phức tạp hơn mà tự động hóa không xử lý được.
    • Gần đây tôi đã thử lập di chúc bằng Willful và kết quả khá đáng thất vọng. Mẫu quá cứng nhắc, đến mức những điều kiện lẽ ra phải diễn đạt được như “nếu X xảy ra thì Y, nếu không thì Z” cũng khó làm, và việc chia tài sản cũng không cho phép gì ngoài tỷ lệ trên tổng tài sản.
      Có cảm giác họ lại dành khá nhiều trọng lượng cho những vấn đề tôi không thấy quá quan trọng, như cách xử lý thú cưng. Tôi vẫn có thể sửa lại kết quả cho phù hợp với mình, nhưng với một dịch vụ 150 đô la thì tôi kỳ vọng nhiều hơn.
    • Tôi thấy khi LLM tạo mã thì nhìn chung cũng tương tự. Hữu ích như một điểm khởi đầu, nhưng không hơn thế. Trong một thời gian nữa, chúng ta, các lập trình viên, vẫn còn việc để làm.
    • Lý do việc rà soát hợp đồng bằng AI sụp đổ khi bị yêu cầu câu trả lời cụ thể có thể là vì trên thực tế họ “thuê ngoài” khâu rà soát cuối cùng cho một luật sư thật ở Utah.
      Công ty tôi đang nghĩ tới ám chỉ trong tài liệu marketing rằng đó là một giải pháp hoàn toàn dựa trên AI, nhưng thực tế có vẻ không vận hành hoàn toàn chỉ bằng AI.
    • Có ý kiến nói GPT không có trách nhiệm pháp lý ngay cả khi trả lời sai, nhưng tôi vẫn hiểu rằng luật sư cũng không chịu trách nhiệm pháp lý chỉ vì đưa ra câu trả lời sai.
      Trong trường hợp cực đoan có thể trở thành vấn đề đạo đức và bị đoàn luật sư xử phạt, nhưng phần lớn chẳng phải chỉ là hệ quả về danh tiếng sao? Có tình huống nào có thể quy trách nhiệm pháp lý cho luật sư vì một hợp đồng được soạn sai không?
  • Trong các lĩnh vực LLM có thể hỗ trợ, lĩnh vực pháp lý đặc biệt đáng kỳ vọng. Trong 5–10 năm nữa — nhìn bài báo này thì có vẻ gần như đã tới rồi — tôi có thể trò chuyện vài giờ với một LLM “luật sư” có quyền truy cập vào tài liệu thuế, y tế, bảo hiểm và hôn nhân của mình, để nhận thông tin và lời khuyên được cá nhân hóa mà không phải trả 500 đô la một giờ.
    Sẽ có một làn sóng người bình thường hiểu biết pháp lý tốt hơn, và tôi thực sự mong chờ điều đó.

    • Tôi sẽ không tin mù quáng những gì LLM nói, nhưng nhìn chung nó sẽ đúng, và ít nhất có thể cung cấp cho tôi từ vựng để khám phá nhằm tự tìm hiểu thêm. Hoặc tôi cũng có thể tiếp tục đặt câu hỏi để đào sâu.
      Tôi đã hỏi LLM về giấy phép phần mềm và các hệ quả pháp lý, và có thể nắm được nền tảng cho các câu hỏi ở mức dự án sở thích mà không phải kéo một chuyên gia đắt đỏ vào.
      Tuy nhiên, nếu quyết định đó liên quan đến số tiền lớn thì tất nhiên tôi sẽ dùng dịch vụ chuyên gia. Với những chủ đề như vậy, “nhìn chung là đúng” là chưa đủ.
    • Hiện chúng tôi đang xây dựng đúng thứ như vậy.
      Mảng kinh doanh cốt lõi của chúng tôi là tạo tài liệu pháp lý, và nó hoạt động bằng logic dựa trên quy tắc, không phải AI. Vì đã nắm giữ tài liệu pháp lý của người dùng như kết quả của mảng kinh doanh cốt lõi, chúng tôi ở vị thế rất tốt để xây dựng tính năng chat AI hỗ trợ liên quan đến các tài liệu đó.
      Gần đây chúng tôi đã triển khai AI gợi ý sản phẩm lên môi trường vận hành. Một phần là dựa trên quy tắc, còn các câu chữ gợi ý được cá nhân hóa do GPT-4 tạo ra. Hiện chúng tôi đang xây dựng tính năng chat AI giúp người dùng hiểu nhiều tài liệu pháp lý và dịch vụ của chúng tôi. Chúng tôi định thay thế hỗ trợ khách hàng tuyến 1 bằng AI chat này, nhưng trước khi nổi giận, mong bạn biết rằng hỗ trợ khách hàng tuyến 1 hiện tại đang là một AI dựa trên quy tắc rất tệ.
      Website chính bằng tiếng Phần Lan là https://aatos.app. Chúng tôi cũng có một số dịch vụ cho SE và DK, và gần đây tại UK mới chỉ mở trước dịch vụ chữ ký điện tử.
    • Có vẻ cũng có thể có LLM giúp cắt giảm chi tiêu. Có thể tưởng tượng một LLM rà soát toàn bộ lịch sử chi tiêu, biết các luật, phúc lợi, tổ chức và chương trình khuyến mãi hiện hành, rồi đề xuất hoặc thực hiện những việc như đổi nhà cung cấp điện, đổi công ty bảo hiểm, hoặc mua số lượng lớn ở cửa hàng khác.
    • Đây không chỉ là vấn đề của pháp lý. Tôi đã tải kết quả xét nghiệm máu và dữ liệu 23andMe của mình lên ChatGPT, và nó phân tích tốt hơn bác sĩ của tôi.
    • Tôi cho rằng nhiều startup đang xây dựng đúng thứ đó, nhưng thành thật mà nói tôi không kỳ vọng nhiều. Tất cả vẫn bị ràng buộc bởi giới hạn token, và những cách tiêu biểu để lách nó như sinh tăng cường bằng truy xuất (RAG) và knowledge graph tuy có thể tiến gần tới hình dung mong muốn, nhưng tôi không nghĩ là đủ gần để thực sự hữu ích.
  • Tôi sẽ tạm chưa đưa ra kết luận về khả năng áp dụng LLM vào lĩnh vực pháp lý cho đến khi chúng được thử nghiệm ở các nhiệm vụ khác ngoài rà soát tài liệu/hợp đồng. Trong mảng pháp chế doanh nghiệp lớn, việc rà soát hợp đồng thường được thuê ngoài cho hàng trăm người mới tốt nghiệp, gần giống công việc hiệu đính chỉ sử dụng tối thiểu năng lực thực sự của luật sư, đồng thời giúp tăng doanh thu cho doanh nghiệp
    Các dịch vụ pháp lý mà cá nhân chủ yếu mua là những thứ như vụ việc gia đình, vụ án hình sự, hay tòa án xử các vụ nhỏ. Tôi không nghĩ LLM trong tương lai gần có thể đảm đương được kiểu phân tích theo từng tình tiết và hoàn cảnh cần thiết để xử lý một vụ tố tụng hình sự trọng tội. Tôi cũng chưa thấy bằng chứng nào cho thấy LLM có thể tiếp cận được những động lực gia đình mang tính cá biệt, theo từng vụ việc và rối rắm cần có trong các vụ quyền nuôi con hoặc ly hôn có tranh chấp
    Không có lý do gì để không chấp nhận LLM như một công cụ cho luật sư dùng, nhưng tôi hoàn toàn không nghĩ đây là công nghệ đã sẵn sàng để được đưa vào thực tiễn thật sự ngoài các công việc hiệu đính pháp lý lặp đi lặp lại

    • Con người cũng không hẳn giỏi xử lý các động lực gia đình phức tạp như quyền nuôi con hay ly hôn. Nhìn vào kết quả, có vẻ quan điểm cá nhân và cảm xúc của thẩm phán chiếm tỷ trọng lớn trong những vụ như vậy
      Nếu không có cảm xúc, quan điểm cá nhân và án lệ được xây dựng dựa trên những điều đó, tôi cũng không rõ các vụ như vậy sẽ trông như thế nào
  • Tôi đang phụ trách dữ liệu và AI tại một công ty môi giới bảo hiểm thương mại dựa trên công nghệ. Chúng tôi đang dùng GPT-4 để xây dựng một công cụ phân tích hợp đồng chuyên sâu chuyên biệt cho các yêu cầu bảo hiểm, và khi còn ở Google tôi cũng đã xây dựng nhiều giải pháp LLM cho đội pháp chế Google, từ phân loại bằng sáng chế đến hỗ trợ discovery
    Mô hình ngôn ngữ rất giỏi tiêu hóa ngôn ngữ pháp lý và phân tích tình huống. Nhưng nhiều ứng dụng pháp lý lại gắn với các quyết định quan trọng không được phép sai, chẳng hạn “chương trình bảo hiểm hiện tại có bảo đảm theo hợp đồng này không?”. Vì vậy, chúng tôi xây dựng sản phẩm LLM trong lĩnh vực pháp lý theo các nguyên tắc sau
    Phải là công cụ human-in-the-loop dùng cùng chuyên gia. Nếu có thể, nên thiết kế như công cụ hỗ trợ ra quyết định thay vì tự động hóa, và như vậy vẫn có thể tiết kiệm rất nhiều thời gian
    Cần có tính minh bạch và trích dẫn. Nếu là công cụ dùng cùng con người, phải có cơ chế xây dựng niềm tin. Dù là tô sáng các điều khoản tài liệu mà LLM đã tham chiếu, hay giải thích vì sao một phần phân tích không được cung cấp, việc trích dẫn căn cứ là rất quan trọng
    Nên tối ưu cho độ chính xác hơn là độ bao phủ. Trong nhiều trường hợp sử dụng pháp lý, false positive và ảo giác đặc biệt tệ, nên việc điều chỉnh mô hình hoặc prompt theo hướng ưu tiên precision sẽ giúp giảm thiểu vấn đề

    • Có gợi ý nào về cách khiến GPT-4 đưa ra trích dẫn không? Có phải là dùng prompt kiểu “hãy trích lại nguyên văn đoạn được trích dẫn” rồi tìm vị trí trong văn bản gốc để tô sáng không?
      Tôi tò mò “tối ưu cho độ chính xác” là nói đến prompt engineering, hay thực sự là fine-tune GPT-4?
  • Không phải bài này hoàn toàn không có điểm hay, nhưng nó trông giống cái cớ để đưa ra những câu phóng đại về cả một nhóm nghề nghiệp hoặc “ngành”. Có lẽ cũng nhằm tăng độ hiển thị rồi sau này bán thứ gì đó
    Phần tệ nhất là ở mục nghiên cứu trước đó họ chỉ trích dẫn đúng một tài liệu preprint. Bản thân tài liệu đó cũng không nói về rà soát hợp đồng mà là suy luận pháp lý nói chung. Một phần LegalBench dĩ nhiên là “diễn giải” và được xây trên các benchmark rà soát hợp đồng hiện có, nhưng lẽ ra họ đã có thể tìm được các bài liên quan hơn
    Tự động hóa rà soát tài liệu pháp lý, bao gồm các tác vụ hỏi-đáp, đã là một lĩnh vực rất sôi động trong NLP khoảng 20 năm qua, và còn sôi động hơn nhiều sau năm 2017. Ít nhất thì các công cụ như Kira, Luminance, dù không dựa trên LLM, cũng đã được các đội pháp chế và hãng luật trên toàn thế giới dùng khá rộng rãi. Vì vậy, các luật sư đã biết những giới hạn đó trong thực tế
    Tuy nhiên các công cụ kiểu Kira không đo hiệu năng của các mô hình mới nhất, cũng không dùng benchmark minh bạch. Ở điểm đó, kết quả benchmark của bài này là một bổ sung đáng hoan nghênh về mặt ứng dụng LLM
    Nhưng xét phạm vi hạn chế chỉ rà soát 10 tài liệu bằng một playbook rà soát duy nhất, thì không đến mức phải viết về “hàm ý đối với ngành”. Khá là khoa trương, và nó cho thấy các tác giả không hiểu rõ ngành này hơn là cho thấy tương lai của ngành dịch vụ pháp lý
    Nếu tò mò về chức năng và giới hạn, tôi cũng đề xuất vài bài đọc nhẹ nhưng hữu ích này: https://kirasystems.com/science/, https://zuva.ai/blog/, https://www.atticusprojectai.org/cuad

    • Có bài cụ thể nào đáng giới thiệu không? Các link dẫn tới blog có rất nhiều bài
  • Tôi tò mò các luật sư sẽ nghĩ ra những lập luận pháp lý nào để làm suy yếu công nghệ đang đe dọa ngành của họ

    • Ngược lại, tôi nghĩ chi phí để trở thành luật sư sẽ còn đắt hơn. Vì giờ sẽ cần máy chủ để chạy suy luận AI, lập trình viên và dịch vụ bên thứ ba
    • Ít nhất ở Mỹ, các luật sư đang nắm quyền kiểm soát chính phủ. Tôi dự đoán sẽ sớm có luật cấm hoặc hạn chế nghiêm ngặt việc dùng AI trong lĩnh vực pháp lý
      Lý lẽ thì sẽ đủ loại, từ nguy cơ bào chữa kém hiệu quả cho đến “hãy nghĩ đến trẻ em”. Miễn là giúp bảo vệ độc quyền thì họ sẽ dùng hết
    • Đó không phải lập luận gượng ép, mà được gọi là hành nghề pháp lý không có giấy phép, và là tội phạm
    • Bản quyền có vẻ là hướng tấn công chính
  • Nhìn vào các vụ gần đây khi luật sư dùng ChatGPT để nghiên cứu và hỗ trợ soạn thảo văn bản tố tụng rồi mọi chuyện diễn ra không tốt, tôi chưa hoàn toàn bị thuyết phục bởi sự lạc quan trong các bình luận ở đây

    • Công nghệ thì ổn. Giáo dục và literacy để người dùng phổ thông không chuyên kỹ thuật hiểu các khiếm khuyết và giới hạn của nó lại là chuyện khác
    • Tất cả bọn họ đều là những kẻ ngốc còn muốn tiết kiệm cả chi phí GPT-4. Họ đã bị ảo giác đánh lừa
    • Đó là lỗi ở mức nhập môn. Không kiểm tra xem án lệ có thực sự tồn tại hay không cơ đấy
      Việc tạo một pipeline nhỏ tạo→xác minh không phải là chuyện tầm thường, nhưng cũng không phải không thể. Các vụ được nhắc tới trông giống sự kết hợp giữa một associate cực kỳ lười biếng và hiểu biết rất poor về việc LLM đang làm gì
  • Về mặt lý thuyết, câu chữ pháp lý nên được cấu trúc tương tự như code. Vì có cấu trúc logic, nó có thể dễ áp dụng LLM hơn so với các dạng ngôn ngữ tự nhiên khác
    Ban đầu từng có tin các luật sư nộp các án lệ “giả”, nhưng việc tái định hình profession pháp lý chỉ là vấn đề thời gian. Trong các hãng luật có rất nhiều người làm các công việc đơn giản như trợ lý, và LLM có thể làm những việc đó. Họ được xem là lao động cổ trắng, nhưng rồi sẽ biến mất
    Mọi chuyện sẽ diễn ra theo cách tương tự như coding. Nó giống như có thêm một junior partner cần được kiểm tra, và có thể thay thế việc xử lý các tài liệu tiêu chuẩn
    Không thể tin hoàn toàn, nhưng junior developer cũng đâu có được tin hoàn toàn. Dù vậy, nó vẫn đưa bạn đi được tới mốc 80%

    • Tôi phần nào đồng ý rằng chuyện này sẽ diễn ra giống như coding, nhưng chính vì thế lại càng thấy khó hiểu. Ít nhất trên HN, tôi thường thấy nói rằng AI sẽ làm chấn động profession pháp lý và khiến luật sư thất nghiệp hàng loạt, nhưng lại ít thấy nói rằng ngành coding sẽ thay đổi theo cùng cách đó
  • Đây là một không gian vấn đề thú vị. Có một lý thuyết pháp lý kiểu gây nhiễu văn hóa có thể hiệu quả ở đây
    Giả sử có một dịch vụ tự tranh tụng giá 99 USD/tháng làm hai việc. 1) Dạy cách chuyển toàn bộ tài sản sang các phương tiện an toàn. 2) Đồng thời giúp tự bào chữa trong vai trò người tự tranh tụng. Mục tiêu không phải là thắng, mà là làm hệ thống bị tắc nghẽn. Sau khi phát tín hiệu cho đối phương rằng về mặt pháp lý bạn đang ở trạng thái phá sản, nếu cứ liên tục nộp đơn và khiến quá trình trở nên đau đớn nhất có thể, họ có thể nhận ra rằng thủ tục kháng cáo sẽ mất tới 5 năm và đơn giản là bỏ cuộc
    Đúng là luật sư không muốn giao tài liệu pháp lý cho các dịch vụ template, nhưng nói thật, chỉ cần đến tòa, thu thập hàng loạt hồ sơ đã nộp và dùng chúng để huấn luyện cũng có thể là đủ. Trong chiến lược đó, không nhất thiết cần tài liệu xuất sắc hay lý thuyết pháp luật hay. Chỉ cần tài liệu đáp ứng yêu cầu nộp của tòa là được. Kiểu như: “Vâng, chúng tôi sẽ cần lấy lời khai có ghi biên bản của các con gái người giúp việc nhà ông/bà với mức 400 USD/giờ, và nếu có vấn đề gì thì cứ mở một phiên điều trần.” Nếu đủ nhiều người làm như vậy, hệ thống pháp luật về cơ bản sẽ ngừng lại và quyền lực sẽ trở về với người dân
    Tưởng nhớ Aaron Swartz, người đã qua đời khi đấu tranh cho những vấn đề như thế này

  • “Trong mọi vụ truy tố hình sự, bị cáo có quyền được luật sư trợ giúp để bào chữa cho mình” — Tu chính án thứ Sáu của Hiến pháp Hoa Kỳ
    Nếu LLM trở nên có năng lực hơn luật sư con người trung bình, liệu điều khoản này vẫn yêu cầu sự trợ giúp của luật sư con người không?

    • Các chính phủ trên toàn thế giới sẽ dốc toàn lực để khiến mọi người xem đề xuất này là sự thật, đặc biệt là để họ dùng LLM thay cho luật sư con người trong bào chữa hình sự. Vì sao ư?
      Có lẽ đặc điểm quan trọng nhất của luật sư không phải là kiến thức kỹ thuật
    • Công dụng khác nhau. Luật sư có thể thay bạn xử lý những việc như tiến trình xét xử
      LLM có thể hỗ trợ các vấn đề về sự kiện thực tế, v.v., và nếu được thiết kế đúng, thậm chí có thể mang lại đảm bảo về quyền riêng tư mạnh hơn luật sư. Dĩ nhiên, có vẻ điều đó khó mà thực sự xảy ra
    • Trớ trêu thay, câu hỏi này có khi nên hỏi GPT thì hơn
    • Có. LLM không miễn phí, và vẫn cần chuyên gia để kiểm chứng đầu ra
    • Đó là việc để tòa án quyết định. Hoàn toàn hợp lý khi suy đoán rằng sẽ có một vụ như vậy xảy ra, vấn đề chỉ là nó sẽ đến nhanh đến mức nào