1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Kết quả so sánh 1.008 SVG từ 7 mô hình frontier không tìm thấy bằng chứng rõ ràng về pelicanmaxxing, tức đẩy hiệu năng lên để khớp với một prompt nổi tiếng
  • 48 prompt kết hợp 8 loài động vật và 6 phương tiện được chạy 3 lần cho mỗi mô hình, rồi GPT-5.6 Luna chấm riêng độ nhất quán của động vật, phương tiện và hành động theo thang 1–5
  • Bồ nông đứng thứ 6 trong 8 loài động vật, xe đạp đứng thứ 5 trong 6 phương tiện, và tổ hợp bồ nông-xe đạp cũng chỉ xếp 42/48
  • Ngay cả trong phân tích hồi quy đã hiệu chỉnh độ khó, hiệu ứng theo từng phòng thí nghiệm cũng không có ý nghĩa thống kê; hiệu ứng xe đạp của Gemini 3.5 Flash là trường hợp duy nhất từng có ý nghĩa nhưng cũng không vượt qua hiệu chỉnh so sánh đa lần
  • Cả 21 ảnh bồ nông-xe đạp đều hướng sang phải, nhưng 60% tổng số ảnh cũng cùng hướng đó; thí nghiệm này cũng không thể xác định liệu có SVGmaxxing để tăng cường năng lực tạo SVG nói chung hay không

Benchmark ‘bồ nông đi xe đạp’

  • Simon Willison đã nhiều năm thử cùng một prompt “hãy tạo SVG của một con bồ nông đang đi xe đạp” mỗi khi một LLM lớn mới ra mắt
  • Bài test khởi đầu như một trò đùa này đã trở thành một benchmark AI không chính thức nổi tiếng, và trong các thread giới thiệu mô hình mới trên Hacker News, những kết quả liên quan cũng nhận được rất nhiều upvote
  • benchmaxxing là hành vi tối ưu hóa mô hình AI để đạt điểm cao trên các benchmark phổ biến
  • Vì hiệu năng mô hình có thể ảnh hưởng đến lựa chọn của người dùng, bài viết kiểm chứng khả năng các phòng thí nghiệm đã tối ưu mô hình cho riêng bài test này, tức pelicanmaxxing
  • Mã thí nghiệm và pipeline xử lý dữ liệu được công khai trong kho GitHub

Thiết kế thí nghiệm tạo ra 1.008 SVG

  • Kết hợp 8 loài động vật và 6 phương tiện để tạo thành 48 prompt
    • Động vật: pelican, flamingo, heron, otter, raccoon, antelope, whale, cat
    • Phương tiện: bicycle, unicycle, skateboard, scooter, plane, boat
  • Tất cả prompt chỉ thay động vật và phương tiện trong câu gốc của Simon Willison
  • Động vật và phương tiện không được chọn theo một quy trình quá nghiêm ngặt, nhưng được sắp để tạo ra mức độ tương đồng với bản gốc và độ khó đa dạng
    • flamingo và heron giống pelican
    • cat, raccoon, otter được chọn làm các trường hợp dễ
    • antelope là trường hợp khó, còn whale rất khác pelican
  • Thử nghiệm 7 mô hình sau qua OpenRouter
    • GPT-5.6 Terra
    • Claude Sonnet 5
    • Gemini 3.5 Flash
    • Grok 4.5
    • Qwen3.7-Max
    • GLM-5.2
    • DeepSeek V4 Pro
  • Với mỗi prompt, tạo 3 mẫu ở temperature 1.0 và cùng mức nỗ lực suy luận, thu được tổng cộng 1.008 SVG

Pipeline render, chấm điểm và trích xuất đặc trưng

  • Kết quả tạo sinh được xử lý qua ba bước
    • Render: chuyển SVG sang PNG; nếu không có SVG hoặc render thất bại thì tạo lại cho đến khi có kết quả hợp lệ
      • Trong 1.008 lần tạo đã có 11 lần thử lại
    • Chấm điểm: GPT-5.6 Luna chấm riêng độ nhất quán của động vật, phương tiện và hành động từ 1 đến 5
      • Xếp hạng động vật và phương tiện dùng điểm riêng của từng hạng mục
      • Khi cần một con số duy nhất cho mỗi ảnh, dùng điểm giám khảo (judge score) là trung bình của ba điểm
    • Trích xuất đặc trưng: Gemini 3.1 Flash-Lite ghi lại động vật và phương tiện được nhận diện, hướng của chủ thể và các yếu tố trong cảnh
  • Nếu một phòng thí nghiệm đã học riêng benchmark này, thì hàng pelican, cột bicycle hoặc ô pelican-bicycle sẽ nhận điểm cao hơn mức độ khó vốn có của chúng

Khác biệt quan sát được bằng mắt

  • Khi so sánh lưới ảnh tổng thể theo từng mô hình, không tìm thấy trường hợp ảnh pelican-bicycle vượt trội rõ rệt so với các kết quả khác của cùng mô hình
  • Mẫu đầu tiên của GLM-5.2 trông có vẻ khá hơn đôi chút, nhưng trong cùng nhóm cũng có ảnh heron-skateboard chất lượng cao, nên khó xem đó là kết quả của tối ưu hóa đặc biệt
  • Các phòng thí nghiệm tạo được ảnh pelican-bicycle đẹp cũng có xu hướng vẽ tốt các tổ hợp động vật-phương tiện khác
  • Đánh giá bằng mắt khó tái lập và có thể khác nhau giữa từng người, nên bài viết bổ sung phân tích định lượng

Thành tích riêng của bồ nông và xe đạp

  • Khi cộng điểm động vật trên mọi mô hình, pelican đứng thứ 6/8
    • Thấp hơn cat, whale, raccoon, heron và antelope
    • Cả 7 phòng thí nghiệm đều vẽ cat, whale và raccoon tốt hơn pelican
  • Bản thân pelican có thể khó vẽ hơn cat, nên chỉ riêng thứ hạng này chưa thể loại trừ khả năng có huấn luyện riêng
  • Bicycle đứng áp chót trong 6 phương tiện, gần ngang với plane ở cuối bảng
  • Một chiếc xe đạp cần có hai bánh khớp nhau, khung nối hai trục bánh, tay lái, yên và bàn đạp
    • Mô hình chấm điểm cho rằng khoảng 2/3 ảnh xe đạp bị thiếu ít nhất một trong các yếu tố này hoặc nối không đúng
  • Bicycle cũng khó hơn các phương tiện đơn giản như skateboard, nên ngay cả khi được huấn luyện riêng, thứ hạng tương đối vẫn có thể thấp

Sự mơ hồ do prompt ‘plane’ tạo ra

  • Việc dùng “plane” thay vì “airplane” khiến một số mô hình hiểu đây là mặt phẳng hình học chứ không phải máy bay
  • Vì vậy ảnh được tạo ra là con vật đứng trên một bề mặt phẳng thay vì đang cưỡi máy bay
  • Chỉ riêng ở plane, bộ trích xuất đặc trưng mới gặp trường hợp hoàn toàn không tìm thấy phương tiện
    • Trong 168 ảnh plane, có 25 ảnh không nhận diện được phương tiện
    • Ở 5 phương tiện còn lại thì không có trường hợp nào như vậy
  • 20% ảnh plane nhận điểm phương tiện là 1 hoặc 2
    • Bicycle là 5%
    • Boat, scooter và skateboard không có ảnh nào chỉ được 1–2 điểm

Xếp hạng theo tổ hợp và hiệu chỉnh độ khó

  • Tổ hợp pelican-bicycle có thành tích trung bình đứng 42/48
  • Vì mỗi tổ hợp có thể có độ khó nội tại khác nhau, tác giả áp dụng phân tích hồi quy hiệu ứng cố định trên toàn bộ 1.008 ảnh
    • Công thức cơ bản là score ~ lab + animal × vehicle
    • Bổ sung các hạng tương tác pelican, bicycle và pelican-bicycle theo từng phòng thí nghiệm
    • Dùng sai số chuẩn vững
  • Hạng animal × vehicle hấp thụ độ khó riêng khác nhau của từng trong số 48 tổ hợp
  • Các hạng tương tác theo phòng thí nghiệm đo mức tăng riêng theo benchmark so với phòng thí nghiệm trung bình cùng với khoảng tin cậy

Không tìm thấy hiệu ứng có ý nghĩa trong phân tích hồi quy

  • Hiệu ứng pelican theo từng phòng thí nghiệm nằm trong khoảng từ -0,11 đến +0,14 điểm và đều không có ý nghĩa thống kê
    • Ngay cả p-value nhỏ nhất cũng là 0,25
  • Hiệu ứng bicycle theo từng phòng thí nghiệm trải từ -0,18 điểm của Grok 4.5 (p=0,11) đến +0,27 điểm của Gemini 3.5 Flash (p=0,022)
    • 7 hiệu ứng này chia cả hai hướng dương và âm
    • Chỉ Gemini 3.5 Flash đạt ngưỡng p<0,05
  • Sau khi loại hiệu ứng pelican và bicycle riêng của từng phòng thí nghiệm, mức tăng thêm ở đúng tổ hợp pelican-bicycle cũng không có trường hợp nào đạt p<0,05
    • Hiệu ứng dương lớn nhất là +0,35 điểm của GLM-5.2, nhưng p=0,12
    • Đây là kết quả gần tín hiệu nhất trong thí nghiệm nhưng vẫn nằm trong phạm vi ngẫu nhiên
  • Mọi khoảng tin cậy của hiệu ứng pelican và hiệu ứng ô pelican-bicycle đều chứa 0
  • Nếu thực hiện 21 phép kiểm định với p<0,05 thì chỉ do ngẫu nhiên cũng đã kỳ vọng khoảng 1 dương tính giả
    • 21 × 0.05 ≈ 1.05, và kết quả có ý nghĩa thực tế cũng chỉ có một, là hiệu ứng bicycle của Gemini
    • Ngưỡng Bonferroni là 0.05/21 ≈ 0.002, nên p=0,022 của Gemini không vượt qua được
  • Độ rộng khoảng tin cậy trung bình khoảng ±0,6 điểm, nên các hiệu ứng tăng nhỏ hơn mức này khó được thí nghiệm phát hiện

Bố cục ảnh hướng sang phải

  • Cả 21 ảnh pelican-bicycle do 7 phòng thí nghiệm tạo ra đều hướng sang phải
    • Đây là tổ hợp duy nhất trong 48 tổ hợp mà mọi ảnh đều cùng một hướng
  • Tuy vậy, 60% trong tổng 1.008 ảnh cũng hướng sang phải, nên bản thân hướng phải đã là xu hướng phổ biến
  • Tỷ lệ hướng phải theo phương tiện là scooter 83%, bicycle 81%, skateboard 60%, plane 58%, unicycle 45%, boat 35%
  • Tỷ lệ hướng phải theo động vật là antelope và pelican cùng 78%, heron 77%, whale 65%, flamingo 64%, otter 45%, cat 40%, raccoon 36%
  • Vì pelican hay bicycle đều khó vẽ ở góc chính diện, mô hình thường chọn bố cục nhìn ngang trái-phải, nên ảnh có hướng mơ hồ cũng ít hơn
  • Các tổ hợp khác cũng cho tỷ lệ trùng hướng cao
    • antelope-scooter và pelican-scooter có 20/21 ảnh cùng hướng
    • heron-bicycle có 19/21 ảnh cùng hướng
  • Chỉ riêng việc một trong 48 tổ hợp có 21 ảnh đều cùng hướng là chưa đủ để xem như ngoại lệ đặc biệt

Tìm dấu vết ghi nhớ trong các yếu tố cảnh

  • Gemini 3.1 Flash-Lite trích xuất tự do các yếu tố cảnh tìm thấy trong ảnh để kiểm tra xem có bố cục được ghi nhớ nào lặp lại hay không
  • Ở một số tổ hợp, vài yếu tố cụ thể lặp lại khá thường xuyên
    • Trong ảnh flamingo-boat, lúc nào cũng có mặt trời
    • 38% ảnh otter-plane có khăn quàng
    • 38% ảnh cat-bicycle có giỏ xe
  • Pelican-bicycle cũng có vài yếu tố xuất hiện với tần suất cao, nhưng không tìm thấy mẫu lặp đặc biệt nào khác biệt so với các tổ hợp động vật-phương tiện khác

Một mô hình chấm điểm duy nhất và ngân sách hạn chế

  • Mọi điểm số đều do một mô hình chấm duy nhất là GPT-5.6 Luna xem từng ảnh rồi cho điểm
    • Tiêu chí chấm chưa được căn chỉnh đầy đủ, và cũng không kiểm tra tính nhất quán khi chấm lại
    • Nếu mô hình chấm không đánh giá tranh vẽ một cách đáng tin cậy thì giá trị của kết quả định lượng sẽ giảm đi
  • Cũng có hạn chế là mô hình chấm và mô hình tham gia GPT-5.6 Terra thuộc cùng một họ sản phẩm
    • Tuy nhiên, vì mỗi phòng thí nghiệm đều tạo đủ 48 tổ hợp, nên dù mô hình chấm có thiên vị phong cách của một phòng thí nghiệm nào đó thì điểm của cả lưới ảnh bên đó cũng sẽ cùng tăng
    • Phân tích so sánh khác biệt giữa các tổ hợp bên trong từng phòng thí nghiệm, nên kiểu thiên vị này không làm thay đổi kết luận chính
  • Không thể phát hiện SVGmaxxing, tức tối ưu cho toàn bộ năng lực tạo SVG hoặc cho một nhóm như “động vật cưỡi phương tiện”, thay vì cho một prompt cụ thể
    • Khi đó hiệu năng của mọi ô đều cùng tăng, nên khó phân biệt với một mô hình vốn đã giỏi tạo SVG
    • Google/DeepMind đã công khai thực hiện kiểu tối ưu này
  • Tổng chi phí thí nghiệm chỉ khoảng 80 USD credit API
    • Mỗi ô chỉ có 3 mẫu, 1 mô hình chấm và 7 mô hình tham gia
    • Prompt và pipeline chưa được lặp lại, tinh chỉnh đủ nhiều nên các vấn đề như “plane” và “airplane” vẫn còn

Không có bằng chứng cho tối ưu hóa theo một prompt cụ thể

  • Pelican không được vẽ tốt hơn các động vật khác, bicycle cũng không vượt trội hơn các phương tiện khác, và không phòng thí nghiệm nào vẽ tổ hợp đó tốt hơn mức dự kiến từ hiệu năng riêng của pelican và bicycle một cách có ý nghĩa
  • GLM-5.2 ghi nhận mức tăng lớn nhất ở một ô pelican-bicycle cụ thể, nhưng hiệu ứng nhỏ và không có ý nghĩa thống kê
  • Việc cả 21 ảnh đều hướng sang phải là điều đáng chú ý, nhưng bố cục hướng phải nhìn chung rất phổ biến và ba tổ hợp khác cũng đạt tỷ lệ trùng hướng trên 90%
  • So với pelicanmaxxing chỉ nhắm vào một benchmark cụ thể, SVGmaxxing để tăng cường năng lực tạo SVG nói chung có vẻ khả dĩ hơn, nhưng thí nghiệm này không thể xác định phòng thí nghiệm nào đang làm vậy

1 bình luận

 
Ý kiến trên Hacker News
  • Tôi cũng đã tranh thủ kiểm tra thêm các tổ hợp động vật và phương tiện khác, và từng mơ tìm ra bằng chứng cho thấy một phòng thí nghiệm AI nào đó đặc biệt giỏi vẽ bồ nông đi xe đạp
    Phương pháp Dylan dùng để tạo 1.008 SVG từ 8×6 tổ hợp chắc chắn hơn tôi nghĩ rất nhiều. Nhưng tôi vẫn không tìm thấy trường hợp nào mà bồ nông đi xe đạp được tạo ra tốt hơn hẳn các tổ hợp khác ở bất kỳ mô hình nào

    • Có thể họ không tối ưu riêng cho bồ nông mà là tối ưu cho SVG nói chung. Việc tạo SVG phức tạp ban đầu là một benchmark tốt vì có thể kiểm tra năng lực lập trình tổng quát và hiểu biết không gian, nhưng nếu nhắm trực tiếp vào riêng bài toán này thì cũng không quá khó
    • Điều tương tự cũng từng xảy ra với TPC, đơn vị tạo benchmark SQL. Nếu hiệu năng TPC kém thì không đủ tư cách cạnh tranh, còn nếu tốt thì mới có vé tham gia các bài so sánh xử lý tác vụ thực tế của khách hàng
      Trong một thị trường đông đúc, vượt benchmark là phí vào cửa, nhưng tối ưu kiểu hẹp như hardcode một cảnh cụ thể mà không cải thiện các bài toán lân cận thì rất có vấn đề. Nó làm tôi nhớ đến benchmark “Quack3” cho card ATI trong lĩnh vực GPU
    • Bài kiểm tra cơ bản hơn là đánh giá khả năng tạo hình SVG nói chung. Có thể xây dựng một pipeline gắn mô tả cho ảnh ngẫu nhiên, yêu cầu LLM tạo SVG, rồi raster hóa để so sánh bằng độ tương đồng thị giác mang tính quyết định, hoặc để một LLM khác chấm mức độ giống với ảnh gốc
    • Cũng nên thử đổi sang loài mới. Những loài cùng bộ Bồ nông như cò mỏ thìa hay diệc cũng có thể là ứng viên
  • Việc bồ nông đi xe đạp quay sang phải là điều tự nhiên. Bộ truyền động của xe đạp nằm bên phải, nên để hiển thị nó mà không bị khung xe che khuất thì người ta sẽ vẽ mặt bên phải, và rất có thể dữ liệu huấn luyện cũng phản ánh bố cục này
    Căn cứ: https://www.rei.com/c/bikes
    Nhìn kỹ thì tất cả xe đạp đều quay sang phải bất kể động vật quay hướng nào, và trừ cá voi ra thì cả hai chân của người cưỡi đều nằm ở phía phải của xe. Điều này cho thấy sự thiếu hiểu biết thực chất rất lớn về cách xe đạp hoạt động

  • Mỗi lần Simon Willison đăng SVG lên thì lại có phản ứng kiểu “giờ chắc chắn là họ đã học thuộc rồi” và bỏ qua việc đánh giá, nhưng cũng đã có bài viết giải thích một cách logic việc kiểu học đó dễ bị phát hiện đến mức nào. Tôi rất vui khi thấy có người phân tích định lượng kết quả những con vật nhỏ đi xe đạp
    https://simonwillison.net/2025/Nov/13/training-for-pelicans-...

    • Cũng có một khả năng nhẹ nhàng hơn. Trước đây gần như không có tranh minh họa bồ nông đi xe đạp, nhưng giờ đã có các tác phẩm do họa sĩ giỏi trực tiếp vẽ, và khi các phòng thí nghiệm thu thập chúng như các tài liệu web khác thì hiệu năng có thể được cải thiện
      Kết quả lần này cho thấy ngay cả sự cải thiện đó cũng chưa xảy ra. Thậm chí còn có khả năng họ đã học từ các kết quả tệ trên mạng và hiệu năng bị suy giảm
    • Chỉ với kết quả khái quát hóa từ một số ít tổ hợp động vật và phương tiện thì khó có thể coi đó là bằng chứng mạnh cho việc dữ liệu đó chưa được học trực tiếp hoặc trên diện rộng
  • Nếu lời giải thích hợp lý hơn là tối ưu hóa SVG, thì cũng cần xem ở đây “tối ưu hóa” nghĩa là gì. Khả năng tự vẽ SVG tốt hơn bản thân nó là một kỹ năng hữu ích

    • Việc phòng thí nghiệm AI tối đa hóa năng lực kỹ thuật không phải điều gì khủng khiếp. Benchmark gần như là công cụ duy nhất hiện nay để so sánh định lượng các mô hình, nên nếu không hài lòng với tối ưu hóa benchmark thì tốt hơn là góp phần tạo ra benchmark tốt hơn
  • Tôi đã thêm một biến thể vào thí nghiệm tương tự. Tôi kiểm tra xem khi không chỉ định loài chim hay phương tiện cụ thể, liệu mô hình có tự chọn bồ nông đi xe đạp hay không
    Kết quả: https://www.modelbias.ai/pelican-on-a-bicycle-test

    • Dù là hình đơn giản, vẫn có kết quả chim cánh cụt đi ván trượt rất đẹp về mặt thẩm mỹ, và chúng xuất hiện ngay cả ở các mô hình yếu. Dòng Opus có vẻ còn cho kết quả tệ đi theo thời gian
    • Vì không cần đánh giá chủ quan và cũng ít bị ảnh hưởng bởi độ phức tạp của động vật và phương tiện, nên nó thuyết phục và vững chắc hơn phân tích trong bài gốc
  • Dữ liệu gốc được công khai trên GitHub: https://github.com/dylanjcastillo/blog/tree/main/_extras/pel...

  • Việc bắt LLM tạo SVG rất khó và thiếu tự nhiên, giống như bắt một họa sĩ người thật vẽ tranh bằng cách đọc cho họ danh sách tọa độ. Các mô hình tạo ảnh ngày nay có thể dễ dàng tạo ra xe đạp có cấu trúc hoàn chỉnh và bồ nông chân thực, nhưng kết quả chỉ là ảnh raster
    Hiện vẫn thiếu bước phân rã và tái tạo hình ảnh thành đường dẫn SVG hoặc lệnh nét cọ, và để làm tốt điều đó cần có sự hiểu biết thật sự về cấu trúc cảnh, điều mà AI vẫn còn yếu

    • Một họa sĩ xuất sắc có thể hình dung quá trình vẽ trong đầu, và điều này có thể không khác mấy với cách LLM cấu thành SVG ở bên trong. Gần đây Anthropic gọi không gian nội bộ này là workspace, và có lẽ nó chỉ xa lạ với những người không quen SVG
    • Bài kiểm tra này đánh giá chính việc tạo SVG, chứ không phải raster
    • Các mô hình ảnh hỗ trợ đầu ra văn bản như Image2 hoặc mô hình văn bản tổng quát có thể đọc ảnh như Claude đều có thể vector hóa ảnh raster. Nhưng chất lượng hiện vẫn thấp, nên kết quả làm thủ công bằng Inkscape của người không chuyên còn tốt hơn
  • Một khi cách chấm điểm đầu ra LLM đã được biết đến, những người nắm quyền quyết định tài trợ và các phòng thí nghiệm sẽ bắt đầu quan tâm đến chỉ số đó và hiệu chỉnh theo nó. Trong kịch bản tốt nhất, họ sẽ cải thiện năng lực SVG nói chung đồng thời tối ưu cả việc tạo bồ nông, nhưng một khi nó đã trở thành thước đo ai cũng biết thì sẽ khó còn dùng làm đánh giá độc lập đáng tin cậy