2 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Là mô hình tạo ảnh nền tảng thế hệ thứ 3 của dòng Qwen-Image, lấy “Real(实)” làm mục tiêu cốt lõi để vượt ra ngoài hình ảnh đẹp mắt và có thể dùng trong các công việc năng suất
  • Xử lý đầu vào tối đa 4,5k token, tạo trong một lần các bố cục giàu thông tin như báo, storyboard, đề thi, cũng như hình ảnh có nhiều khái niệm song song và chồng lớp
  • Kết xuất được chữ cỡ 10px, công thức LaTeX và chú thích viết tay sao cho có thể đọc được, đồng thời tái hiện các kết cấu vi mô như lỗ chân lông, tóc, da và nét cọ
  • Hỗ trợ 12 ngôn ngữ, nhiều phông chữ, hơn 100 phong cách nghệ thuật, UI web/game/livestreaming, và cũng có thể tìm kiếm thông tin mới nhất trên Internet để phản ánh vào hình ảnh
  • Là mô hình nhằm mở rộng tạo ảnh thành công cụ năng suất có thể triển khai trong thiết kế, sản xuất nội dung, giáo dục và thương mại điện tử, bao gồm PDF báo, storyboard phim ngắn và UI phức tạp

Mô hình thế hệ thứ 3 hướng tới “Real”

  • Qwen-Image-3.0mô hình tạo ảnh nền tảng thế hệ thứ 3 của dòng Qwen-Image
  • Hướng trọng tâm theo từng thế hệ như sau
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • “Real” gồm ba năng lực
    • Nội dung phong phú: hỗ trợ đầu vào tối đa 4,5k token và bố cục phức tạp
    • Chi tiết chân thực: tái hiện chữ 10px và các yếu tố vi mô như lỗ chân lông, tóc
    • Tri thức sâu rộng: tạo ảnh dựa trên 12 ngôn ngữ, nhiều UI khác nhau và tri thức thế giới
  • Mục tiêu là phát triển tạo ảnh từ “có thể dùng” thành “thực dụng”, từ “đẹp mắt” thành hữu ích

Nội dung phong phú và bố cục phức tạp

  • Trong slide toán học, có thể kết xuất đồng thời quan hệ không gian, ký hiệu toán học, phần giải thích định lý và vị trí tương đối của từng yếu tố
  • Với chỉ thị khoảng 3,7k token, tạo một lưới 3×3 trong một lần duy nhất mà không cần ghép nhiều ảnh lại với nhau
    • Mỗi ô là một infographic phức tạp kết hợp câu tiếng Trung/tiếng Anh, công thức, biểu đồ và nhân vật truyện tranh
    • Bố trí trong một hình duy nhất các nội dung gồm truyện tranh an toàn đường hầm, bài học hình học không gian, phân tích văn phong “Chu Shi Biao”, chuyển động parabol, ký sinh trùng học, sơ đồ y khoa về đau ngực phải, định lý Sylow, kiểm soát nội bộ ngân hàng và so sánh cấu trúc DNA tế bào
  • Nhận chỉ thị tối đa 4,5k token để hiểu và kết xuất các bố cục thị giác có mật độ thông tin cao
  • Mở rộng theo chiều ngang

    • Chỉ năng lực bố trí nhiều yếu tố song song trên một canvas duy nhất
    • Sử dụng đặt cạnh nhau về ngữ nghĩa và điều khiển không gian để sắp xếp nhiều khái niệm sao cho không gây nhiễu lẫn nhau
  • Chiều sâu theo chiều dọc

    • Là năng lực phân rã ý nghĩa và thể hiện từng bước các giao diện chồng lớp có logic
    • Với một chỉ thị duy nhất, tạo cấu trúc đa màn hình gồm màn hình lập trình VSCode, Qwen Chat, WeChat và poster cà phê hand-drip chồng lên nhau
    • Mỗi lớp duy trì phong cách và các chi tiết của UI tương ứng

Từ chữ nhỏ đến phục dựng tranh

  • Chữ nhỏ và dàn trang phức tạp

    • Kết xuất được cả chữ nhỏ cỡ 10px sao cho có thể đọc được
    • Có thể tạo đồng thời các vùng có nhiều chữ và minh họa, như infographic kiến thức về cá nhám voi
    • Trên một trang bài báo về hình học đại số, tái hiện công thức LaTeX, chỉ số trên/dưới, chữ Hy Lạp, số định lý, dấu ngoặc nhọn, gạch phân số và căn chỉnh nhiều dòng
    • Duy trì khả năng đọc của công thức và nội dung chính ngay cả với phông chữ nhỏ
    • Kết hợp chất giấy chân thực với văn bản dày đặc để tạo hình ảnh dạng báo
  • Chỉnh sửa và chữ viết tay

    • Có thể thêm chú thích viết tay màu đỏ lên trang sách
    • Bao gồm gạch chân, đường lượn sóng, vòng tròn, mũi tên và ghi chú ngắn
    • Thể hiện phong cách chữ viết tay tự nhiên như ghi chép trên lớp của học sinh trung học
  • Biểu đạt và phục dựng kết cấu

    • Trong ảnh chân dung, mô tả các yếu tố vi mô như lỗ chân lông, tóc, kết cấu da, đồng thời cũng có thể thể hiện kết cấu tinh xảo của các vật thể khác
    • Phục dựng tranh truyền thống bị hư hại hoặc mất một phần theo đúng phong cách vẽ và nét cọ ban đầu
    • Với bức tranh chiến đấu của đại bàng, loại bỏ vết mốc và dấu hư hại, hoàn thiện phần bị thiếu trong khi vẫn giữ đậm nhạt của mực, kết cấu lông vũ và cân bằng bố cục

Khai thác ngôn ngữ, UI và tri thức thế giới

  • Hỗ trợ 12 ngôn ngữ, nhiều phông chữ, hơn 100 phong cách nghệ thuật và nhiều giao diện UI khác nhau
  • Bao gồm các ví dụ kết xuất chính xác tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha
  • Có thể tạo nhiều loại màn hình UI chân thực như trang web, game và livestreaming
  • Infographic dựa trên tri thức

    • Giữ lại chủ thể chính trong ảnh côn trùng thực tế, đồng thời mở rộng thành infographic dùng cho nghiên cứu
    • Bao gồm thông tin phân loại học, chú thích đặc điểm hình thái, khung phóng to chi tiết và thước tỷ lệ
    • Cấu trúc kết quả dưới dạng sơ đồ nghiên cứu có thể dùng ngay cho xuất bản học thuật
  • Sử dụng thông tin mới nhất và IP

    • Không chỉ dựa trên tri thức mà mô hình có sẵn, mà còn có thể kết nối Internet để tìm kiếm thông tin mới nhất
    • Tìm kiếm thời tiết Hàng Châu ngày 21 tháng 7 để tạo hình ảnh dự báo thời tiết
    • Có thể tìm một nhân vật IP cụ thể và tạo ảnh dựa trên đó
    • Tạo cảnh Qi Baishi và Van Gogh giới thiệu Qwen-Image-3.0 trong phòng livestreaming

Mở rộng sang công việc năng suất

  • Dựa trên ba năng lực cốt lõi, hỗ trợ các tác vụ giá trị cao như PDF báo, storyboard phim ngắn và giao diện UI phức tạp
  • Mục tiêu là kết nối năng lực tạo ảnh với giá trị năng suất trong nhiều lĩnh vực hơn như thiết kế, sản xuất nội dung, giáo dục và thương mại điện tử

1 bình luận

 
Ý kiến Hacker News
  • Cảm giác khá kỳ khi ép dùng những mô hình kiểu này cho mua sắm online. Chúng chỉnh cho quần áo trông vừa người và cả ánh sáng cũng đẹp mắt hơn, nên cảm giác mặc và độ vừa vặn thực tế của món đồ vẫn khó biết như trước đây

    • Mục tiêu ngắn hạn là bán được hàng, nhưng mục tiêu dài hạn tham vọng hơn là làm mờ ranh giới giữa quảng cáo và thực tế để đến lúc mua hàng, người bình thường thậm chí không còn đặt ra nghi vấn đó nữa
      Trong 50 năm nữa, ngay cả “tính trung thực của quảng cáo” cũng có thể bị xem như một quá khứ lý tưởng không thể lấy lại
    • Thứ một số người muốn có thể không phải là AI tạo sinh tự thân mà là kiểu chuyển đổi ảnh sang ảnh như “hãy biến nó thành như được chụp bởi một nhiếp ảnh gia giỏi”
      Nhưng với một nền tảng mỗi tháng có thêm 1.000 sản phẩm mới, ảnh thật không hoàn hảo có lẽ lại tốt hơn cho chuyển đổi mua hàng. Đặc biệt, các hình ảnh kiểu 3D khiến mọi biến thể màu sắc trông giống hệt nhau còn gây phản cảm hơn
    • Quảng cáo đồ nội thất cũ trên Facebook Marketplace cũng tương tự. Phần lớn ảnh đều được AI tút lại như catalog của Pottery Barn, rồi đến cuối mới cho thấy ảnh món đồ thật đầy vết xước và hư hỏng đang nằm trong một garage bừa bộn
    • Tôi nghi ngờ liệu cách này có thật sự ít bóp méo hơn kiểu truyền thống là cho người mẫu mặc áo sơ mi rồi chụp dưới ánh sáng hoàn hảo bởi nhiếp ảnh gia chuyên nghiệp hay không
  • Khá thú vị là trong meta keywords của HTML có hơn 100 mục liên quan đến nội dung người lớn như hentai, nudes

    • Có vẻ các từ khóa này được áp dụng toàn cục cả cho những trang như https://qwen.ai/usagepolicy vốn yêu cầu không dùng sản phẩm cho nội dung tình dục
      Chạy document.querySelector('meta[name="keywords"]').content trong console sẽ thấy toàn bộ thẻ
    • Có vẻ một số công cụ tối ưu hóa công cụ tìm kiếm đã tự động thêm meta keywords. Có thể chúng thu thập các truy vấn phổ biến chứa qwen, đồng thời cả những lỗi gõ như gwen hay ben trong ngữ cảnh người lớn
    • Tôi không rõ hiện nay thẻ meta keywords còn có giá trị gì, và nó chỉ đang thêm vào trang hơn 77KB dữ liệu vô dụng
    • Đội Qwen hẳn cũng biết cộng đồng nội dung người lớn tiếp nhận rất nhanh các mô hình tạo ảnh mới, như thấy trên Civitai. Có vẻ đây là một chiến lược SEO nhằm đưa mô hình vào các kết quả tìm kiếm mà nhóm này vốn đã xem
  • Có vẻ được huấn luyện từ đầu ra của GPT Image 1, và tông vàng đặc trưng rất rõ
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1 cũng có tông vàng dù không được huấn luyện từ đầu ra của các mô hình tạo ảnh khác. Vì mọi người thích ảnh có ánh hoàng hôn dịu và mô hình ưu tiên dễ nắm bắt điều đó, nên khi tối ưu hóa sức hút thẩm mỹ, mọi ảnh sẽ có một lớp ám màu nhẹ nếu không cố tình kìm lại
    • Tông vàng và đỏ là vấn đề rất phổ biến bất kể nguồn ảnh huấn luyện là gì. Ngay cả khi startup về ảnh huấn luyện trên ảnh gốc, hiện tượng ám màu vẫn xuất hiện và liên tục khó loại bỏ
    • Ảnh do AI tạo đã trở thành một phần của web, nên với web scraping thông thường thì không thể tránh ảnh tạo sinh trong dữ liệu huấn luyện
  • Tiếng Ả Rập trong ảnh đại diện rõ ràng bị lỗi, nhưng khi dùng mô hình thực tế thì không như vậy. Có thể ảnh đại diện không được tạo bằng Qwen Image 3.0

    • Đây là một tiêu chuẩn tốt để thử mô hình mới. Khi thử GPT Image 2 và Nano Banana Pro bằng câu kinh Quran tiếng Tamil và tiếng Ả Rập, chúng tạo ra đúng, có lẽ nhờ dữ liệu huấn luyện khổng lồ
  • Họ nói cần 3.700 token để mô tả chính xác toàn bộ lưới 3×3, nhưng không công bố prompt nên phần trình diễn kém thuyết phục

  • Hoàn toàn không thấy nói gì về thời điểm và việc có công bố trọng số hay không, không biết có chỗ nào khác viết về chuyện này không

    • Vì cả trọng số của Qwen-Image-2.0 cũng không được công bố, lần này có lẽ khả năng cũng thấp
    • Có vẻ từ sau Z-Image và Qwen-Image đầu tiên, họ đã chuyển hẳn sang mô hình đóng. Chỉ nhìn các ảnh được công bố thì Qwen-Image 3.0 có vẻ chỉ là một lựa chọn kém hơn các mô hình độc quyền như gpt-image-2 hay nb-pro
    • Có công bố đi nữa thì Cursor, Azure và Amazon mới là bên kiếm tiền, nên chẳng có lý do gì để làm vậy. Trừ khi OpenAI thật sự mở ra, còn không thì khả năng rất mong manh
  • Tôi đã cung cấp 2 logo thật, một bộ đặc tả ngôn ngữ thiết kế hoàn chỉnh và 3 ảnh chụp màn hình ứng dụng, nhưng kết quả chỉ ra 3 hình kinh khủng, và không cái nào giống logo gốc đã đưa vào

  • Thử trên chat.qwen.ai thì cả bố cục lẫn độ chính xác giải phẫu đều còn chưa đạt mức Qwen Image 1. Kết quả có chân ba cái hoặc mắt phát sáng, chất lượng ngang Microsoft Lens đã bị rút lại

  • Tôi ước hồi đại học đã có những mô hình thế này. Là người học thiên về trực quan, tôi hẳn đã hiểu một số chủ đề dễ hơn nhiều qua sơ đồ và hình minh họa giải thích thay vì những đoạn văn dài

    • Nhưng sơ đồ được tạo ra chỉ là đồ mô phỏng. Dù yêu cầu một poster giải thích chính xác các thành phần của nguyên tử, nó vẫn cho ra hình các quả bóng bàn đỏ, xanh và xám quay quanh theo quỹ đạo tròn thay vì biểu đạt liên quan đến đám mây xác suất; may mắn lắm thì mới được sơ đồ lớp electron
      Tôi đã yêu cầu Nano Banana 2 tạo “poster infographic cho sinh viên đại học giải thích cách nguyên tử hoạt động”, và nó tạo ra mô hình Bohr như trong sách khoa học cấp hai
    • Vợ tôi đưa mọi công thức nấu ăn vào chức năng tạo ảnh của ChatGPT để biến chúng thành các trang kiểu tạp chí, và kết quả rất tuyệt. Cô ấy đang làm một sách nấu ăn gia đình để bọn trẻ biết những món chúng từng ăn khi còn nhỏ
  • Vẫn còn bộ lọc vàng ố ở khắp các hình ảnh