- Là mô hình tạo ảnh nền tảng thế hệ thứ 3 của dòng Qwen-Image, lấy “Real(实)” làm mục tiêu cốt lõi để vượt ra ngoài hình ảnh đẹp mắt và có thể dùng trong các công việc năng suất
- Xử lý đầu vào tối đa 4,5k token, tạo trong một lần các bố cục giàu thông tin như báo, storyboard, đề thi, cũng như hình ảnh có nhiều khái niệm song song và chồng lớp
- Kết xuất được chữ cỡ 10px, công thức LaTeX và chú thích viết tay sao cho có thể đọc được, đồng thời tái hiện các kết cấu vi mô như lỗ chân lông, tóc, da và nét cọ
- Hỗ trợ 12 ngôn ngữ, nhiều phông chữ, hơn 100 phong cách nghệ thuật, UI web/game/livestreaming, và cũng có thể tìm kiếm thông tin mới nhất trên Internet để phản ánh vào hình ảnh
- Là mô hình nhằm mở rộng tạo ảnh thành công cụ năng suất có thể triển khai trong thiết kế, sản xuất nội dung, giáo dục và thương mại điện tử, bao gồm PDF báo, storyboard phim ngắn và UI phức tạp
Mô hình thế hệ thứ 3 hướng tới “Real”
- Qwen-Image-3.0 là mô hình tạo ảnh nền tảng thế hệ thứ 3 của dòng Qwen-Image
- Hướng trọng tâm theo từng thế hệ như sau
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- “Real” gồm ba năng lực
- Nội dung phong phú: hỗ trợ đầu vào tối đa 4,5k token và bố cục phức tạp
- Chi tiết chân thực: tái hiện chữ 10px và các yếu tố vi mô như lỗ chân lông, tóc
- Tri thức sâu rộng: tạo ảnh dựa trên 12 ngôn ngữ, nhiều UI khác nhau và tri thức thế giới
- Mục tiêu là phát triển tạo ảnh từ “có thể dùng” thành “thực dụng”, từ “đẹp mắt” thành hữu ích
Nội dung phong phú và bố cục phức tạp
- Trong slide toán học, có thể kết xuất đồng thời quan hệ không gian, ký hiệu toán học, phần giải thích định lý và vị trí tương đối của từng yếu tố
- Với chỉ thị khoảng 3,7k token, tạo một lưới 3×3 trong một lần duy nhất mà không cần ghép nhiều ảnh lại với nhau
- Mỗi ô là một infographic phức tạp kết hợp câu tiếng Trung/tiếng Anh, công thức, biểu đồ và nhân vật truyện tranh
- Bố trí trong một hình duy nhất các nội dung gồm truyện tranh an toàn đường hầm, bài học hình học không gian, phân tích văn phong “Chu Shi Biao”, chuyển động parabol, ký sinh trùng học, sơ đồ y khoa về đau ngực phải, định lý Sylow, kiểm soát nội bộ ngân hàng và so sánh cấu trúc DNA tế bào
- Nhận chỉ thị tối đa 4,5k token để hiểu và kết xuất các bố cục thị giác có mật độ thông tin cao
-
Mở rộng theo chiều ngang
- Chỉ năng lực bố trí nhiều yếu tố song song trên một canvas duy nhất
- Sử dụng đặt cạnh nhau về ngữ nghĩa và điều khiển không gian để sắp xếp nhiều khái niệm sao cho không gây nhiễu lẫn nhau
-
Chiều sâu theo chiều dọc
- Là năng lực phân rã ý nghĩa và thể hiện từng bước các giao diện chồng lớp có logic
- Với một chỉ thị duy nhất, tạo cấu trúc đa màn hình gồm màn hình lập trình VSCode, Qwen Chat, WeChat và poster cà phê hand-drip chồng lên nhau
- Mỗi lớp duy trì phong cách và các chi tiết của UI tương ứng
Từ chữ nhỏ đến phục dựng tranh
-
Chữ nhỏ và dàn trang phức tạp
- Kết xuất được cả chữ nhỏ cỡ 10px sao cho có thể đọc được
- Có thể tạo đồng thời các vùng có nhiều chữ và minh họa, như infographic kiến thức về cá nhám voi
- Trên một trang bài báo về hình học đại số, tái hiện công thức LaTeX, chỉ số trên/dưới, chữ Hy Lạp, số định lý, dấu ngoặc nhọn, gạch phân số và căn chỉnh nhiều dòng
- Duy trì khả năng đọc của công thức và nội dung chính ngay cả với phông chữ nhỏ
- Kết hợp chất giấy chân thực với văn bản dày đặc để tạo hình ảnh dạng báo
-
Chỉnh sửa và chữ viết tay
- Có thể thêm chú thích viết tay màu đỏ lên trang sách
- Bao gồm gạch chân, đường lượn sóng, vòng tròn, mũi tên và ghi chú ngắn
- Thể hiện phong cách chữ viết tay tự nhiên như ghi chép trên lớp của học sinh trung học
-
Biểu đạt và phục dựng kết cấu
- Trong ảnh chân dung, mô tả các yếu tố vi mô như lỗ chân lông, tóc, kết cấu da, đồng thời cũng có thể thể hiện kết cấu tinh xảo của các vật thể khác
- Phục dựng tranh truyền thống bị hư hại hoặc mất một phần theo đúng phong cách vẽ và nét cọ ban đầu
- Với bức tranh chiến đấu của đại bàng, loại bỏ vết mốc và dấu hư hại, hoàn thiện phần bị thiếu trong khi vẫn giữ đậm nhạt của mực, kết cấu lông vũ và cân bằng bố cục
Khai thác ngôn ngữ, UI và tri thức thế giới
- Hỗ trợ 12 ngôn ngữ, nhiều phông chữ, hơn 100 phong cách nghệ thuật và nhiều giao diện UI khác nhau
- Bao gồm các ví dụ kết xuất chính xác tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha
- Có thể tạo nhiều loại màn hình UI chân thực như trang web, game và livestreaming
-
Infographic dựa trên tri thức
- Giữ lại chủ thể chính trong ảnh côn trùng thực tế, đồng thời mở rộng thành infographic dùng cho nghiên cứu
- Bao gồm thông tin phân loại học, chú thích đặc điểm hình thái, khung phóng to chi tiết và thước tỷ lệ
- Cấu trúc kết quả dưới dạng sơ đồ nghiên cứu có thể dùng ngay cho xuất bản học thuật
-
Sử dụng thông tin mới nhất và IP
- Không chỉ dựa trên tri thức mà mô hình có sẵn, mà còn có thể kết nối Internet để tìm kiếm thông tin mới nhất
- Tìm kiếm thời tiết Hàng Châu ngày 21 tháng 7 để tạo hình ảnh dự báo thời tiết
- Có thể tìm một nhân vật IP cụ thể và tạo ảnh dựa trên đó
- Tạo cảnh Qi Baishi và Van Gogh giới thiệu Qwen-Image-3.0 trong phòng livestreaming
Mở rộng sang công việc năng suất
- Dựa trên ba năng lực cốt lõi, hỗ trợ các tác vụ giá trị cao như PDF báo, storyboard phim ngắn và giao diện UI phức tạp
- Mục tiêu là kết nối năng lực tạo ảnh với giá trị năng suất trong nhiều lĩnh vực hơn như thiết kế, sản xuất nội dung, giáo dục và thương mại điện tử
1 bình luận
Ý kiến Hacker News
Cảm giác khá kỳ khi ép dùng những mô hình kiểu này cho mua sắm online. Chúng chỉnh cho quần áo trông vừa người và cả ánh sáng cũng đẹp mắt hơn, nên cảm giác mặc và độ vừa vặn thực tế của món đồ vẫn khó biết như trước đây
Trong 50 năm nữa, ngay cả “tính trung thực của quảng cáo” cũng có thể bị xem như một quá khứ lý tưởng không thể lấy lại
Nhưng với một nền tảng mỗi tháng có thêm 1.000 sản phẩm mới, ảnh thật không hoàn hảo có lẽ lại tốt hơn cho chuyển đổi mua hàng. Đặc biệt, các hình ảnh kiểu 3D khiến mọi biến thể màu sắc trông giống hệt nhau còn gây phản cảm hơn
Khá thú vị là trong meta keywords của HTML có hơn 100 mục liên quan đến nội dung người lớn như hentai, nudes
Chạy
document.querySelector('meta[name="keywords"]').contenttrong console sẽ thấy toàn bộ thẻqwen, đồng thời cả những lỗi gõ nhưgwenhaybentrong ngữ cảnh người lớnkeywordscòn có giá trị gì, và nó chỉ đang thêm vào trang hơn 77KB dữ liệu vô dụngCó vẻ được huấn luyện từ đầu ra của GPT Image 1, và tông vàng đặc trưng rất rõ
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
Tiếng Ả Rập trong ảnh đại diện rõ ràng bị lỗi, nhưng khi dùng mô hình thực tế thì không như vậy. Có thể ảnh đại diện không được tạo bằng Qwen Image 3.0
Họ nói cần 3.700 token để mô tả chính xác toàn bộ lưới 3×3, nhưng không công bố prompt nên phần trình diễn kém thuyết phục
Hoàn toàn không thấy nói gì về thời điểm và việc có công bố trọng số hay không, không biết có chỗ nào khác viết về chuyện này không
Tôi đã cung cấp 2 logo thật, một bộ đặc tả ngôn ngữ thiết kế hoàn chỉnh và 3 ảnh chụp màn hình ứng dụng, nhưng kết quả chỉ ra 3 hình kinh khủng, và không cái nào giống logo gốc đã đưa vào
Thử trên chat.qwen.ai thì cả bố cục lẫn độ chính xác giải phẫu đều còn chưa đạt mức Qwen Image 1. Kết quả có chân ba cái hoặc mắt phát sáng, chất lượng ngang Microsoft Lens đã bị rút lại
Tôi ước hồi đại học đã có những mô hình thế này. Là người học thiên về trực quan, tôi hẳn đã hiểu một số chủ đề dễ hơn nhiều qua sơ đồ và hình minh họa giải thích thay vì những đoạn văn dài
Tôi đã yêu cầu Nano Banana 2 tạo “poster infographic cho sinh viên đại học giải thích cách nguyên tử hoạt động”, và nó tạo ra mô hình Bohr như trong sách khoa học cấp hai
Vẫn còn bộ lọc vàng ố ở khắp các hình ảnh