BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

DeepSeek phát hành mô hình hiểu thị giác, mang đến đôi mắt đến muộn cho những chú cá voi xanh lớn.

Đọc bài viết này mất 24 phút
Con đường phía trước đã không cho phép nó tiếp tục nhắm mắt bước đi nữa.
Tiêu đề gốc: "DeepSeek ra mắt mô hình hiểu thị giác, Đại Lam Kinh cuối cùng cũng có đôi mắt đến muộn"
Tác giả gốc: Động Sát Beating


Ngày 21 tháng 8 năm 2026, DeepSeek ra mắt mô hình hiểu thị giác hoàn toàn mới deepseek-v4-flash-vision-exp, API đa phương thức chính thức được mở. Các nhà phát triển lần đầu tiên có thể gửi trực tiếp hình ảnh vào giao diện chính thức của DeepSeek.


Mô hình giữ nguyên ngữ cảnh 100 triệu token và đầu ra tối đa 384.000 token của V4 Flash, hỗ trợ JSON Output, Tool Calls, Responses API, đồng thời tương thích với Anthropic API.


Giá cả cũng hoàn toàn áp dụng theo V4 Flash. Mỗi triệu token đầu vào, khi cache không trúng, giờ cao điểm 3 NDT, giờ thấp điểm 1,5 NDT; khi cache trúng lần lượt là 0,1 NDT và 0,05 NDT. Đầu ra giờ cao điểm 9 NDT, giờ thấp điểm 4,5 NDT. Tại Bắc Kinh, từ 9 giờ đến 12 giờ và 14 giờ đến 18 giờ hàng ngày là giờ cao điểm, 17 giờ còn lại được giảm giá một nửa.


Hình ảnh cũng được thanh toán theo token. Trước khi vào mô hình, mỗi hình ảnh sẽ được tự động thu phóng theo kích thước, hình nhỏ hơn khoảng 384×384 pixel sẽ được phóng to, hình lớn sẽ được nén xuống tổng pixel khoảng 800×800. Một hình ảnh tối đa chiếm 384 token. Một hình 2000×2000 và một hình 5000×5000 cuối cùng có thể tiêu tốn số token hoàn toàn giống nhau.


Theo giới hạn tối đa 384 token, chi phí đầu vào của một hình ảnh trong giờ cao điểm khi cache không trúng khoảng 0,001152 NDT. Xử lý một nghìn hình ảnh như vậy, chi phí đầu vào hình ảnh chỉ khoảng 1,152 NDT, văn bản và đầu ra mô hình tính riêng.


Đi kèm ra mắt còn có Files API. Các nhà phát triển có thể tải lên hình ảnh trước, sau đó đưa file_id vào yêu cầu. Cùng một hình ảnh chỉ cần truyền một lần, sau đó có thể tham chiếu lặp lại trong các yêu cầu khác nhau.


API này không thu phí. Mỗi tệp tối đa 64 MiB, mỗi người dùng có thể lưu tối đa 25 GiB, 10.000 tệp. Tệp có thể được đặt thời gian hết hạn từ 1 giờ đến 30 ngày, nếu không đặt thời hạn thì có thể lưu giữ vĩnh viễn. Hiện tại, phía chính thức cũng không cung cấp giao diện tải xuống nội dung tệp. Các nhà phát triển có thể tải lên, truy vấn và xóa, mô hình có thể đọc. Nó giống một kho lưu trữ hình ảnh miễn phí chuyên dụng cho suy luận hơn là một đám mây thông thường.


Tuy nhiên, điều kỳ lạ không phải là đến hôm nay DeepSeek mới có thể xem hình ảnh.


Hai dòng thời gian


Nếu chỉ nhìn vào nghiên cứu, khả năng thị giác của DeepSeek không hề muộn.


Nếu chỉ nhìn vào sản phẩm và API, thì nó lại thực sự muộn rất lâu.


Ngày 11 tháng 3 năm 2024, DeepSeek-VL được mã nguồn mở.


Nó có hai phiên bản 1.3B và 7B, có thể xem hình ảnh tự nhiên, trang web, công thức, biểu đồ và tài liệu. Đến tháng 10, Janus xuất hiện, đưa khả năng hiểu và tạo hình ảnh vào cùng một khung tự hồi quy. Ngày 13 tháng 11, JanusFlow tiếp nối. Tháng 12, DeepSeek-VL2 được phát hành, chuyển sang kiến trúc hỗn hợp chuyên gia, tổng tham số chia thành ba mức 3B, 16B và 27B.



Rạng sáng ngày 28 tháng 1 năm 2025, đêm giao thừa, Janus-Pro được mã nguồn mở. Kho lưu trữ chính thức ghi theo giờ UTC là ngày 27 tháng 1.


Phiên bản 7B đạt 0,80 trong GenEval, bài đánh giá tuân thủ chỉ dẫn tạo hình ảnh từ văn bản, vượt qua mức 0,67 của DALL-E 3 được liệt kê trong bài báo. Nó có trọng số mã nguồn mở, có thể triển khai cục bộ, và cũng có bản demo công khai.


DeepSeek không đưa nó vào API lưu trữ của mình.


Chỉ một tuần trước đó, R1 đã đưa DeepSeek vào ánh đèn sân khấu. Janus vẫn nằm trên GitHub và Hugging Face. Đối với đại đa số người dùng thông thường, nó nhanh chóng biến mất khỏi tầm mắt.


Ngày 20 tháng 10 năm 2025, DeepSeek-OCR được mã nguồn mở, dùng token thị giác để nén tài liệu dài. Ngày 27 tháng 1 năm 2026, OCR 2 được phát hành.


Tính từ DeepSeek-VL, trong hai năm có thể tra được ít nhất bảy bản ghi công khai: DeepSeek-VL, Janus, JanusFlow, VL2, Janus-Pro, OCR và OCR 2.


Nghiên cứu thị giác luôn được thực hiện và luôn được công bố.


Chỉ là các nhà phát triển thông thường vẫn không có lối vào đó.


Còn ở phía bên kia, đến tháng 3 năm 2024, giao diện nhà phát triển của vài đối thủ chính đều đã có thể nhận hình ảnh. OpenAI mở GPT-4 Turbo with Vision vào tháng 11 năm 2023, hình ảnh có thể trực tiếp vào Chat Completions API; một tháng sau, Google ra mắt Gemini Pro Vision API; tháng 3 năm 2024, toàn bộ dòng Claude 3 được thêm khả năng thị giác.


Ngày 25 tháng 4 năm 2025, Lý Ngạn Hoành tại hội nghị Create của Baidu phát biểu, "DeepSeek cũng không phải là vạn năng." Trong số các vấn đề ông liệt kê sau đó, có cả sự đơn điệu về phương thức.


Nhận định của ông là, đa phương thức sẽ trở thành tiêu chuẩn của các mô hình nền tảng, và thị trường của các mô hình thuần văn bản sẽ ngày càng thu hẹp.


Vào thời điểm đó, DeepSeek đã nghiên cứu thị giác được một năm.


Rạng sáng


Ngày 7 và 8 tháng 4 năm 2026, một số người dùng mở DeepSeek, giao diện bỗng xuất hiện thêm ba mục nhập.


"Nhanh" "Chuyên gia" "Thị giác".



Ngày 29 tháng 4, Trần Tiểu Khang, trưởng nhóm đa phương thức của DeepSeek, xác nhận tính năng nhận diện hình ảnh bắt đầu được triển khai thử nghiệm cho một số người dùng. Sau đó, một nhà nghiên cứu cấp cao của DeepSeek viết, "Chú cá voi nhỏ giờ đã có thể nhìn thấy." South China Morning Post đã trực tiếp đưa câu nói này vào tiêu đề.


Đôi mắt của DeepSeek lần đầu tiên thực sự lộ diện từ giao diện sản phẩm.


Ngày hôm sau, DeepSeek đăng tải bài nghiên cứu "Thinking with Visual Primitives" lên GitHub. Vài giờ sau, kho lưu trữ và bài nghiên cứu lại bị gỡ xuống. Đến ngày 1 tháng 5, địa chỉ gốc đã trả về lỗi 404. DeepSeek không giải thích, trên mạng chỉ còn lại bản sao của bài nghiên cứu và các bài báo truyền thông chuyển tải.


Bài nghiên cứu tập trung vào một vấn đề rất cụ thể.


Khi mô hình nhìn thấy một hình ảnh rất chật chội, nó thường biết mình đang nói gì, nhưng lại không nói rõ được mình đang nói về người nào, đường nào cụ thể. Nhóm nghiên cứu đã chèn trực tiếp tọa độ điểm và khung giới hạn vào quá trình suy luận, để mô hình vừa chỉ ra vị trí, vừa tiếp tục suy nghĩ.


Một hình ảnh 756×756 trước tiên đi qua bộ mã hóa thị giác, biến thành 2916 token khối ảnh, sau đó thông qua nén không gian 3×3 để tổng hợp thành 324 token. Sự chú ý thưa thớt của V4 Flash tiếp tục nén bộ nhớ đệm, cuối cùng chỉ để lại 81 mục KV thị giác.


Nhóm nghiên cứu cũng đã tạo ra hơn 40 triệu mẫu huấn luyện cho phương pháp này, bao gồm cả dữ liệu chuyên biệt để huấn luyện điều hướng mê cung và theo dõi đường đi.


Bài nghiên cứu này đã dành rất nhiều công sức để giải quyết, thực chất là vấn đề "chỉ vào đâu".


Mô hình trước tiên phải nhìn thấy, rồi mới biết mình đang nhìn vào đâu. Chỉ có như vậy, nó mới có thể tiếp tục suy luận.


DeepSeek lần này không nói rõ Vision Exp có hoàn toàn áp dụng bộ giải pháp Visual Primitives này hay không. Quan trọng hơn, nghiên cứu này lần đầu tiên phơi bày cách DeepSeek hiểu về "suy luận thị giác" ra bên ngoài.


Ngày 18 tháng 6, chế độ nhận diện hình ảnh trên web và ứng dụng chính thức ra mắt. Ngày hôm sau, có phương tiện truyền thông tải ảnh Lương Văn Phong lên để thử nghiệm, DeepSeek hai lần liên tiếp nhận nhầm ông thành Trương Nhất Minh. Đổi sang một cuộc trò chuyện khác, nó lại nhận Trương Nhất Minh thành Trần Thiên Thạch, người sáng lập Cambricon.


Nó đã có thể đọc ảnh chụp màn hình tiếng Anh, cũng có thể chuyển đổi trang web thành mã code.


Nhưng khi đối mặt với khuôn mặt người, nó thậm chí không nhận ra cả ông chủ của mình.


Ngày 19 tháng 8, DeepSeek Harness để lại một bản tài liệu kỹ thuật ghi rõ ngày tháng. Bộ chuyển đổi chính thức đã có thể tuần tự hóa hình ảnh thành image_url, tài liệu đồng thời ghi rõ rằng danh mục mô hình mặc định tạm thời sẽ không hiển thị deepseek-v4-flash-vision-exp, cần chờ điểm cuối API tương ứng khả dụng.


Ngày 20 tháng 8, có nhà phát triển thử nghiệm thực tế phát hiện rằng gửi ảnh đến tên mô hình chưa mở này chỉ nhận được lỗi 400.


Ngày 21 tháng 8, hạn chế này được gỡ bỏ. Harness thêm deepseek-v4-flash-vision-exp vào danh mục mô hình mặc định, bản hợp nhất tương ứng trực tiếp ghi "publish the vision model". Sau đó, tài liệu API chính thức của DeepSeek và tài khoản công khai đồng thời thông báo Vision Exp ra mắt.


Hai tuyến cuối cùng đã chạm vào nhau.


Agent


Trong bản ghi âm chuyển thành văn bản của một buổi gặp gỡ nhà đầu tư vào tháng 5 năm nay, Lương Văn Phong đã sắp xếp lộ trình AGI theo cách mình hiểu thành nhiều bậc thang: mô hình ngôn ngữ, chuỗi suy nghĩ, Agent, học liên tục, tự cải tiến, rồi đến trí tuệ nhúng.


Đa phương thức được ông đặt ở vị trí thành phần, gần giống với tìm kiếm.


Khi nói về tạo video, trong bản ghi có một câu:


Về mặt thương mại, đó là một công việc kinh doanh tốt. Nhưng điều này không liên quan gì đến trí tuệ.


Đánh giá của ông là, tạo video và mô hình thế giới ở giai đoạn hiện tại không có mối quan hệ quá lớn với giới hạn trí tuệ, điều cấp thiết trước mắt là huấn luyện AI, và việc học liên tục sau khi huấn luyện.


Điểm khác biệt của đa phương thức nằm ở chỗ, mặc dù nó cũng được đặt ở vị trí "thành phần", nhưng lại là thành phần mà DeepSeek đã công khai xác nhận chắc chắn sẽ thực hiện. Khi đó, Lương Văn Phong cũng đề cập rằng V4 và các phiên bản tiếp theo sẽ hỗ trợ đa phương thức gốc.


Thị giác luôn có vị trí trong lộ trình của DeepSeek, chỉ là chưa được ưu tiên xếp trước mà thôi.


Khi lộ trình tiến đến bước thứ ba là Agent, tình hình bắt đầu có chút khác biệt.


DeepSeek chưa từng công khai nói rằng lần ra mắt API thị giác này là "được tung ra vì Agent". Nhưng nếu đặt nhận định của Lương Văn Phong về lộ trình cùng với sự kiện ra mắt hôm nay, thì hai đường này khó có thể tách rời để nhìn nhận riêng.


Agent cần đọc màn hình, xem biểu đồ, xử lý ảnh chụp màn hình do công cụ trả về. Nó không thể mãi sống trong thế giới văn bản thuần túy. Những năng lực thị giác đã được phát triển suốt hai năm qua, cuối cùng cũng từ các bài nghiên cứu, kho lưu trữ và trang thử nghiệm, tiến thẳng đến API.


Ba ví dụ mà DeepSeek trình diễn hôm nay cho Vision Exp cũng không phải kiểu "nhìn hình nói chuyện" truyền thống: một Agent tạo PPT du lịch Tây Tạng bằng xe tự lái cho khách hàng cao cấp, một Agent thiết kế lại trang web chính thức của DeepSeek Harness, và một Agent khác tạo bản demo front-end có hiệu ứng động theo yêu cầu thị giác.


Tất cả đều yêu cầu mô hình xử lý thông tin thị giác lặp đi lặp lại trong các tác vụ dài hạn.


Thiết kế của API cũng đang hướng theo chiều này. Responses API cũng chấp nhận input_image, Agent trình duyệt có thể nhận ảnh chụp màn hình trang web rồi đưa lại vào vòng suy luận tiếp theo; Agent mã nguồn có thể kiểm tra kết quả render, biểu đồ, tài liệu quét và giao diện phần mềm cũng có thể trực tiếp trở thành ngữ cảnh.


Files API giải quyết một vấn đề khác: cùng một hình ảnh không cần phải tải lên lặp lại trong mỗi yêu cầu. Một tệp có thể được lưu trữ lâu dài ở đó, Agent chỉ cần truyền file_id lặp đi lặp lại. Mỗi yêu cầu đơn lẻ còn có thể chứa tối đa 600 hình ảnh. Khi sử dụng liên kết ngoài hoặc Base64, giới hạn mỗi hình là 32 MiB, nhưng khi tham chiếu qua Files API có thể lên đến 64 MiB.


Điều này không còn giống việc thêm một nút "tải ảnh lên" vào khung chat nữa.


Nó giống như đang bổ sung cơ sở hạ tầng cần thiết khi Agent sử dụng thị giác hơn.


Bốn so sánh Agent đa phương thức mà DeepSeek công bố cũng hiếm khi kiểm tra khả năng "nhìn hình nói chuyện" theo nghĩa truyền thống.


ApexBench tập trung vào các tác vụ quy trình dài trong ngân hàng đầu tư, tư vấn và luật. Agents' Last Exam đến từ công việc thực tế trong 55 lĩnh vực chuyên môn. Chartography chuyên kiểm tra đường cong Kaplan-Meier, biểu đồ nến, đường đồng mức, biểu đồ Sankey và biểu đồ Bode. ZeroBench dùng 100 bài toán khó được thiết kế thủ công để kiểm tra khả năng suy luận thị giác đa bước.



Vision Exp đạt kết quả hai thắng hai thua trước Claude Opus 4.8.


Agents' Last Exam là 27,3 so với 25,7, ZeroBench là 35,0 so với 34,0. ApexBench là 36,5 so với 39,4, Chartography là 64,3 so với 65,0. Chênh lệch của cả bốn hạng mục đều không vượt quá 3 điểm.


Điều thú vị hơn là khi thêm khả năng thị giác, khả năng Agent văn bản ban đầu không bị suy giảm rõ rệt.


So sánh từng hạng mục với V4 Flash thuần văn bản phát hành ngày 31 tháng 7, cả năm bài đánh giá Agent văn bản mà trang web chính thức công bố kết quả trước và sau đều tăng.


Terminal Bench 2.1 tăng từ 82,7 lên 83,9, NL2Repo từ 54,2 lên 57,7, DeepSWE từ 54,4 lên 59,3, DSBench-Hard từ 59,6 lên 63,6, AutomationBench từ 25,1 lên 25,7. Điểm 59,3 của DeepSWE cũng vượt qua mức 58,0 của Opus 4.8 trong biểu đồ.


Tuy nhiên, bộ số liệu này đến từ bài kiểm tra của chính DeepSeek. Trang web chính thức ghi chú rằng trong các tác vụ văn bản Code Agent công khai, các mô hình dòng DeepSeek sử dụng chế độ tối giản DeepSeek Harness với mức suy luận đặt ở max. Chúng phù hợp hơn để quan sát sự thay đổi của Vision Exp so với V4 Flash của chính hãng, thay vì được coi trực tiếp là bảng xếp hạng độc lập từ bên thứ ba.


Hậu tố "exp" sau tên mô hình vẫn chưa được gỡ bỏ.


DeepSeek xác định rõ đây là mô hình thử nghiệm, phiên bản vẫn có thể tiếp tục thay đổi. Giao diện hiện tại chỉ hỗ trợ hiểu hình ảnh, đầu ra vẫn là văn bản. Tạo hình ảnh và video chưa được mở, Files API cũng chỉ chấp nhận JPEG, PNG, GIF và WebP, không thể đưa PDF trực tiếp vào.


Năm 2024, các nhà phát triển muốn gửi một bức ảnh cho DeepSeek, nhưng API chính thức vẫn chưa hỗ trợ.


Đến ngày 21 tháng 8 năm 2026, bức ảnh này cuối cùng cũng được tiếp nhận.


Đôi mắt của DeepSeek quả thực mở ra quá muộn.


Khi nó thực sự mở mắt, con đường phía trước đã không cho phép nó tiếp tục nhắm mắt bước đi.


Liên kết bài viết gốc


Chào mừng bạn tham gia cộng đồng chính thức của BlockBeats:

Nhóm Telegram đăng ký: https://t.me/theblockbeats

Nhóm Telegram thảo luận: https://t.me/BlockBeats_App

Tài khoản Twitter chính thức: https://twitter.com/BlockBeatsAsia

举报 Báo lỗi/Báo cáo
Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Báo lỗi/Báo cáo
Gửi