Mistral Large 4 là gì? Một chuyên gia với một triệu tham số từ châu Âu

AIHubMixĐọc 6 phút
Mistral Large 4 là gì? Một chuyên gia với một triệu tham số từ châu Âu

Mistral Large 4 là sản phẩm chủ lực mới của Mistral AI. Nó có khoảng một triệu tham số, được đào tạo từ đầu ở châu Âu, và các trọng số mở của nó sẽ được phát hành vào cuối tháng 10 năm 2026. Nó không phải là mô hình thông minh nhất hiện có. Điều làm cho nó nổi bật là nó dẫn đầu trong một vài lĩnh vực mà các sản phẩm chủ lực đóng không chấp nhận hoặc tụt lại phía sau: công việc an ninh phòng thủ, xác định đối tượng trong hình ảnh và các tác nhân nghiên cứu pháp lý.

Mistral đã phát hành nó vào ngày 6 tháng 10 năm 2026 dưới dạng bản xem trước công khai. Biệt danh của nó là "Le Chonk". Bài viết này sẽ đề cập đến mô hình này, những gì nó làm tốt, những điểm yếu của nó và cách thử nghiệm nó thông qua AIHubMix.

Tóm tắt

Mistral Large 4
Nhà phát triển Mistral AI (Pháp)
Ngày phát hành 6 tháng 10 năm 2026
Trạng thái Bản xem trước công khai
API ID mistral-large-4
Tham số 1.05T tổng, khoảng 50B hoạt động
Cửa sổ ngữ cảnh 1M token
Đầu vào / đầu ra Văn bản và hình ảnh vào, văn bản ra
Lập luận Bật mặc định, có thể tắt
Giá mỗi 1M token $1.36 đầu vào, $4.18 đầu ra
Trọng số mở Dự kiến vào cuối tháng 10

Trên AIHubMix, ID mô hình là mistral-large-4-0, mà Mistral cũng chấp nhận như một bí danh. Thông số ở đây theo thẻ mô hình của Mistral. Mistral đã đưa ra cả 49B và 52B như số lượng tham số hoạt động. Giấy phép cho các trọng số mở chưa được công bố.

Đây là một mô hình hỗn hợp chuyên gia, vì vậy chỉ một phần nhỏ trong số các tham số của nó hoạt động cho mỗi token. Nó có một bộ mã hóa hình ảnh 1.6B tham số, chấp nhận tối đa 100 hình ảnh mỗi yêu cầu, và bao phủ hơn 160 ngôn ngữ. Mistral đã đào tạo nó trên 3,800 GPU NVIDIA Grace Blackwell trong các trung tâm dữ liệu của riêng mình ở châu Âu, không phải trên nền tảng của một công ty khác.

Những gì nó làm tốt

Các số liệu dưới đây đến từ bài đăng ra mắt của Mistral và từ các thử nghiệm độc lập của Artificial Analysis và Vals AI. Các số liệu của Mistral là tự báo cáo, và tất cả đều được đo trong bản xem trước trong khi đào tạo vẫn đang diễn ra.

Lĩnh vực Tiêu chuẩn Large 4 Để so sánh
An ninh CyberGym-E2E 82% MiMo-V2.6-Pro 79%
An ninh Cybench (40 CTFs) 93% không so sánh
Thị giác DIOR-RSVG 73% GPT-6 Astra 68%
Thị giác Dense200 42% GPT-6 Astra 41%
Pháp lý Tác nhân pháp lý Harvey 15.8% Kimi K3 12.9%
Tài chính Finch 67% DeepSeek V4 Pro 67%

An ninh phòng thủ. CyberGym-E2E yêu cầu một mô hình tái tạo một lỗ hổng thực tế và sau đó vá nó. Large 4 có điểm số cao nhất trong thử nghiệm của Artificial Analysis. Theo Mistral, Claude Opus 5.5 và GPT-6 Astra có điểm gần như bằng không vì chúng từ chối nhiệm vụ này. Tuy nhiên, nó không nói "có" với mọi thứ. Mistral báo cáo rằng nó từ chối các yêu cầu mạng độc hại thực sự thường xuyên hơn bất kỳ mô hình mở nào khác mà nó đã thử nghiệm, và rằng nó đã chặn 93.3% các cuộc tấn công trên tiêu chuẩn tiêm lệnh B3 của Lakera.

Tìm kiếm đối tượng trong hình ảnh. Large 4 có thể thực hiện việc định vị hình ảnh: nó có thể đánh dấu vị trí của một đối tượng, không chỉ mô tả nó. DIOR-RSVG kiểm tra điều này trên hình ảnh vệ tinh và trên không, và Dense200 kiểm tra nó trên các cảnh đông đúc. Các bản demo của Mistral bao gồm việc quét hình ảnh vệ tinh gigapixel và kiểm tra các phần trong bản vẽ kỹ thuật.

Công việc pháp lý và tài chính. Trên tiêu chuẩn tác nhân pháp lý của Harvey, Vals AI xếp hạng nó thứ sáu trong số 76 mô hình và đứng đầu trong số các mô hình mở. Trên Finch, một tiêu chuẩn tài chính, biểu đồ của Mistral cho thấy nó ngang bằng với DeepSeek V4 Pro.

Artificial Analysis đã tóm tắt việc phát hành như sau: "Pháp đã trở lại với mô hình thông minh nhất từ bên ngoài Mỹ và Trung Quốc."

Những điểm yếu của nó

Large 4 không phải là một mô hình toàn diện hàng đầu:

  • Trí tuệ tổng quát. Nó đạt 38 trên Chỉ số Trí tuệ của Artificial Analysis. Điều này ngang bằng với GPT-6 Luna và đứng sau các mô hình mở GLM-5.3 (45) và Kimi K3 (44).
  • Lập trình nặng về terminal. Nó đạt 22.7% trên Terminal-Bench 4 trong thử nghiệm của Vals AI, đứng thứ 21 trong số 45. Claude Opus 5.5 đạt 65.2%.
  • Chứng minh toán học và báo cáo PDF dài. Nó đạt 10% trên ProofBench và 19% trên GDP.pdf. GPT-6 Astra đạt khoảng 32% trên GDP.pdf.
  • Chi phí cho mỗi nhiệm vụ. Theo tính toán của Artificial Analysis, một nhiệm vụ Chỉ số Trí tuệ có giá $1.13 theo giá niêm yết. Các mô hình mở tương tự có khả năng như GLM-5.3-Flash có giá khoảng $0.25.

So sánh với Large 3

Large 3 Large 4
Tham số 675B tổng, 41B hoạt động 1.05T tổng, khoảng 50B hoạt động
Ngữ cảnh 256K 1M
Hình ảnh mỗi yêu cầu 8 100
Giá mỗi 1M token $0.50 / $1.50 $1.36 / $4.18
Trọng số Apache 2.0, có sẵn ngay bây giờ Dự kiến vào cuối tháng 10

Large 4 có giá khoảng 2.7 lần so với mỗi token so với Large 3. Đối với công việc văn bản đơn giản, khối lượng lớn mà Large 3 đã xử lý tốt, việc nâng cấp có thể không mang lại lợi ích.

Hai điều cần biết trước khi bạn gọi nó

Suy nghĩ được bật mặc định. Trên API của Mistral, reasoning_effort có thể là "none" hoặc "high". Thông qua AIHubMix, các thử nghiệm vào ngày 9 tháng 10 đã phát hiện rằng mô hình suy nghĩ bất kể reasoning_effort nói gì, bao gồm cả "none", và các token suy nghĩ được tính là đầu ra. Để tắt suy nghĩ, gửi "reasoning": {"effort": "none"} trong thân yêu cầu, như mẫu dưới đây. Khi suy nghĩ được bật, hướng dẫn lập luận của Mistral cho biết nên gửi lại trong lượt tiếp theo. Thông qua AIHubMix, nó đến trong một trường reasoning_details riêng biệt, và yêu cầu tiếp theo chấp nhận nó như một phần của tin nhắn trợ lý.

Đây là một bản xem trước. Chính sách vòng đời của Mistral cho phép cập nhật âm thầm cho các mô hình xem trước và thông báo một tháng trước khi ngừng hoạt động một mô hình. Giữ một bộ nhỏ các lời nhắc thử nghiệm và chạy lại chúng từ thời gian này sang thời gian khác.

Thử nghiệm nó qua AIHubMix

AIHubMix cung cấp Large 4 thông qua điểm cuối Chat Completions tương thích với OpenAI. Nếu bạn chưa thiết lập khóa, hướng dẫn nhanh chỉ mất vài phút.

import os

from openai import OpenAI

client = OpenAI(
    api_key=os.environ["AIHUBMIX_API_KEY"],
    base_url="https://aihubmix.com/v1",
)

response = client.chat.completions.create(
    model="mistral-large-4-0",
    messages=[{
        "role": "user",
        "content": "Viết một quy tắc Sigma mà đánh dấu PowerShell được khởi động bởi các ứng dụng Office, "
                   "và giải thích từng điều kiện trong một dòng.",
    }],
    extra_body={"reasoning": {"effort": "none"}},  # tắt suy nghĩ
)
print(response.choices[0].message.content)

Câu trả lời luôn là một chuỗi đơn giản trong content. Bỏ qua trường reasoning và mô hình sẽ suy nghĩ trước. Suy nghĩ sẽ đến dưới dạng một danh sách trong message.model_extra["reasoning_details"], và các token của nó được tính là đầu ra. Khi suy nghĩ được bật, hãy cho max_tokens nhiều không gian. Trong thử nghiệm, một giới hạn 300 token đã được sử dụng hết bởi suy nghĩ và trả về một câu trả lời trống.

Ai nên thử nghiệm nó

  • Các đội an ninh thực hiện việc tái tạo lỗ hổng, vá lỗi, phân tích phần mềm độc hại, hoặc quy tắc phát hiện mà các mô hình đóng từ chối.
  • Các đội làm việc với hình ảnh, chẳng hạn như kiểm tra vệ tinh và trên không, bản vẽ kỹ thuật, và các cảnh đông đúc, nơi mà các hộp quan trọng hơn các chú thích.
  • Các nhà phát triển pháp lý và tài chính muốn một mô hình mở gần với các tiêu chuẩn tác nhân hàng đầu.
  • Các tổ chức châu Âu cần một mô hình không phải của Mỹ hay Trung Quốc, với một triển khai được lưu trữ tại EU và một con đường để tự lưu trữ.

Đối với các tác nhân lập trình tổng quát hoặc công việc hàng ngày nhạy cảm về chi phí, hãy so sánh nó với các mô hình khác trước. Danh sách mô hình AIHubMix cho phép bạn chạy cùng một lời nhắc chống lại Large 4 và các lựa chọn thay thế của nó với một khóa duy nhất.

Câu hỏi thường gặp

Mistral Large 4 là gì?
Nó là mô hình chủ lực của Mistral AI, được phát hành dưới dạng bản xem trước công khai vào ngày 6 tháng 10 năm 2026. Nó là một mô hình hỗn hợp chuyên gia với 1.05 triệu tham số, nhận đầu vào văn bản và hình ảnh, và trả về văn bản.

Mistral Large 4 có mã nguồn mở không?
Chưa. Mistral dự định công bố các trọng số vào cuối tháng 10 năm 2026, nhưng chưa công bố giấy phép. Giấy phép Apache 2.0 của Large 3 không tự động được chuyển giao.

Nó có giá bao nhiêu?
Giá niêm yết là $1.36 cho mỗi triệu token đầu vào, $0.14 cho mỗi triệu token đầu vào đã lưu, và $4.18 cho mỗi triệu token đầu ra.

Cửa sổ ngữ cảnh dài bao nhiêu?
1M token, theo thẻ mô hình của Mistral. Điều này gấp bốn lần so với 256K của Large 3.

Nó có tốt hơn GPT-6 hoặc Claude không?
Chỉ trong một số lĩnh vực cụ thể: các nhiệm vụ an ninh phòng thủ mà các mô hình đóng từ chối, định vị hình ảnh, và tiêu chuẩn tác nhân pháp lý của Harvey. Về trí tuệ tổng quát và lập trình tác nhân, các sản phẩm chủ lực đóng vẫn dẫn đầu.

Nó có hỗ trợ lập luận không?
Có, và nó được bật mặc định. Thông qua AIHubMix, suy nghĩ sẽ quay lại trong một trường reasoning_details riêng biệt. Để tắt nó, gửi một đối tượng lập luận với nỗ lực được đặt thành không trong thân yêu cầu. Đặt reasoning_effort thành không không tắt nó trên AIHubMix.

Nó có thể đọc hình ảnh không?
Có. Nó chấp nhận tối đa 100 hình ảnh mỗi yêu cầu và có thể đánh dấu vị trí của các đối tượng trong đó. Nó không thể tạo ra hình ảnh.

Nguồn