Bỏ qua để đến nội dung

Hội đồng Đánh giá Model AI (Model Council)

Trang Hội đồng Đánh giá Model AI (Model Council) (/app/model-council) là công cụ benchmark hiệu năng AI, cho phép gửi cùng một câu hỏi thử nghiệm tới nhiều mô hình AI khác nhau để so sánh chất lượng câu trả lời, tốc độ và chi phí trước khi quyết định chọn model cho Agent.

Hệ thống cho phép chọn cùng lúc nhiều mô hình lớn:

  • OpenAI: GPT-4o, GPT-4o-mini.
  • Anthropic: Claude Sonnet, Claude Haiku.
  • Google: Gemini 2.5 Pro, Gemini 2.5 Flash.
  • DeepSeek: DeepSeek-V3, DeepSeek-R1.

4 Bước chạy So sánh Mô hình (Model Comparison)

Phần tiêu đề “4 Bước chạy So sánh Mô hình (Model Comparison)”
flowchart TD
  START[1. Bấm + Thử nghiệm mới] --> FORM[2. Nhập Prompt, System Prompt & Tham số]
  FORM --> SEL[3. Chọn dải Models cần so sánh]
  SEL --> RUN[4. Chạy mô phỏng song song]
  RUN --> RESULT[Bảng so sánh: Tốc độ, Token & Chọn Winner]

Nhấp nút + Thử nghiệm so sánh mới để mở modal cấu hình:

  • Câu hỏi thử nghiệm (prompt): Nhập tình huống tư vấn phức tạp (vd: “Khách hỏi mua áo thun nhưng chê đắt và đòi giảm giá 30%”).
  • System Prompt: Câu lệnh định hình vai trò tư vấn viên.
  • Tham số sinh câu:
    • temperature: Mức độ sáng tạo (Mặc định 0.7).
    • max_tokens: Giới hạn độ dài từ (Mặc định 1500).

Tick chọn danh sách các mô hình bạn muốn đưa vào “Hội đồng” so sánh (ví dụ: tick chọn cùng lúc GPT-4o, Claude SonnetDeepSeek-R1).

Bước 3: Đánh giá & Xem kết quả song song

Phần tiêu đề “Bước 3: Đánh giá & Xem kết quả song song”

Hệ thống hiển thị kết quả tư vấn của từng mô hình trên các thẻ song song:

  • Chất lượng nội dung: Đánh giá văn phong và độ chính xác logic.
  • Thời gian phản hồi (Latency): Tính bằng mili-giây (ms).
  • Lượng Token & Chi phí: Đo lường tổng số token tiêu tốn.

Bước 4: Bình chọn Model chiến thắng (Winner)

Phần tiêu đề “Bước 4: Bình chọn Model chiến thắng (Winner)”

Bấm Chọn Model này chiến thắng (Winner) để lưu lại kết quả đánh giá phục vụ việc chọn model mặc định cho Agent Builder.