Hội đồng Đánh giá Model AI (Model Council)
Trang Hội đồng Đánh giá Model AI (Model Council) (/app/model-council) là công cụ benchmark hiệu năng AI, cho phép gửi cùng một câu hỏi thử nghiệm tới nhiều mô hình AI khác nhau để so sánh chất lượng câu trả lời, tốc độ và chi phí trước khi quyết định chọn model cho Agent.
Các mô hình AI hỗ trợ So sánh
Phần tiêu đề “Các mô hình AI hỗ trợ So sánh”Hệ thống cho phép chọn cùng lúc nhiều mô hình lớn:
- OpenAI: GPT-4o, GPT-4o-mini.
- Anthropic: Claude Sonnet, Claude Haiku.
- Google: Gemini 2.5 Pro, Gemini 2.5 Flash.
- DeepSeek: DeepSeek-V3, DeepSeek-R1.
4 Bước chạy So sánh Mô hình (Model Comparison)
Phần tiêu đề “4 Bước chạy So sánh Mô hình (Model Comparison)”flowchart TD START[1. Bấm + Thử nghiệm mới] --> FORM[2. Nhập Prompt, System Prompt & Tham số] FORM --> SEL[3. Chọn dải Models cần so sánh] SEL --> RUN[4. Chạy mô phỏng song song] RUN --> RESULT[Bảng so sánh: Tốc độ, Token & Chọn Winner]
Bước 1: Khởi tạo bài thử nghiệm
Phần tiêu đề “Bước 1: Khởi tạo bài thử nghiệm”Nhấp nút + Thử nghiệm so sánh mới để mở modal cấu hình:
- Câu hỏi thử nghiệm (
prompt): Nhập tình huống tư vấn phức tạp (vd: “Khách hỏi mua áo thun nhưng chê đắt và đòi giảm giá 30%”). - System Prompt: Câu lệnh định hình vai trò tư vấn viên.
- Tham số sinh câu:
temperature: Mức độ sáng tạo (Mặc định0.7).max_tokens: Giới hạn độ dài từ (Mặc định1500).
Bước 2: Chọn các Model tham gia
Phần tiêu đề “Bước 2: Chọn các Model tham gia”Tick chọn danh sách các mô hình bạn muốn đưa vào “Hội đồng” so sánh (ví dụ: tick chọn cùng lúc GPT-4o, Claude Sonnet và DeepSeek-R1).
Bước 3: Đánh giá & Xem kết quả song song
Phần tiêu đề “Bước 3: Đánh giá & Xem kết quả song song”Hệ thống hiển thị kết quả tư vấn của từng mô hình trên các thẻ song song:
- Chất lượng nội dung: Đánh giá văn phong và độ chính xác logic.
- Thời gian phản hồi (Latency): Tính bằng mili-giây (ms).
- Lượng Token & Chi phí: Đo lường tổng số token tiêu tốn.
Bước 4: Bình chọn Model chiến thắng (Winner)
Phần tiêu đề “Bước 4: Bình chọn Model chiến thắng (Winner)”Bấm Chọn Model này chiến thắng (Winner) để lưu lại kết quả đánh giá phục vụ việc chọn model mặc định cho Agent Builder.
Bước tiếp theo
Phần tiêu đề “Bước tiếp theo”- Điều hành AI Agent (AI Routing) — Cấu hình ma trận luồng đi.
- Nghiên cứu chuyên sâu (Deep Research) — Công cụ nghiên cứu dữ liệu AI.
- Trợ lý AI tổng quan — Quản lý Agent.
