Claude Code tính phí theo lượng token API tiêu thụ. Với giá của các gói subscription (Pro, Max, Team, Enterprise), xem claude.com/pricing. Chi phí trên mỗi developer dao động khá lớn tùy vào model chọn dùng, kích thước codebase, và pattern sử dụng (ví dụ chạy nhiều instance song song hoặc automation).
Trên các tổ chức enterprise, chi phí trung bình khoảng $13/developer/ngày hoạt động và $150–250/developer/tháng, với 90% user có chi phí dưới $30/ngày hoạt động. Để ước tính chi tiêu cho team của bạn, hãy bắt đầu với một nhóm pilot nhỏ và dùng các công cụ theo dõi bên dưới để thiết lập baseline trước khi rollout rộng hơn.
Theo dõi chi phí của bạn
Phần tiêu đề “Theo dõi chi phí của bạn”Dùng lệnh /usage
Phần tiêu đề “Dùng lệnh /usage”Khối Session ở đầu /usage hiển thị thống kê token chi tiết cho session hiện tại. Claude Code tự tính số tiền cục bộ từ số token theo giá niêm yết chuẩn, nên không phản ánh giá khuyến mãi hay giảm giá theo hợp đồng và có thể khác với hóa đơn thực tế. Để có số liệu billing chính thức, xem trang Usage trong Claude Console.
Total cost: $0.55Total duration (API): 6m 20sTotal duration (wall): 6h 33m 10sTotal code changes: 0 lines added, 0 lines removedUsage by model: claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)Các con số này reset khi /clear bắt đầu session mới.
Trên gói Pro, Max, Team, hoặc Enterprise, /usage còn hiển thị breakdown về những gì tính vào giới hạn gói: skill, subagent, plugin, và từng MCP server, mỗi thứ hiển thị theo phần trăm tổng usage. Nó cũng cảnh báo khi một hành vi như context dài hoặc cache miss chiếm từ 10% usage gần đây trở lên. Nhấn d hoặc w để chuyển giữa 24 giờ và 7 ngày gần nhất.
Thêm usage credit vào subscription
Phần tiêu đề “Thêm usage credit vào subscription”Usage credit cho phép bạn tiếp tục làm việc khi đã hết giới hạn usage của gói. Quản lý bằng lệnh /usage-credits sau khi đăng nhập subscription claude.ai qua /login (lệnh này không dùng được với xác thực API key).
| Vai trò | /usage-credits làm gì |
|---|---|
| Subscriber Pro hoặc Max | Mở trang billing settings trên trình duyệt |
| Thành viên Team/Enterprise có quyền billing | Mở trang usage settings của tổ chức |
| Thành viên Team/Enterprise không có quyền billing | Yêu cầu xác nhận, sau đó gửi request tới admin tổ chức |
Quản lý chi phí cho tổ chức
Phần tiêu đề “Quản lý chi phí cho tổ chức”Bảng dưới ánh xạ từng setup tới nơi xem chi tiêu, nơi giới hạn chi tiêu, và cách lấy số liệu theo từng user.
| Setup của bạn | Xem chi tiêu | Giới hạn chi tiêu | Báo cáo theo user |
|---|---|---|---|
| Claude for Teams/Enterprise | Spend report trong org analytics | Spend limit trong admin settings | Spend report CSV; Enterprise Analytics API (bản Enterprise) |
| Claude Console (API) | Trang usage của Console | Workspace spend limit | Console dashboard, Claude Code Analytics API |
| Amazon Bedrock, Google Cloud’s Agent Platform, hoặc Microsoft Foundry | Billing console của cloud provider | Budget control của cloud provider | OpenTelemetry hoặc LLM gateway |
Export OpenTelemetry hoạt động trên mọi setup và là lựa chọn duy nhất stream metric token/chi phí theo từng user vào hệ thống observability riêng của bạn gần như real-time.
Claude for Teams và Enterprise
Phần tiêu đề “Claude for Teams và Enterprise”Mỗi thành viên dùng usage từ một hạn mức theo seat, reset theo cửa sổ rolling 5 giờ và theo tuần. Hạn mức này dùng chung với Claude chat và Cowork, kích thước tùy vào seat tier (Standard hoặc Premium). Các điều khiển nằm trong admin console của claude.ai, không phải Claude Console.
- Xem chi tiêu: spend report trong org analytics - ước tính chi tiêu theo user/model, xuất CSV, cập nhật hàng ngày.
- Xem mức áp dụng: dashboard analytics hiển thị daily active users, sessions, và contribution metrics.
- Giới hạn chi tiêu: hạn mức seat là trần mặc định. Bật usage credit để cho phép vượt, rồi đặt spend limit ở cấp tổ chức, nhóm, hoặc từng thành viên.
- Số liệu theo user: Enterprise Analytics API (yêu cầu Primary Owner tạo key scope
read:analytics); trên gói Team, xuất spend report CSV.
Claude Console
Phần tiêu đề “Claude Console”Tổ chức dùng API quản lý chi tiêu Claude Code qua workspace. Bạn có thể đặt spend limit cho workspace và xem báo cáo cost/usage trong Console.
Khuyến nghị rate limit
Phần tiêu đề “Khuyến nghị rate limit”| Team size | TPM/user | RPM/user |
|---|---|---|
| 1–5 users | 200k–300k | 5–7 |
| 5–20 users | 100k–150k | 2.5–3.5 |
| 20–50 users | 50k–75k | 1.25–1.75 |
| 50–100 users | 25k–35k | 0.62–0.87 |
| 100–500 users | 15k–20k | 0.37–0.47 |
| 500+ users | 10k–15k | 0.25–0.35 |
TPM/user giảm dần khi team lớn hơn vì tỷ lệ user dùng đồng thời thường thấp hơn ở tổ chức lớn. Các rate limit này áp dụng ở cấp tổ chức, không phải cấp cá nhân.
Cloud provider
Phần tiêu đề “Cloud provider”Trên Amazon Bedrock, Google Cloud’s Agent Platform, và Microsoft Foundry, Claude Code tính phí theo token vào tài khoản cloud của bạn. Claude Code không gửi metric từ cloud của bạn về Anthropic, nên dashboard analytics và Claude Code Analytics API không bao phủ usage này. Ba cách để attribute chi phí theo user: OpenTelemetry, một Claude apps gateway, hoặc một LLM gateway (ví dụ LiteLLM - dự án bên thứ ba, không liên kết với Anthropic).
Khi developer hỏi về giới hạn
Phần tiêu đề “Khi developer hỏi về giới hạn”- “Bạn đã chạm session limit / weekly limit”: giới hạn theo seat trên gói subscription, dùng chung cho mọi model. Chạy
/usage-creditsđể xin thêm nếu tổ chức đã bật usage credit. - Cảnh báo context hoặc auto-compact: không phải giới hạn usage - conversation đã gần tới kích thước input tối đa của model.
- Chi tiêu bất ngờ cao trên API/cloud provider: thường do session dài chưa từng
/clear, hoặc để mặc định model Opus.
Chi phí token của agent team
Phần tiêu đề “Chi phí token của agent team”Agent team spawn nhiều instance Claude Code, mỗi cái có context window riêng, nên usage tăng theo số teammate hoạt động và thời gian chạy. Để kiểm soát chi phí: dùng Sonnet cho teammate, giữ team nhỏ, giữ spawn prompt gọn, và shutdown teammate khi xong việc. Agent team mặc định tắt - bật bằng CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1.
Giảm token usage
Phần tiêu đề “Giảm token usage”Chi phí token tỷ lệ với kích thước context. Claude Code tự tối ưu qua prompt caching và auto-compaction, nhưng các thói quen dưới đây giúp giữ context nhỏ hơn nữa.
Quản lý context chủ động
Phần tiêu đề “Quản lý context chủ động”/cleargiữa các task: dùng khi chuyển sang việc không liên quan. Dùng/renametrước khi clear để dễ tìm lại session, rồi/resumeđể quay lại.- Custom compaction instruction:
/compact Focus on code samples and API usagecho biết cần giữ gì khi tóm tắt. - Thêm hướng dẫn compact vào CLAUDE.md:
# Compact instructions
When you are using compact, please focus on test output and code changesChọn đúng model
Phần tiêu đề “Chọn đúng model”Sonnet xử lý tốt hầu hết task coding và rẻ hơn Opus. Dùng Opus cho quyết định kiến trúc phức tạp hoặc reasoning nhiều bước. Dùng /model để đổi model giữa session, hoặc đặt mặc định trong /config. Với subagent đơn giản, chỉ định model: haiku trong cấu hình subagent.
Giảm overhead từ MCP server
Phần tiêu đề “Giảm overhead từ MCP server”Định nghĩa tool MCP mặc định deferred - chỉ tên tool vào context cho tới khi Claude thực sự dùng tool đó. Chạy /context để xem gì đang chiếm chỗ. Ưu tiên CLI tool (gh, aws, gcloud…) khi có thể - tiết kiệm context hơn MCP server vì không có phần liệt kê tool. Chạy /mcp để tắt server không dùng tới.
Cài plugin code intelligence cho ngôn ngữ có kiểu tĩnh
Phần tiêu đề “Cài plugin code intelligence cho ngôn ngữ có kiểu tĩnh”Plugin code intelligence cho Claude khả năng điều hướng symbol chính xác thay vì tìm kiếm dựa trên text, giảm số lần đọc file không cần thiết.
Đẩy xử lý sang hook và skill
Phần tiêu đề “Đẩy xử lý sang hook và skill”Hook tùy chỉnh có thể tiền xử lý dữ liệu trước khi Claude thấy nó - ví dụ một hook grep lỗi từ file log 10.000 dòng thay vì để Claude đọc toàn bộ. Một skill có thể cung cấp domain knowledge để Claude không cần khám phá lại từ đầu.
Ví dụ hook PreToolUse lọc output test chỉ giữ phần fail:
{ "hooks": { "PreToolUse": [ { "matcher": "Bash", "hooks": [ { "type": "command", "command": "~/.claude/hooks/filter-test-output.sh" } ] } ] }}#!/bin/bashinput=$(cat)cmd=$(echo "$input" | jq -r '.tool_input.command')
if [[ "$cmd" =~ ^(npm test|pytest|go test) ]]; then filtered_cmd="$cmd 2>&1 | grep -A 5 -E '(FAIL|ERROR|error:)' | head -100" echo "{\"hookSpecificOutput\":{\"hookEventName\":\"PreToolUse\",\"permissionDecision\":\"allow\",\"updatedInput\":{\"command\":\"$filtered_cmd\"}}}"else echo "{}"fiChuyển hướng dẫn từ CLAUDE.md sang skill
Phần tiêu đề “Chuyển hướng dẫn từ CLAUDE.md sang skill”CLAUDE.md được nạp vào context ngay từ đầu session. Nếu nó chứa hướng dẫn chi tiết cho workflow cụ thể (review PR, migrate database…), các token đó tồn tại kể cả khi bạn làm việc khác. Skill chỉ nạp khi được gọi - nên đưa hướng dẫn chuyên biệt vào skill giúp context cơ bản nhỏ hơn. Giữ CLAUDE.md dưới 200 dòng, chỉ gồm phần thiết yếu.
Điều chỉnh extended thinking
Phần tiêu đề “Điều chỉnh extended thinking”Extended thinking mặc định bật vì cải thiện đáng kể hiệu năng cho task planning/reasoning phức tạp. Token thinking tính phí như output token. Với task đơn giản, giảm chi phí bằng cách hạ effort level qua /effort, tắt thinking trong /config, hoặc hạ MAX_THINKING_TOKENS (với model có thinking budget cố định).
Giao việc tốn nhiều output cho subagent
Phần tiêu đề “Giao việc tốn nhiều output cho subagent”Chạy test, fetch documentation, xử lý log file có thể tốn nhiều context - giao cho subagent để output chi tiết ở lại context của subagent, chỉ tóm tắt trả về conversation chính.
Quản lý chi phí agent team
Phần tiêu đề “Quản lý chi phí agent team”Agent team dùng khoảng gấp 7 lần token so với session thường khi teammate chạy ở plan mode, vì mỗi teammate duy trì context window riêng.
Viết prompt cụ thể
Phần tiêu đề “Viết prompt cụ thể”Yêu cầu mơ hồ như “cải thiện codebase này” kích hoạt quét rộng. Yêu cầu cụ thể như “thêm input validation vào hàm login trong auth.ts” giúp Claude làm việc hiệu quả với ít lần đọc file hơn.
Làm việc hiệu quả với task phức tạp
Phần tiêu đề “Làm việc hiệu quả với task phức tạp”- Dùng plan mode (Shift+Tab) cho task phức tạp - Claude khám phá codebase và đề xuất cách tiếp cận trước khi bạn duyệt.
- Sửa hướng sớm: nhấn Escape để dừng ngay nếu Claude đi sai hướng; dùng
/rewindhoặc double-tap Escape để khôi phục về checkpoint trước. - Cho tiêu chí kiểm chứng: kèm test case, screenshot, hoặc mô tả output mong muốn.
- Test từng bước nhỏ: viết một file, test, rồi tiếp tục.
Token usage nền
Phần tiêu đề “Token usage nền”Claude Code dùng một ít token cho tác vụ nền ngay cả khi idle: tóm tắt conversation cũ (phục vụ claude --resume), và một số lệnh như /usage có thể tạo request kiểm tra trạng thái. Các tiến trình này thường tốn dưới $0.04/session.
Vì sao usage tăng vọt trong session dài
Phần tiêu đề “Vì sao usage tăng vọt trong session dài”- Context dài: Claude Code gửi toàn bộ conversation ở mỗi request; dù dùng prompt caching, một câu hỏi ngắn trong session mở cả ngày vẫn tính usage cho toàn bộ lịch sử.
- Cache miss: message đầu tiên sau khoảng nghỉ dài hơn cache lifetime (1 giờ với subscription, 5 phút khi dùng usage credit hoặc API key) sẽ miss cache và xử lý lại toàn bộ context.
- Scheduled task: kích hoạt theo interval kể cả khi session idle, gửi toàn bộ context mỗi lần.
- Agent teammate: mỗi teammate hoạt động tiếp tục tiêu tốn token cho tới khi thoát.
- Compaction:
/compactđọc toàn bộ conversation để tóm tắt, nên bản thân nó là một request lớn -/clearthì không tốn gì.
Hiểu thay đổi hành vi Claude Code
Phần tiêu đề “Hiểu thay đổi hành vi Claude Code”Claude Code thường xuyên có bản cập nhật có thể thay đổi cách tính năng hoạt động, kể cả cách báo cáo chi phí. Chạy claude --version để kiểm tra version hiện tại. Với câu hỏi billing cụ thể cho tài khoản, liên hệ Anthropic support qua in-product messenger (đăng nhập claude.ai hoặc platform.claude.com, chọn Get help).
lượt xem