Bỏ qua để đến nội dung

Quản lý chi phí hiệu quả

Bài viết được dịch tự động từ bài viết gốc, chưa được kiểm tra lại bởi con người. Chỉ những bài viết có dấu tick xanh cạnh tiêu đề là đã được kiểm tra.

Claude Code tính phí theo lượng token API tiêu thụ. Với giá của các gói subscription (Pro, Max, Team, Enterprise), xem claude.com/pricing. Chi phí trên mỗi developer dao động khá lớn tùy vào model chọn dùng, kích thước codebase, và pattern sử dụng (ví dụ chạy nhiều instance song song hoặc automation).

Trên các tổ chức enterprise, chi phí trung bình khoảng $13/developer/ngày hoạt động$150–250/developer/tháng, với 90% user có chi phí dưới $30/ngày hoạt động. Để ước tính chi tiêu cho team của bạn, hãy bắt đầu với một nhóm pilot nhỏ và dùng các công cụ theo dõi bên dưới để thiết lập baseline trước khi rollout rộng hơn.

Khối Session ở đầu /usage hiển thị thống kê token chi tiết cho session hiện tại. Claude Code tự tính số tiền cục bộ từ số token theo giá niêm yết chuẩn, nên không phản ánh giá khuyến mãi hay giảm giá theo hợp đồng và có thể khác với hóa đơn thực tế. Để có số liệu billing chính thức, xem trang Usage trong Claude Console.

Total cost: $0.55
Total duration (API): 6m 20s
Total duration (wall): 6h 33m 10s
Total code changes: 0 lines added, 0 lines removed
Usage by model:
claude-sonnet-4-6: 1.2k input, 5.3k output, 940.0k cache read, 50.0k cache write ($0.55)

Các con số này reset khi /clear bắt đầu session mới.

Trên gói Pro, Max, Team, hoặc Enterprise, /usage còn hiển thị breakdown về những gì tính vào giới hạn gói: skill, subagent, plugin, và từng MCP server, mỗi thứ hiển thị theo phần trăm tổng usage. Nó cũng cảnh báo khi một hành vi như context dài hoặc cache miss chiếm từ 10% usage gần đây trở lên. Nhấn d hoặc w để chuyển giữa 24 giờ và 7 ngày gần nhất.

Usage credit cho phép bạn tiếp tục làm việc khi đã hết giới hạn usage của gói. Quản lý bằng lệnh /usage-credits sau khi đăng nhập subscription claude.ai qua /login (lệnh này không dùng được với xác thực API key).

Vai trò/usage-credits làm gì
Subscriber Pro hoặc MaxMở trang billing settings trên trình duyệt
Thành viên Team/Enterprise có quyền billingMở trang usage settings của tổ chức
Thành viên Team/Enterprise không có quyền billingYêu cầu xác nhận, sau đó gửi request tới admin tổ chức

Bảng dưới ánh xạ từng setup tới nơi xem chi tiêu, nơi giới hạn chi tiêu, và cách lấy số liệu theo từng user.

Setup của bạnXem chi tiêuGiới hạn chi tiêuBáo cáo theo user
Claude for Teams/EnterpriseSpend report trong org analyticsSpend limit trong admin settingsSpend report CSV; Enterprise Analytics API (bản Enterprise)
Claude Console (API)Trang usage của ConsoleWorkspace spend limitConsole dashboard, Claude Code Analytics API
Amazon Bedrock, Google Cloud’s Agent Platform, hoặc Microsoft FoundryBilling console của cloud providerBudget control của cloud providerOpenTelemetry hoặc LLM gateway

Export OpenTelemetry hoạt động trên mọi setup và là lựa chọn duy nhất stream metric token/chi phí theo từng user vào hệ thống observability riêng của bạn gần như real-time.

Mỗi thành viên dùng usage từ một hạn mức theo seat, reset theo cửa sổ rolling 5 giờ và theo tuần. Hạn mức này dùng chung với Claude chat và Cowork, kích thước tùy vào seat tier (Standard hoặc Premium). Các điều khiển nằm trong admin console của claude.ai, không phải Claude Console.

  • Xem chi tiêu: spend report trong org analytics - ước tính chi tiêu theo user/model, xuất CSV, cập nhật hàng ngày.
  • Xem mức áp dụng: dashboard analytics hiển thị daily active users, sessions, và contribution metrics.
  • Giới hạn chi tiêu: hạn mức seat là trần mặc định. Bật usage credit để cho phép vượt, rồi đặt spend limit ở cấp tổ chức, nhóm, hoặc từng thành viên.
  • Số liệu theo user: Enterprise Analytics API (yêu cầu Primary Owner tạo key scope read:analytics); trên gói Team, xuất spend report CSV.

Tổ chức dùng API quản lý chi tiêu Claude Code qua workspace. Bạn có thể đặt spend limit cho workspace và xem báo cáo cost/usage trong Console.

Team sizeTPM/userRPM/user
1–5 users200k–300k5–7
5–20 users100k–150k2.5–3.5
20–50 users50k–75k1.25–1.75
50–100 users25k–35k0.62–0.87
100–500 users15k–20k0.37–0.47
500+ users10k–15k0.25–0.35

TPM/user giảm dần khi team lớn hơn vì tỷ lệ user dùng đồng thời thường thấp hơn ở tổ chức lớn. Các rate limit này áp dụng ở cấp tổ chức, không phải cấp cá nhân.

Trên Amazon Bedrock, Google Cloud’s Agent Platform, và Microsoft Foundry, Claude Code tính phí theo token vào tài khoản cloud của bạn. Claude Code không gửi metric từ cloud của bạn về Anthropic, nên dashboard analytics và Claude Code Analytics API không bao phủ usage này. Ba cách để attribute chi phí theo user: OpenTelemetry, một Claude apps gateway, hoặc một LLM gateway (ví dụ LiteLLM - dự án bên thứ ba, không liên kết với Anthropic).

  • “Bạn đã chạm session limit / weekly limit”: giới hạn theo seat trên gói subscription, dùng chung cho mọi model. Chạy /usage-credits để xin thêm nếu tổ chức đã bật usage credit.
  • Cảnh báo context hoặc auto-compact: không phải giới hạn usage - conversation đã gần tới kích thước input tối đa của model.
  • Chi tiêu bất ngờ cao trên API/cloud provider: thường do session dài chưa từng /clear, hoặc để mặc định model Opus.

Agent team spawn nhiều instance Claude Code, mỗi cái có context window riêng, nên usage tăng theo số teammate hoạt động và thời gian chạy. Để kiểm soát chi phí: dùng Sonnet cho teammate, giữ team nhỏ, giữ spawn prompt gọn, và shutdown teammate khi xong việc. Agent team mặc định tắt - bật bằng CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1.

Chi phí token tỷ lệ với kích thước context. Claude Code tự tối ưu qua prompt caching và auto-compaction, nhưng các thói quen dưới đây giúp giữ context nhỏ hơn nữa.

  • /clear giữa các task: dùng khi chuyển sang việc không liên quan. Dùng /rename trước khi clear để dễ tìm lại session, rồi /resume để quay lại.
  • Custom compaction instruction: /compact Focus on code samples and API usage cho biết cần giữ gì khi tóm tắt.
  • Thêm hướng dẫn compact vào CLAUDE.md:
# Compact instructions
When you are using compact, please focus on test output and code changes

Sonnet xử lý tốt hầu hết task coding và rẻ hơn Opus. Dùng Opus cho quyết định kiến trúc phức tạp hoặc reasoning nhiều bước. Dùng /model để đổi model giữa session, hoặc đặt mặc định trong /config. Với subagent đơn giản, chỉ định model: haiku trong cấu hình subagent.

Định nghĩa tool MCP mặc định deferred - chỉ tên tool vào context cho tới khi Claude thực sự dùng tool đó. Chạy /context để xem gì đang chiếm chỗ. Ưu tiên CLI tool (gh, aws, gcloud…) khi có thể - tiết kiệm context hơn MCP server vì không có phần liệt kê tool. Chạy /mcp để tắt server không dùng tới.

Cài plugin code intelligence cho ngôn ngữ có kiểu tĩnh

Phần tiêu đề “Cài plugin code intelligence cho ngôn ngữ có kiểu tĩnh”

Plugin code intelligence cho Claude khả năng điều hướng symbol chính xác thay vì tìm kiếm dựa trên text, giảm số lần đọc file không cần thiết.

Hook tùy chỉnh có thể tiền xử lý dữ liệu trước khi Claude thấy nó - ví dụ một hook grep lỗi từ file log 10.000 dòng thay vì để Claude đọc toàn bộ. Một skill có thể cung cấp domain knowledge để Claude không cần khám phá lại từ đầu.

Ví dụ hook PreToolUse lọc output test chỉ giữ phần fail:

{
"hooks": {
"PreToolUse": [
{
"matcher": "Bash",
"hooks": [
{
"type": "command",
"command": "~/.claude/hooks/filter-test-output.sh"
}
]
}
]
}
}
#!/bin/bash
input=$(cat)
cmd=$(echo "$input" | jq -r '.tool_input.command')
if [[ "$cmd" =~ ^(npm test|pytest|go test) ]]; then
filtered_cmd="$cmd 2>&1 | grep -A 5 -E '(FAIL|ERROR|error:)' | head -100"
echo "{\"hookSpecificOutput\":{\"hookEventName\":\"PreToolUse\",\"permissionDecision\":\"allow\",\"updatedInput\":{\"command\":\"$filtered_cmd\"}}}"
else
echo "{}"
fi

CLAUDE.md được nạp vào context ngay từ đầu session. Nếu nó chứa hướng dẫn chi tiết cho workflow cụ thể (review PR, migrate database…), các token đó tồn tại kể cả khi bạn làm việc khác. Skill chỉ nạp khi được gọi - nên đưa hướng dẫn chuyên biệt vào skill giúp context cơ bản nhỏ hơn. Giữ CLAUDE.md dưới 200 dòng, chỉ gồm phần thiết yếu.

Extended thinking mặc định bật vì cải thiện đáng kể hiệu năng cho task planning/reasoning phức tạp. Token thinking tính phí như output token. Với task đơn giản, giảm chi phí bằng cách hạ effort level qua /effort, tắt thinking trong /config, hoặc hạ MAX_THINKING_TOKENS (với model có thinking budget cố định).

Chạy test, fetch documentation, xử lý log file có thể tốn nhiều context - giao cho subagent để output chi tiết ở lại context của subagent, chỉ tóm tắt trả về conversation chính.

Agent team dùng khoảng gấp 7 lần token so với session thường khi teammate chạy ở plan mode, vì mỗi teammate duy trì context window riêng.

Yêu cầu mơ hồ như “cải thiện codebase này” kích hoạt quét rộng. Yêu cầu cụ thể như “thêm input validation vào hàm login trong auth.ts” giúp Claude làm việc hiệu quả với ít lần đọc file hơn.

  • Dùng plan mode (Shift+Tab) cho task phức tạp - Claude khám phá codebase và đề xuất cách tiếp cận trước khi bạn duyệt.
  • Sửa hướng sớm: nhấn Escape để dừng ngay nếu Claude đi sai hướng; dùng /rewind hoặc double-tap Escape để khôi phục về checkpoint trước.
  • Cho tiêu chí kiểm chứng: kèm test case, screenshot, hoặc mô tả output mong muốn.
  • Test từng bước nhỏ: viết một file, test, rồi tiếp tục.

Claude Code dùng một ít token cho tác vụ nền ngay cả khi idle: tóm tắt conversation cũ (phục vụ claude --resume), và một số lệnh như /usage có thể tạo request kiểm tra trạng thái. Các tiến trình này thường tốn dưới $0.04/session.

  • Context dài: Claude Code gửi toàn bộ conversation ở mỗi request; dù dùng prompt caching, một câu hỏi ngắn trong session mở cả ngày vẫn tính usage cho toàn bộ lịch sử.
  • Cache miss: message đầu tiên sau khoảng nghỉ dài hơn cache lifetime (1 giờ với subscription, 5 phút khi dùng usage credit hoặc API key) sẽ miss cache và xử lý lại toàn bộ context.
  • Scheduled task: kích hoạt theo interval kể cả khi session idle, gửi toàn bộ context mỗi lần.
  • Agent teammate: mỗi teammate hoạt động tiếp tục tiêu tốn token cho tới khi thoát.
  • Compaction: /compact đọc toàn bộ conversation để tóm tắt, nên bản thân nó là một request lớn - /clear thì không tốn gì.

Claude Code thường xuyên có bản cập nhật có thể thay đổi cách tính năng hoạt động, kể cả cách báo cáo chi phí. Chạy claude --version để kiểm tra version hiện tại. Với câu hỏi billing cụ thể cho tài khoản, liên hệ Anthropic support qua in-product messenger (đăng nhập claude.ai hoặc platform.claude.com, chọn Get help).