Tôi Là Tùng
Quay lại Blog

Hạ cấp Claude Max 5x từ $100 xuống $20: Bức tranh chạy task xuyên đêm với DeepSeek Harness

Vì sao tôi hạ gói Claude Max 5x từ $100 xuống $20 để chuyển phần thực thi sang DeepSeek Harness (DSH)? Bức tranh vận hành task, ticket theo ca, 1,64 tỷ token và 21,47 USD chi phí DeepSeek, kèm các sự cố thật.

Hạ cấp Claude Max 5x từ $100 xuống $20: Bức tranh chạy task xuyên đêm với DeepSeek Harness | Tôi là Tùng, toilatung, Nguyễn Thanh Tùng, Tùng Sóc Sơn

Hạ cấp Claude Max 5x từ $100 xuống $20: Bức tranh chạy task xuyên đêm với DeepSeek Harness

TL;DR: Từ ngày 19/09/2026, tôi hạ gói Claude Max 5x ($100/tháng) xuống gói Pro plan ($20/tháng, Monthly — ngày 19/10/2026 tới đây là vừa tròn đúng 1 tháng hạ cấp). Claude giữ vai kiến trúc sư trưởng và người phản biện ban ngày. Toàn bộ phần thực thi được chuyển giao cho DeepSeek Harness (DSH) — hệ thống chạy ticket theo ca, tự hành xuyên đêm qua OpenRouter và DeepSeek API. Kết quả thực chứng gần 1 tháng: 1,64 tỷ token tiêu thụ, ví DeepSeek ghi nhận đúng 21,47 USD (khoảng 545.000 VNĐ từ 24/09 đến 09/10), và không còn ai phải ngồi gõ prompt canh chừng ca đêm.

DeepSeek Harness (DSH) là gì?

DeepSeek Harness (DSH) là kiến trúc đưa AI Agent từ mô hình hội thoại thủ công (human-in-the-chat) sang mô hình vận hành theo ca (shift-based autonomous engine). Ba trụ cột cốt lõi của DSH gồm: quản trị ticket nghiêm ngặt theo spec, cô lập hoàn toàn mã nguồn bằng Git Worktree, và phân tầng model kép (Dual-Engine) giữa tầng thợ cày giá rẻ với tầng thẩm định chất lượng cao.

Từ ngày 19/09/2026, tôi hạ gói Claude Max 5x ($100/tháng) xuống gói Pro plan ($20/tháng). Claude giữ vai kiến trúc sư và người phản biện ban ngày. Phần thực thi chuyển cho DeepSeek Harness (DSH): hệ thống chạy ticket theo ca, xuyên đêm, qua OpenRouter và DeepSeek API.

Kết quả 30 ngày gần nhất: 1,64 tỷ token qua OpenRouter. Ví DeepSeek ghi nhận 21,47 USD (từ ngày 24/09 đến 09/10). Tuyệt đối không có ai ngồi gõ prompt trong ca đêm.

Nếu bạn đang tìm cách thoát khỏi việc làm nô lệ cho cửa sổ chat để tiến tới tư duy Director Mindset khi làm việc với AI, đây là bản thiết kế chi tiết cùng những bài học thực chiến xương máu.

1. Vấn đề: Tôi đang làm thuê cho cửa sổ chat

Kịch bản này có thể bạn đã quá quen thuộc:

Bạn nâng lên gói thuê bao đắt nhất ($100 hoặc thậm chí $200/tháng) để làm việc "không giới hạn". Rồi bạn vẫn ngồi dán mắt trước terminal hoặc giao diện web, gõ từng câu lệnh, đọc từng dòng phản hồi, copy paste code qua lại. Sau vài tiếng tập trung cao độ, màn hình hiện thông báo đỏ: chạm trần hạn mức (rate limit). Bạn mệt mỏi đi ngủ lúc 23:00, và cỗ máy AI đắt đỏ cũng đi ngủ theo bạn.

Đó không phải là tự động hóa quy trình. Đó là ngồi canh AI.

Tôi nhận ra mình trả $100/tháng thực chất chỉ để mua thêm thời gian ngồi dán mắt trước màn hình, chứ không phải để mua đầu ra thực tế cho sản phẩm.

Câu hỏi cốt lõi mà một người làm hệ thống cần đặt ra không phải là "model nào mạnh nhất trên bảng xếp hạng?". Câu hỏi chuẩn xác phải là:

  • Công việc nào thực sự cần trí tuệ chiến lược của tôi và Claude?
  • Công việc nào bản chất chỉ là cày cuốc đúng quy trình kỹ thuật lặp đi lặp lại?

Khi trả lời thẳng thắn câu hỏi đó, bạn sẽ nhận ra việc dùng model top-tier đắt đỏ để format CSS hay viết unit test là một sự lãng phí tài nguyên khủng khiếp.

2. Reframe: Phân vai, không phân hạng model

Ngày 19/09/2026, tôi quyết định hạ gói Claude Max 5x từ $100 xuống gói Pro plan cơ bản. Ngày 19/10/2026 tới đây là vừa tròn đúng 1 tháng tôi vận hành mô hình này. Trạng thái thanh toán trên dashboard Claude hiển thị rõ:

Pro plan
Billing cycle: Monthly
Your subscription will auto renew on Oct 19, 2026.

Tôi không hề từ bỏ Claude. Tôi định nghĩa lại vai trò của nó trong chuỗi giá trị:

  • Claude Pro ($20/tháng): Kiến trúc sư trưởng và người phản biện chiến lược. Được sử dụng trong các phiên thảo luận chuyên sâu ban ngày: vẽ kiến trúc tổng thể, bóc tách module, chia ticket kỹ thuật, duyệt hướng đi và review rủi ro logic.
  • DeepSeek Harness (DSH): Đội ngũ thợ cày thực thi. Chuyên trách sửa lỗi cú pháp, chạy test suite, quét lint mã nguồn, di trú CSS, đồng bộ schema cơ sở dữ liệu — chạy hoàn toàn độc lập qua API theo từng ticket độc lập.

Tiết kiệm $80/tháng tiền thuê bao dịch vụ nghe có vẻ không lớn đối với một doanh nghiệp. Nhưng giá trị thật của bước chuyển đổi này nằm ở chỗ khác: Đầu ra của hệ thống không còn bị trói buộc vào số giờ tôi ngồi gõ phím.

Cỗ máy sản xuất tiếp tục chạy khi tôi rời khỏi bàn làm việc, tự kiểm tra mã nguồn, tự sửa lỗi cú pháp và tự đóng gói kết quả.

3. Framework: Một ngày làm việc chia thành 3 ca

Ca đêm tự hành kiểm chứng ticket qua Git Worktree và Quality Gate của DeepSeek Harness | Tôi là Tùng, toilatung, Nguyễn Thanh Tùng, Tùng Sóc Sơn

Tôi không quản lý AI như một con chatbot để tâm sự. Tôi quản lý AI như một ca trực kỹ thuật trong nhà máy sản xuất phần mềm:

Ca trựcKhung giờAi làmĐầu ra cụ thể
Ca ngàyGiờ hành chínhTùng + Claude ($20)Bản đặc tả kiến trúc (spec), danh sách ticket, phạm vi (scope) cô lập
Ca đêm23:00 → 05:45DSH tự hành (API)Code đã vượt qua các cổng kiểm chứng (Quality Gate) trên nhánh Git riêng
Ca sángSau 05:45Tùng (Reviewer)Đọc báo cáo tổng hợp, nghiệm thu merge code hoặc rollback bằng một lệnh

Cơ chế vận hành của ca đêm tự hành

Ca đêm chạy tự động theo kịch bản điều phối (orchestration script) với luồng kiểm soát nghiêm ngặt:

[ BÀN GIAO ] (Trước 23:00)
Gán nhãn ticket + xác định phạm vi (scope) trong bản spec
    │
    ▼
┌──────────────────────────────────────────────────────────────┐
│ CA ĐÊM DSH (23:00 → 05:45)                                   │
│ 1. Tạo Git Worktree riêng biệt (không đè lên nhánh main)      │
│ 2. Dispatch ticket qua Gateway (sandbox hệ điều hành)        │
│ 3. Dual-Engine: Model rẻ cày việc, model mạnh thẩm định     │
│ 4. Cổng nghiệm thu vật lý: tsc, eslint, npm test, build      │
│ 5. Fallback tự động nếu nhà cung cấp trả lỗi 429 / 503       │
└──────────────────────────────────────────────────────────────┘
    │
    ▼ (05:45)
[ MORNING OVERVIEW ]
reports/MORNING_OVERVIEW.md
- Danh sách việc đã hoàn thành
- Các lỗi phát sinh và log chi tiết
- Tỷ lệ vượt qua Quality Gate
- Mã lệnh rollback nhanh nếu cần

Mỗi buổi sáng thức dậy, tôi không bao giờ phải hỏi câu vô định "Đêm qua AI làm được gì rồi nhỉ?".

Tôi chỉ cần mở đúng một file báo cáo duy nhất và đọc bằng chứng định lượng: số lượng test đã pass, file nào đã sửa, bao nhiêu token đã dùng.

Mỗi ticket đều có mã định danh, phạm vi file được phép chạm vào, và ngân sách token tối đa. Một ticket chỉ được đánh dấu là hoàn thành khi trình biên dịch và bộ test xác nhận, tuyệt đối không phải khi AI tự nhận "tôi đã làm xong rồi". Đây chính là tư duy Zero Trust cho AI Agent: khi nào cần người duyệt mà tôi luôn áp dụng.

4. Case thật: 1,64 tỷ token, 21,47 USD chi phí

Kiến trúc Dual-Engine 97:3 và so sánh chi phí $21.47 USD thực tế với mô hình cũ | Tôi là Tùng, toilatung, Nguyễn Thanh Tùng, Tùng Sóc Sơn

Nhiều anh em kỹ sư và founder lo sợ rằng nếu thả AI chạy vòng lặp tự động xuyên đêm thì hóa đơn API cuối tháng sẽ bùng nổ không kiểm soát.

Dưới đây là số liệu thực tế được ghi nhận trong hệ thống của tôi trong 30 ngày qua:

  • Tổng token tiêu thụ qua OpenRouter (30 ngày): 1,64 tỷ token (1.64B), tăng trưởng +34.390% so với chu kỳ trước khi ứng dụng DSH.
  • Chi phí ví DeepSeek (24/09 – 09/10): Đúng 21,47 USD (tương đương khoảng 545.000 VNĐ).
    • deepseek-flash: $18,30 (chạy ròng rã suốt 15 ngày, chi phí trung bình chỉ ~$1,20/ngày).
    • deepseek-v4-pro: $3,17 (dùng để chạy kiểm thử các thuật toán nặng trong đợt tải ngày 07/10).
  • Chi phí OpenRouter điều phối: Khoảng $28,50 cho tầng router định tuyến và các model mã nguồn mở bổ trợ.

Bí quyết nằm ở tỷ lệ phân tầng tải 97 : 3

Hệ thống đạt được mức chi phí tối ưu này là nhờ áp dụng triệt để kiến trúc Dual-Engine System 1 & System 2 cho AI Agent:

  • ~96,9% khối lượng token thuộc về tầng "thợ cày": Gồm Space Bunny Alpha (1,06 tỷ token) và GLM 5.3 Flash (529 triệu token). Nhiệm vụ của tầng này là đọc log dài hàng nghìn dòng, phân tích cây cú pháp trừu tượng (AST), cào DOM, rà soát regex và chạy các vòng kiểm tra lặp lại.
  • ~3,1% khối lượng token thuộc về tầng "thẩm định": Gồm Gemini 3.8 Flash, GLM 5.3, và DeepSeek V4 Pro. Tầng này chỉ được gọi khi cần đưa ra quyết định kiến trúc then chốt hoặc duyệt Quality Gate trước khi commit.

Giá thành trung bình của toàn bộ hệ sinh thái rơi vào khoảng $0,013 – $0,02 trên mỗi 1 triệu token.

Lưu ý minh bạch dữ liệu: Con số 21,47 USD là số tiền trừ trực tiếp trên ví nạp trước của DeepSeek API. Con số 1,64 tỷ token là tổng lượng dữ liệu luân chuyển ghi nhận trên dashboard của OpenRouter. Do hai nguồn thanh toán và tính cước khác nhau, mức giá trung bình trên chỉ là ước tính tham khảo trên quy mô thực nghiệm của tôi.

5. Bốn bài học xương máu từ sự cố vận hành thật

Vận hành tự động hóa trong thực tế không bao giờ là màu hồng.

Báo cáo kiểm toán hệ thống ngày 06/10 (codebase-audit-2026-10-06) và ca đêm di trú giao diện ngày 07/10 (TVT-NIGHT-2026-10-07-DOT1) đã để lại cho tôi bốn bài học đắt giá.

Bài học 1: Model stealth có thể biến mất giữa chừng

Space Bunny Alpha gánh tới 64,6% tổng lượng tải xử lý trong tháng. Đột ngột một ngày, model thử nghiệm này dừng hoạt động trên OpenRouter. Nếu hệ thống hardcode cứng tên model trong mã nguồn, toàn bộ ca đêm sẽ chết đứng với mã lỗi HTTP 404 Model Not Found.

  • Giải pháp: Xây dựng chuỗi dự phòng ba chặng (fallback-runner.mjs): GLM 5.3 Flash → DeepSeek Flash → Gemini Flash. Khi một provider báo lỗi timeout hoặc 404, request lập tức trượt xuống model kế tiếp mà không làm đứt gãy tiến trình.

Bài học 2: Test mock pass 100% không có nghĩa là code an toàn

Ở đợt audit ngày 06/10 (phát hiện lỗi F01 và F02), plugin dsh-agent-factory-guard vượt qua toàn bộ unit test với tỷ lệ 100%. Tuy nhiên, khi đưa vào môi trường runtime thực tế, nó sập ngay ở tool đầu tiên do thiếu cấu trúc trường output: { schema, render }.

  • Quy tắc vàng: Cổng kiểm chứng Quality Gate bắt buộc phải chạy qua ToolRuntime thật trong sandbox cô lập, tuyệt đối không được tin tưởng vào các bộ dữ liệu giả lập (mock data).

Bài học 3: Sửa file live mà quên sửa generator

Trong ca đêm ngày 07/10, AI đã xuất sắc phát hiện ra 64 ký tự \" bất thường trong chuỗi echo của PHP khiến trình duyệt ngừng phân tích CSS giữa chừng (chết từ rule 55/89). Sửa xong, số rule hoạt động bình thường nhảy vọt lên 89.

Thế nhưng, AI đã sửa thẳng vào file sinh ra tvt-performance-optimizer.php mà bỏ quên script nguồn build_v11.10.0.py. Hậu quả là lần chạy build tiếp theo suýt nữa đã xóa sạch toàn bộ bản vá lỗi đó.

  • Quy tắc vàng: Generator first, never patch rendered output. Chỉ được phép sửa file nguồn phát sinh mã, sau đó chạy lệnh build để tái tạo artifact.

Bài học 4: Dặn dò bằng prompt thì yếu, khóa bằng hệ điều hành mới chắc

Câu lệnh "Hãy cẩn thận nhé, đừng sửa đè các file khác ngoài thư mục này" hoàn toàn vô dụng khi context window của AI bị trôi hoặc model gặp ảo giác.

Hàng rào bảo vệ thực sự phải là quyền ghi ở cấp độ hệ điều hành (read-only filesystem boundary). Agent chỉ được cấp quyền ghi vào duy nhất thư mục con thuộc phạm vi ticket mà nó được giao phó.

6. So sánh hai mô hình vận hành: Chat thủ công vs Kiến trúc DSH

Để thấy rõ sự khác biệt giữa việc trả tiền mua quyền chat và đầu tư vào một hệ thống tự hành, hãy xem bảng đối chiếu chi tiết:

Tiêu chí so sánhChat truyền thống (Claude Max $100/tháng)Kiến trúc DeepSeek Harness (DSH)
Mô hình chi phí$100/tháng cố định (dù dùng ít hay nhiều)$20/tháng (Claude Pro plan Monthly hạ từ 19/09, tròn 1 tháng vào Oct 19, 2026) + Chi phí API thực tế (DeepSeek: ~$21,47)
Hình thức tương tácCon người gõ từng prompt, đọc từng phản hồiLàm việc theo ca trực, tự hành qua Git Worktree
Thời gian làm việcGiới hạn theo phiên, đêm đến máy nghỉChạy bền bỉ xuyên đêm, không cần người túc trực
Kiểm soát mã nguồnDễ sửa đè vào nhánh chính, khó hoàn tácCô lập 100% trong Git Worktree, rollback trong 1 giây
Tiêu chuẩn nghiệm thuDựa vào lời khẳng định "tôi đã làm xong" của AICổng vật lý bắt buộc: tsc, eslint, npm test, hash check
Khả năng mở rộngBị giới hạn bởi thời gian sinh học của con ngườiMở rộng theo số lượng luồng (worker) song song

Nhận định thực tế: DSH không phải lúc nào cũng rẻ hơn cho mọi tình huống. Nó chỉ phát huy hiệu quả chi phí vượt trội khi khối lượng công việc lặp lại đủ lớn và quy trình kỹ thuật đủ rõ ràng để máy tự nghiệm thu. Những bài toán đòi hỏi sự phán đoán mơ hồ, tư duy thẩm mỹ hoặc hoạch định chiến lược vẫn hoàn toàn thuộc về con người và các model cao cấp.

7. Ba nguyên tắc cốt lõi nếu bạn muốn dựng cỗ máy tương tự

Nếu bạn là một tech founder, lập trình viên hay agency đang muốn giải phóng sức lao động bằng AI, hãy bắt đầu với 3 nguyên tắc này:

  1. Hạ gói chat, đầu tư vào API Gateway: Giữ gói subscription cơ bản ($20) để phục vụ việc tư duy và định hướng. Mở tài khoản API trả trước để chi trả đúng theo dung lượng thực dùng, nhìn thấy từng đồng chi phí trên dashboard thay vì trả tiền trọn gói rồi để lãng phí.
  2. Chuyển dịch từ prompt sang sandbox: Đừng cố viết một prompt dài 2.000 từ để dặn AI không được làm bậy. Hãy khóa quyền truy cập ở cấp độ hệ điều hành, cấp quyền đọc/ghi cô lập bằng Git Worktree và Docker sandbox.
  3. Quản trị bằng ticket và bằng chứng nghiệm thu vật lý: Mỗi đầu việc phải có mã định danh, phạm vi file, và ngân sách token tối đa. Một task chỉ được xem là hoàn thành khi trình biên dịch (compiler) và bộ test vật lý đóng dấu thông qua.

Tôi đang chủ động dịch chuyển từ cuộc đua "ai có câu prompt thần thánh hơn" sang "ai có môi trường vận hành vững chắc hơn". Tôi không dạy bạn cách dùng một công cụ rời rạc. Tôi xây dựng một hệ thống hoàn chỉnh mà ở đó các công cụ được đặt đúng vị trí của chúng.

Câu hỏi thường gặp (FAQ)

Tại sao bắt buộc dùng Git Worktree khi chạy AI Agent tự động?

Git Worktree cho phép AI Agent làm việc trên một thư mục tách biệt hoàn toàn gắn với một nhánh Git riêng, mà không làm ảnh hưởng đến mã nguồn bạn đang làm việc trên nhánh chính (main). Nếu Agent sinh code lỗi, bạn chỉ cần xóa thư mục worktree đó bằng một lệnh duy nhất (git worktree remove) mà không để lại bất kỳ rủi ro nào cho production.

DeepSeek Flash có thể thay thế hoàn toàn Claude trong việc viết code không?

Không. Với các tác vụ thực thi cụ thể như sửa lỗi cú pháp, chuẩn hóa CSS, tối ưu hàm, viết unit test, bóc tách JSON theo schema — DeepSeek Flash làm cực kỳ tốt với chi phí chỉ bằng 1/50. Nhưng đối với việc thiết kế kiến trúc hệ thống, phân rã bài toán lớn hoặc phản biện logic nghiệp vụ phức tạp, tôi vẫn bắt buộc sử dụng Claude, Gemini Pro hoặc DeepSeek R1 ở bước lập kế hoạch ban ngày.

Làm thế nào để kiểm soát chi phí không bị bùng nổ khi Agent chạy ca đêm?

Hệ thống DSH thiết lập 3 tầng chốt chặn chi phí:

  1. Giới hạn số lần thử lại (Self-healing retries): Tối đa 3 lần cho mỗi lỗi biên dịch. Nếu không sửa được, task tự động dừng và ghi log.
  2. Trần ngân sách token cứng (Token Budget): Mỗi ticket được gán một mức trần token tối đa (ví dụ 100.000 tokens). Vượt quá ngưỡng này, tiến trình lập tức bị ngắt.
  3. Cơ chế ngắt tự động (Circuit Breaker): Gửi thông báo khẩn qua Telegram webhook và dừng toàn bộ ca đêm nếu phát hiện vòng lặp vô tận.

Bước tiếp theo dành cho bạn

Bài viết được chia sẻ bởi Nguyễn Thanh Tùng — Founder, Tôi Là Tùng. Thực chiến xây dựng hệ thống AI cho doanh nghiệp Việt.

Lead Magnet Special Edition

Nhận Bộ Thư Viện Prompt & SOP AI Workflow Vận Hành Doanh Nghiệp 2026

Tặng miễn phí Ebook PDF + Notion Template quản lý AI System thực chiến từ Tôi Là Tùng. Gửi trực tiếp vào hòm thư công việc của bạn.

Bảo mật 100%• Nhận file PDF & Notion• Hủy đăng ký 1-Click
🎁 Miễn Phí 100%

Tặng File Cấu Hình AI Stack Tự Host (n8n + Flowise + pgvector)

Docker-compose sẵn dùng để tự dựng hạ tầng AI của riêng bạn trong vài phút — không cần trả phí SaaS hàng tháng.

Nguyễn Thanh Tùng — AI System Designer
Viết bởi Tùng
Nguyễn Thanh Tùng · AI Director