Bộ nhớ đệm prompt

Prompt Caching cho phép lưu vào bộ nhớ đệm các tiền tố prompt được sử dụng lặp lại, giảm mức tiêu thụ token và độ trễ phản hồi.

Nguyên lý hoạt động#

Khi yêu cầu của bạn chứa system prompt hoặc thông tin ngữ cảnh dài, được sử dụng lặp lại:

  • Yêu cầu đầu tiên — xử lý đầy đủ tất cả token và lưu tiền tố prompt vào bộ nhớ đệm
  • Yêu cầu tiếp theo — khi trúng bộ nhớ đệm, các token thuộc phần đã lưu sẽ không bị tính phí lặp lại
  • Bộ nhớ đệm hết hạn — bộ nhớ đệm có một TTL nhất định (thường 5-10 phút), sau khi hết hạn cần lưu lại

Hỗ trợ bộ nhớ đệm#

Tài nguyên mô hình của 诺玛AI được cung cấp bởi các nhà cung cấp đám mây chính thức của mô hình như AWS Bedrock, Azure OpenAI, Google Cloud, Alibaba Cloud, Volcano Cloud. Các mô hình mà nhà cung cấp đám mây hỗ trợ Prompt Caching thì 诺玛AI cũng hỗ trợ.

Nhà cung cấp đám mây

Mô hình tiêu biểu

Cơ chế bộ nhớ đệm

AWS Bedrock

Dòng Claude

Prompt Caching gốc

Azure OpenAI

Dòng GPT-4o

Tự động lưu đệm

Google Cloud

Dòng Gemini

Context Caching

Alibaba Cloud

Dòng Qwen

Lưu đệm phía nền tảng

Volcano Cloud

Dòng Doubao

Lưu đệm phía nền tảng

Tình hình hỗ trợ bộ nhớ đệm của từng mô hình cụ thể căn cứ theo tài liệu chính thức của mỗi nhà cung cấp đám mây. 诺玛AI sẽ truyền thẳng các tham số liên quan đến bộ nhớ đệm, không cần cấu hình thêm.

Cách sử dụng#

Giao thức OpenAI

Prompt Caching của các mô hình OpenAI là tự động — tự động kích hoạt khi phát hiện tiền tố prompt lặp lại:

# system prompt dài sẽ được tự động lưu vào bộ nhớ đệm
SYSTEM_PROMPT = """Bạn là trợ lý hỗ trợ kỹ thuật của 诺玛AI.

Dưới đây là thông tin sản phẩm bạn cần biết:
- 诺玛AI là một LLM Gateway, hỗ trợ nhiều mô hình lớn phổ biến
- Hỗ trợ ba giao thức lớn OpenAI / Anthropic / Gemini
- ...
(lược bớt thêm các kiến thức về sản phẩm)
"""

# Yêu cầu lần thứ nhất: lưu system prompt vào bộ nhớ đệm
response1 = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[
        {"role": "system", "content": SYSTEM_PROMPT},
        {"role": "user", "content": "诺玛AI hỗ trợ những mô hình nào?"}
    ]
)

# Yêu cầu lần thứ hai: trúng bộ nhớ đệm, nhanh hơn và rẻ hơn
response2 = client.chat.completions.create(
    model="openai/gpt-4o",
    messages=[
        {"role": "system", "content": SYSTEM_PROMPT},  # Trúng bộ nhớ đệm
        {"role": "user", "content": "Làm thế nào để cấu hình công cụ phát triển?"}
    ]
)

Giao thức Anthropic

Các mô hình Anthropic hỗ trợ cache control tường minh:

Tiết kiệm chi phí#

Sau khi trúng bộ nhớ đệm, các token thuộc phần đã lưu được tính phí với mức giá thấp hơn, tỷ lệ tiết kiệm khác nhau tùy theo mô hình:

  • Dòng Anthropic Claude — trúng bộ nhớ đệm có thể tiết kiệm khoảng 90% chi phí đầu vào
  • Dòng OpenAI GPT — trúng bộ nhớ đệm có thể tiết kiệm khoảng 50% chi phí đầu vào
  • Dòng Google Gemini — trúng bộ nhớ đệm có thể tiết kiệm khoảng 50-75% chi phí đầu vào

Tỷ lệ tiết kiệm thực tế phụ thuộc vào tỷ lệ trúng bộ nhớ đệm và chính sách tính phí của từng nhà cung cấp đám mây, vui lòng tham khảo thống kê mức sử dụng trong bảng điều khiển 诺玛AI để xem chi tiết.

Thực hành tốt nhất#

  • Đặt văn bản dài lên đầu — các phần không thay đổi như system prompt, nội dung cơ sở tri thức nên đặt ở đầu messages
  • Giữ tiền tố nhất quán — chỉ tiền tố hoàn toàn giống nhau mới có thể trúng bộ nhớ đệm
  • Thiết kế cấu trúc prompt hợp lý — tách phần cố định và phần thay đổi
# ✅ Thiết kế tốt: nội dung cố định ở trước, nội dung thay đổi ở sau
messages = [
    {"role": "system", "content": LONG_STATIC_PROMPT},   # Có thể lưu đệm
    {"role": "user", "content": dynamic_question}          # Phần thay đổi
]

# ❌ Thiết kế không tốt: nội dung thay đổi xen lẫn trong nội dung cố định
messages = [
    {"role": "system", "content": f"Today is {date}. {LONG_PROMPT}"}  # Mỗi ngày khác nhau, không thể lưu đệm
]

Việc trúng bộ nhớ đệm có thể xem trong trường `usage` của phản hồi API, hoặc xem tỷ lệ trúng bộ nhớ đệm trong thống kê mức sử dụng của bảng điều khiển 诺玛AI.

Cập nhật lần cuối vào 23 tháng 6, 2026