Tích hợp API Uncensored Local LLM
Tích hợp API Uncensored Local LLM bằng cách trỏ máy khách tương thích OpenAI của bạn vào endpoint được lưu trữ của chúng tôi. Bạn có cửa sổ ngữ cảnh 100k, hỗ trợ truyền phát và đầu ra mô hình thô mà không cần quản lý cơ sở hạ tầng GPU cục bộ.
- URL gốc
- https://api.uncensoredlocalllm.com/v1
- Mô hình
- không kiểm duyệt
URL cơ bản và Xác thực
API của chúng tôi tương thích hoàn toàn với các SDK của OpenAI. Bạn chỉ cần cập nhật base_url và cung cấp khóa API của bạn. Đăng ký trên trang Lấy khóa API để nhận khóa ngay lập tức. Không cần số điện thoại hay thẻ tín dụng để bắt đầu với tín dụng dùng thử. URL cơ bản là https://api.uncensoredlocalllm.com/v1. Hãy giữ khóa của bạn an toàn; bạn có thể tạo lại khóa bất cứ lúc nào, điều này sẽ thu hồi ngay lập tức khóa cũ. Điều này đảm bảo bạn luôn có một endpoint ổn định cho các ứng dụng của mình mà không cần quản lý việc suy luận cục bộ phức tạp.
Yêu cầu đầu tiên
Thực hiện yêu cầu API đầu tiên bằng công cụ HTTP mà bạn thích. Endpoint hỗ trợ định dạng chat-completions tiêu chuẩn. Dưới đây là ví dụ cURL minh họa một yêu cầu cơ bản. Thay thế YOUR_API_KEY bằng khóa thực tế của bạn. Yêu cầu này gửi một prompt và mong đợi phản hồi văn bản. ID mô hình là uncensored. Mô hình trọng số mở này được tinh chỉnh để trả lời mà không từ chối nội dung cho mục đích người lớn hợp pháp, cung cấp đầu ra trực tiếp cho trường hợp sử dụng của bạn.
curl https://api.uncensoredlocalllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Phản hồi sẽ chứa văn bản được tạo trong mảng choices. Nếu bạn gặp lỗi 401, khóa API của bạn không hợp lệ hoặc bị thiếu. Hãy đảm bảo bạn đang sử dụng base URL đúng và khóa của bạn chưa bị thu hồi sau khi tạo lại.
Tích hợp SDK Python
Sử dụng Python SDK chính thức của OpenAI để tích hợp nhanh chóng. Đặt base_url và api_key trong quá trình khởi tạo client của bạn. Cách tiếp cận này cho phép bạn sử dụng các phương thức quen thuộc như chat.completions.create(). SDK tự động xử lý việc tuần tự hóa JSON và các yêu cầu HTTP. Đây là lựa chọn lý tưởng cho các dịch vụ backend hoặc các tập lệnh cần xử lý lượng lớn văn bản. Hãy nhớ rằng ID mô hình vẫn là uncensored bất kể phiên bản SDK bạn sử dụng.
from openai import OpenAI
client = OpenAI(base_url="https://api.uncensoredlocalllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Phương pháp này hiệu quả cho việc xử lý hàng loạt hoặc khi bạn cần xử lý logic phản hồi trong Python. Hãy đảm bảo môi trường của bạn đã cài đặt gói openai. SDK hỗ trợ cả hoạt động đồng bộ và bất đồng bộ, phù hợp với nhiều nhu cầu kiến trúc khác nhau.
Tích hợp SDK Node.js
Đối với môi trường JavaScript hoặc TypeScript, SDK Node.js OpenAI cung cấp trải nghiệm tương tự. Khởi tạo máy khách với URL cơ bản và khóa API của bạn. Điều này đặc biệt hữu ích cho các ứng dụng web hoặc hàm không máy chủ. SDK trừu tượng hóa các chi tiết HTTP, cho phép bạn tập trung vào logic ứng dụng. Bạn có thể gọi endpoint hoàn tất với cùng cấu trúc như các dịch vụ tương thích OpenAI khác.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.uncensoredlocalllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Sử dụng tích hợp này cho giao diện web thời gian thực hoặc các dịch vụ vi mô Node.js. SDK hỗ trợ các mẫu promise và async/await, giúp xử lý lỗi trở nên đơn giản. Hãy đảm bảo bạn xử lý các lỗi mạng tiềm ẩn một cách tinh tế, đặc biệt là trong các hệ thống phân tán.
Phản hồi truyền phát
Bật truyền phát bằng cách đặt stream: true trong yêu cầu của bạn. Điều này cho phép bạn nhận các phản hồi từng phần khi chúng được tạo ra, cải thiện độ trễ cảm nhận được cho người dùng. API hỗ trợ Sự kiện gửi qua máy chủ (SSE) cho truyền phát. Điều này rất quan trọng cho các giao diện trò chuyện nơi phản hồi ngay lập tức là điều kiện tiên quyết. Truyền phát không ảnh hưởng đến chất lượng đầu ra của mô hình hoặc cửa sổ ngữ cảnh.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Xử lý các sự kiện luồng trong mã máy khách của bạn. Mỗi phần chứa một phần của phản hồi cuối cùng. Tổng hợp các phần này để tái tạo lại thông báo đầy đủ. Cách tiếp cận này hoạt động liền mạch với các SDK OpenAI trong cả Python và Node.js.
Giới hạn tốc độ, Lỗi và Cửa sổ ngữ cảnh
API áp dụng giới hạn 300 yêu cầu mỗi phút cho mỗi khóa. Kích thước tối đa của thân yêu cầu là 8 MB. Bạn sẽ nhận được lỗi 429 nếu vượt quá giới hạn tốc độ. Lỗi 402 cho biết tín dụng trả trước không đủ. Hãy đảm bảo bạn theo dõi mức sử dụng và nạp tiền vào tài khoản của mình qua bảng điều khiển. Tín dụng không bao giờ hết hạn, và bạn có thể thanh toán bằng tiền điện tử (USDT hoặc USDC).
Cửa sổ ngữ cảnh là 100.000 token, bao gồm cả prompt và phần hoàn thành. Điều này cho phép các cuộc hội thoại dài hoặc xử lý tài liệu lớn. Nếu bạn vượt quá giới hạn, API sẽ từ chối yêu cầu. ID mô hình là uncensored, và nó hỗ trợ gọi công cụ/hàm cho các khả năng mở rộng.
Thông số API
Toàn bộ giới hạn và tính năng thực tế của API ở một nơi — hãy kiểm tra trước khi nạp tiền.
| Mục | Giá trị |
|---|---|
| Định dạng | tương thích OpenAI: mọi SDK OpenAI đều chạy được, chỉ cần đổi base URL và khóa |
| ID mô hình | uncensored |
| Endpoint | POST /v1/chat/completions · GET /v1/models |
| Xác thực | Authorization: Bearer YOUR_KEY |
| Base URL | https://api.uncensoredlocalllm.com/v1 |
| Gọi hàm | có — tools, tool_choice; phản hồi có tool_calls, kể cả khi streaming; kết quả gửi lại bằng role: tool |
| Tham số | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Cửa sổ ngữ cảnh | 100.000 token (đầu vào + đầu ra) |
| Đầu ra tối đa | tối đa phần còn lại của cửa sổ 100.000 token; max_tokens tùy chọn (không giới hạn riêng) |
| Chế độ JSON | response_format: {"type": "json_object"} |
| Streaming | có — server-sent events; phần cuối chứa lượng token đã dùng |
| Kích thước yêu cầu | tối đa 8 MB |
| Header phản hồi | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Yêu cầu đồng thời | tối đa 8 cùng lúc cho mỗi khóa |
| Giới hạn tốc độ | 300 yêu cầu mỗi phút cho mỗi khóa |
| Thưởng | +5% từ $50, +10% từ $100 |
| Nạp tiền | USDT (TRC20) hoặc USDC (Base), số tiền nguyên bất kỳ từ $10 đến $500 |
| Giá | $0,25 cho 1 triệu token đầu vào · $1,00 cho 1 triệu token đầu ra |
| Dùng thử miễn phí | $0,50 trong 7 ngày, không cần thẻ · Khóa dùng thử: 2 yêu cầu song song, 60 yêu cầu/phút; hạn mức đầy đủ (8 và 300) sau lần nạp đầu |
| Tính phí | tín dụng trả trước theo mức dùng thực tế; lỗi và từ chối miễn phí |
| Thời hạn | tín dụng đã trả không hết hạn, không đăng ký định kỳ |
| Đăng nhập | Google hoặc email và mật khẩu |
| Khóa | mỗi tài khoản một khóa đang hoạt động; khóa mới thay thế khóa cũ |
| Nội dung | cho phép nội dung người lớn; từ chối nội dung tình dục liên quan đến trẻ vị thành niên |
Mã lỗi
Lỗi trả về dạng JSON với type cố định; yêu cầu lỗi hoặc bị từ chối không bị tính phí.
| Mã | Loại | Ý nghĩa |
|---|---|---|
400 | bad_request | JSON sai, tin nhắn trống, tham số sai hoặc vượt cửa sổ ngữ cảnh |
401 | missing_key · invalid_key · key_revoked | thiếu khóa, sai khóa hoặc khóa đã bị thay |
402 | no_credit | hết tín dụng — nạp tiền là dùng tiếp ngay |
403 | content_blocked | nội dung tình dục liên quan trẻ vị thành niên — từ chối, không tính phí |
404 | not_found | endpoint không tồn tại |
413 | request_too_large | nội dung lớn hơn 8 MB |
429 | rate_limited · concurrency | vượt 300/phút hoặc 8 đồng thời — chờ rồi thử lại |
503 | upstream_busy | mô hình đang bận — thử lại sau vài giây |
Hỏi đáp
Kích thước cửa sổ ngữ cảnh là bao nhiêu?
API hỗ trợ cửa sổ ngữ cảnh 100.000 token, bao gồm cả prompt đầu vào và kết quả đầu ra. Điều này cho phép các cuộc hội thoại dài hoặc xử lý tài liệu lớn trong một yêu cầu.
Tôi xử lý phản hồi truyền phát như thế nào?
Đặt <code>stream: true</code> trong yêu cầu của bạn để nhận Sự kiện gửi bởi máy chủ (SSE). Các SDK OpenAI trong Python và Node.js xử lý truyền phát tự động khi cờ này được bật. Sau đó, bạn có thể xử lý từng phần khi chúng đến.
Điều gì xảy ra nếu tôi hết tín dụng?
Bạn sẽ nhận được lỗi <code>402</code> cho biết không còn tín dụng. Bạn có thể nạp tiền vào tài khoản của mình với số tiền tối thiểu là $10 bằng tiền điện tử (USDT hoặc USDC). Tín dụng không bao giờ hết hạn và tiền thưởng được áp dụng cho các lần nạp lớn hơn.
uncensoredlocalllm.com
Khóa của bạn chỉ cách một biểu mẫu
Tạo tài khoản, sao chép khóa, thay đổi URL cơ bản. Đó là toàn bộ thiết lập.