Integriere die Uncensored Local LLM API
Integriere die Uncensored Local LLM API, indem du deinen OpenAI-kompatiblen Client auf unseren Endpunkt richtest. Du erhältst ein Kontextfenster mit 100k Token, Streaming-Unterstützung und rohe Modellausgaben, ohne lokale GPU-Infrastruktur verwalten zu müssen.
- Base-URL
- https://api.uncensoredlocalllm.com/v1
- Modell
- unzensiert
Base URL und Authentifizierung
Unsere API ist vollständig mit den OpenAI-SDKs kompatibel. Du musst nur die base_url anpassen und deinen API-Schlüssel angeben. Registriere dich auf der API-Schlüssel erhalten-Seite, um deinen Schlüssel sofort zu erhalten. Es wird keine Telefonnummer oder Kreditkarte benötigt, um mit dem Testguthaben zu starten. Die Base URL ist https://api.uncensoredlocalllm.com/v1. Bewahre deinen Schlüssel sicher auf; du kannst ihn jederzeit neu generieren, wodurch der alte sofort ungültig wird. So hast du immer einen einzigen, stabilen Endpunkt für deine Anwendungen, ohne die Komplexität des lokalen Inferenz-Managements.
Erste Anfrage
Führe deinen ersten API-Aufruf mit deinem bevorzugten HTTP-Client durch. Der Endpunkt unterstützt das Standardformat chat-completions. Unten findest du ein cURL-Beispiel für eine grundlegende Anfrage. Ersetze YOUR_API_KEY durch deinen tatsächlichen Schlüssel. Diese Anfrage sendet einen Prompt und erwartet eine Textantwort. Die Modell-ID ist uncensored. Dieses Open-Weight-Modell ist darauf ausgelegt, ohne Inhaltsfilter für die rechtmäßige Nutzung durch Erwachsene zu antworten und liefert direkte Ausgaben für deinen Anwendungsfall.
curl https://api.uncensoredlocalllm.com/v1/chat/completions \
-H "Authorization: Bearer $API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "uncensored",
"messages": [{"role": "user", "content": "Write a blunt product review of a cheap VPN."}]
}'
Die Antwort enthält den generierten Text im choices-Array. Tritt ein 401-Fehler auf, ist dein API-Schlüssel ungültig oder fehlt. Stelle sicher, dass du die korrekte Base URL verwendest und dein Schlüssel nach der Regeneration nicht widerrufen wurde.
Python SDK-Integration
Verwende das offizielle OpenAI Python SDK für eine schnelle Integration. Setze die base_url und api_key bei der Client-Initialisierung. Dieser Ansatz ermöglicht es dir, vertraute Methoden wie chat.completions.create() zu verwenden. Das SDK übernimmt die JSON-Serialisierung und HTTP-Anfragen automatisch. Dies ist ideal für Backend-Dienste oder Skripte, die große Textmengen verarbeiten müssen. Denke daran, dass die Modell-ID unabhängig von der verwendeten SDK-Version immer uncensored bleibt.
from openai import OpenAI
client = OpenAI(base_url="https://api.uncensoredlocalllm.com/v1", api_key="YOUR_KEY")
resp = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Summarise this thread without softening it."}],
)
print(resp.choices[0].message.content)
Diese Methode ist effizient für die Batch-Verarbeitung oder wenn du die Antwortlogik in Python verarbeiten musst. Stelle sicher, dass das openai-Paket in deiner Umgebung installiert ist. Das SDK unterstützt sowohl synchrone als auch asynchrone Vorgänge und passt sich verschiedenen Architekturbedürfnissen an.
Node SDK-Integration
Für JavaScript- oder TypeScript-Umgebungen bietet das OpenAI Node SDK eine ähnliche Erfahrung. Initialisiere den Client mit deiner Basis-URL und deinem API-Schlüssel. Dies ist besonders nützlich für Webanwendungen oder serverlose Funktionen. Das SDK abstrahiert die HTTP-Details, sodass du dich auf die Anwendungslogik konzentrieren kannst. Du kannst den Completions-Endpunkt mit der gleichen Struktur wie bei anderen OpenAI-kompatiblen Diensten aufrufen.
import OpenAI from "openai";
const client = new OpenAI({ baseURL: "https://api.uncensoredlocalllm.com/v1", apiKey: process.env.API_KEY });
const resp = await client.chat.completions.create({
model: "uncensored",
messages: [{ role: "user", content: "Draft a villain monologue for my game." }],
});
console.log(resp.choices[0].message.content);
Verwende diese Integration für Echtzeit-Webinterfaces oder Node.js-Mikrodienste. Das SDK unterstützt Promises und async/await-Muster, was die Fehlerbehandlung einfach macht. Stelle sicher, dass du potenzielle Netzwerkfehler angemessen behandelst, insbesondere in verteilten Systemen.
Streaming-Antworten
Aktiviere das Streaming, indem du stream: true in deiner Anfrage festlegst. Dies ermöglicht dir, teilweise Antworten zu erhalten, während sie generiert werden, und verbessert die wahrgenommene Latenz für Benutzer. Die API unterstützt Server-Sent Events (SSE) für das Streaming. Dies ist entscheidend für Chat-Schnittstellen, bei denen sofortiges Feedback erwartet wird. Das Streaming beeinflusst nicht die Ausgabequalität des Modells oder das Kontextfenster.
stream = client.chat.completions.create(
model="uncensored",
messages=[{"role": "user", "content": "Tell the story in second person."}],
stream=True,
)
for chunk in stream:
if chunk.choices and chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
Verarbeite die Stream-Ereignisse in deinem Client-Code. Jeder Chunk enthält einen Teil der endgültigen Antwort. Aggregate diese Chunks, um die vollständige Nachricht wiederherzustellen. Dieser Ansatz funktioniert nahtlos mit den OpenAI SDKs für Python und Node.js.
Ratenlimits, Fehler und Kontextfenster
Die API begrenzt die Anzahl auf 300 Anfragen pro Minute pro Schlüssel. Die maximale Größe des Anfragekörpers beträgt 8 MB. Wenn du das Ratenlimit überschreitest, erhältst du einen 429-Fehler. Ein 402-Fehler zeigt unzureichendes Prepaid-Guthaben an. Stelle sicher, dass du deine Nutzung über das Dashboard überwachst und dein Konto auflädst. Guthaben verfällt nie, und du kannst per Krypto (USDT oder USDC) bezahlen.
Das Kontextfenster umfasst 100.000 Token, sowohl für den Prompt als auch für die Completion. Dies ermöglicht umfangreiche Gespräche oder die Verarbeitung großer Dokumente. Wenn du das Limit überschreitest, lehnt die API die Anfrage ab. Die Modell-ID ist uncensored, und es unterstützt Function Calling für erweiterte Funktionen.
Fragen und Antworten
Wie groß ist das Kontextfenster?
Die API unterstützt ein Kontextfenster mit 100.000 Token, das sowohl den Eingabe-Prompt als auch die Ausgabe umfasst. Dies ermöglicht umfangreiche Gespräche oder die Verarbeitung großer Dokumente in einer einzigen Anfrage.
Wie handhabe ich Streaming-Antworten?
Setze <code>stream: true</code> in deiner Anfrage, um Server-Sent Events (SSE) zu erhalten. Die OpenAI SDKs für Python und Node.js verarbeiten das Streaming automatisch, wenn dieses Flag aktiviert ist. Du kannst dann jeden Chunk verarbeiten, sobald er eingeht.
Was passiert, wenn mein Guthaben aufgebraucht ist?
Du erhältst einen <code>402</code>-Fehler, der anzeigt, dass kein Guthaben verfügbar ist. Du kannst dein Konto mit mindestens 10 $ per Krypto (USDT oder USDC) aufladen. Guthaben verfällt nie, und bei größeren Aufladungen werden Boni gutgeschrieben.
uncensoredlocalllm.com
Dein Schlüssel ist nur ein Formular entfernt
Erstelle ein Konto, kopiere den Schlüssel, ändere die Basis-URL. Das ist die gesamte Einrichtung.
API-Spezifikation
Alle echten Grenzen und Funktionen der API auf einen Blick – prüfe sie, bevor du Guthaben kaufst.
| Merkmal | Wert |
|---|---|
| API-Format | OpenAI-kompatibel: jedes OpenAI-SDK funktioniert – nur Base-URL und Schlüssel ändern |
| Modell-ID | uncensored |
| Endpunkte | POST /v1/chat/completions · GET /v1/models |
| Authentifizierung | Authorization: Bearer YOUR_KEY |
| Base-URL | https://api.uncensoredlocalllm.com/v1 |
| Function Calling | ja – tools, tool_choice; Antworten mit tool_calls, auch im Stream; Ergebnisse als role: tool |
| Parameter | temperature, top_p, stop, seed, presence_penalty, frequency_penalty |
| Kontextfenster | 100.000 Tokens (Eingabe + Ausgabe) |
| Max. Ausgabe | bis zum Rest des 100.000-Token-Fensters; max_tokens optional (kein separates Limit) |
| JSON-Modus | response_format: {"type": "json_object"} |
| Streaming | ja – Server-Sent Events, der letzte Chunk enthält die Token-Nutzung |
| Anfragegröße | bis 8 MB |
| Antwort-Header | X-Request-Id, X-Balance-USD, X-RateLimit-Limit-Requests, X-RateLimit-Limit-Concurrency |
| Parallelität | 8 gleichzeitige Anfragen pro Schlüssel |
| Ratenlimit | 300 Anfragen pro Minute und Schlüssel |
| Bonus | +5 % ab $50, +10 % ab $100 |
| Aufladen | USDT (TRC20) oder USDC (Base), jeder ganze Betrag von $10 bis $500 |
| Preis | $0,25 pro 1 Mio. Eingabe-Tokens · $1,00 pro 1 Mio. Ausgabe-Tokens |
| Testguthaben | $0,50 für 7 Tage, ohne Karte · Testschlüssel: 2 parallele Anfragen, 60 pro Minute; volle Limits (8 und 300) nach erster Aufladung |
| Abrechnung | Prepaid-Guthaben nach echter Nutzung; Fehler und Ablehnungen sind kostenlos |
| Gültigkeit | bezahltes Guthaben verfällt nie, kein Abo |
| Anmeldung | Google oder E-Mail und Passwort |
| Schlüssel | ein aktiver Schlüssel pro Konto; ein neuer ersetzt den alten |
| Inhalte | Inhalte für Erwachsene erlaubt; sexuelle Inhalte mit Minderjährigen werden abgelehnt |
Fehler und Lösungen
Fehler kommen als JSON mit festem type; fehlgeschlagene oder abgelehnte Anfragen kosten nichts.
| Code | Typ | Bedeutung |
|---|---|---|
400 | bad_request | ungültiges JSON, leere Nachrichten, falscher Parameter oder Kontext zu lang |
401 | missing_key · invalid_key · key_revoked | Schlüssel fehlt, ist falsch oder wurde ersetzt |
402 | no_credit | kein Guthaben – aufladen, dann geht es sofort weiter |
403 | content_blocked | sexuelle Inhalte mit Minderjährigen – abgelehnt, nicht berechnet |
404 | not_found | unbekannter Endpunkt |
413 | request_too_large | Anfrage größer als 8 MB |
429 | rate_limited · concurrency | über 300/Min. oder 8 parallel – kurz warten |
503 | upstream_busy | Modell ausgelastet – in Sekunden erneut versuchen |