中文 ▾
获取 API 密钥

uncensoredlocalllm.com指南

无审查 LLM 聊天集成终极指南

无审查 LLM 聊天提供原始、无过滤的模型输出,没有标准商业 API 中常见的内容护栏。通过使用托管接口,您可以绕过本地推理的硬件和基础设施复杂性,同时保留成人、研究或虚构用例的完整创作和上下文自由度。

更新于

要点

  • 无审查模型不会基于任意企业政策拒绝合法的成人、争议性或安全研究主题。
  • 托管 API 消除了对昂贵 GPU 和 VRAM 管理的需求,同时提供稳定的 OpenAI 兼容接口。
  • 我们的服务提供 100k 上下文窗口、流式输出支持,以及按用量透明计价的工具调用功能。
  • 无需信用卡即可立即获得免费试用额度,让您在投入资金前验证模型行为。

理解无审查与有审查模型

标准大语言模型通过来自人类反馈的强化学习 (RLHF) 进行训练,以使输出符合企业安全政策。此过程引入了“审查”,即模型拒绝回答关于争议性话题的问题,对暴力内容生成更柔和的描述,或在内容具有上下文相关性时阻止成人内容。无审查 llm去除了这些对齐层,允许基础模型完全基于其训练数据和提示词指令生成文本。这导致对用户意图的保真度更高,特别是在创意写作、角色扮演或技术分析中,细微差别通常在安全过滤中丢失。

权衡在于模型可能会产生更原始、未打磨或尖锐的内容。这并不意味着模型损坏;而是意味着它没有受到人为限制。对于构建由最终用户控制上下文的开发人员来说,这种原始能力通常优于有审查替代方案的通用礼貌。

无审查 LLM 聊天的优势

使用无审查的 LLM 聊天接口对于内容限制影响实用性的用例至关重要。考虑一个为成人受众测试应用的开发者:经过审查的模型可能会拒绝生成简单的浪漫场景,从而破坏用户体验。同样,在安全研究中,无审查模型在识别漏洞时表现更好,不会因安全过滤器而对其答案进行保留。对于创意作家而言,能够生成直白或非传统的叙事,而无需提示模型“小心”,可以节省大量时间和 token 使用量。

此外,无审查模型通常更忠实地遵循复杂指令。由于它们不倾向于给出“安全”或“平衡”的答案,它们可以更有效地采用特定角色或语调风格。这使得它们非常适合需要保持一致角色且不会在话题变得稍微不寻常时陷入企业套话的聊天机器人。

本地与托管:硬件权衡

在本地运行无审查模型可为您提供完全的隐私保护和无持续成本,但需要大量的硬件投资。您需要具有充足显存的 GPU 来加载大型模型(例如 7B 到 70B 参数)。管理过程包括下载权重、配置 Ollama 或 vLLM 等推理引擎,以及处理可能导致您的设置失效的更新。如果您的互联网中断或硬件故障,您的服务将停止。

托管服务提供了不同的权衡:便利性和稳定性,但需按 token 成本付费。通过使用托管接口,您可以将硬件负担转移给提供商。您将获得一致的性能水平、24/7 可用性,且无需管理驱动程序或 CUDA 版本。对于许多开发人员而言,在任何具有互联网访问的设备上启动聊天接口的能力超过了本地推理的节省,尤其是在处理可变流量负载时。

如何集成无审查 LLM 聊天 API

如果 API 遵循 OpenAI 标准,集成非常简单。我们的接口接受标准的 chat-completions 请求,这意味着您可以使用现有的 SDK 和客户端库。您只需将 base URL 更新为我们的托管服务并提供 API 密钥即可。模型 ID 通常设置为“uncensored”,以确保您连接到正确的推理引擎。

  • 接口: POST /v1/chat/completions
  • Base URL: https://api.uncensoredlocalllm.com/v1
  • 模型: "uncensored"

这种方法允许您通过更改应用程序代码中的单个配置变量在审查和无审查模型之间切换。它支持同步响应和流式输出,使构建响应式聊天界面变得容易。

流式响应以改善用户体验

在构建聊天界面时,延迟是一个关键因素。等待整个响应生成后再显示它可能会感觉迟钝,尤其是在大上下文窗口下。流式输出允许您显示正在生成的 token,从而提高您应用程序的感知性能。我们的 API 支持服务器发送事件 (SSE) 进行流式输出,这与大多数现代 JavaScript 和 Python SDK 兼容。

流式输出对于无审查模型特别有用,因为它们可能会生成更长、更详细的响应。通过实时显示 token,您可以让用户保持参与,并允许他们在模型开始偏离主题时停止生成。这是高质量聊天实现中的标准功能,可确保流畅的用户体验。

无审查聊天中的上下文窗口处理

上下文窗口大小决定了模型可以记住多少对话历史。更大的上下文窗口允许更深、更连贯的对话,并更好地处理长文档或代码库。我们的服务提供100,000 token 上下文窗口,这比一些基本 API 中常见的标准 8k 或 32k 限制大得多。

这种容量对于无审查聊天应用程序至关重要,用户可能会参与长而细微的角色扮演或粘贴大量代码片段。它确保模型保留对话的完整上下文,减少其“忘记”早期指令或细节的可能性。在设计应用程序时,请考虑如何管理内存:虽然 API 处理大窗口,但您的客户端仍应有效结构提示词以避免不必要的 token 使用。

内容限制与成人用例

虽然模型是无审查的,但并非完全没有局限。主要限制是针对未成年人的性内容,这被阻止以符合一般内容标准。否则,如果提示,模型将生成成人内容、暴力或争议性观点。这使其适合 NSFW llm 应用程序、成人角色扮演和无限制的故事讲述。

对于开发人员来说,这意味着您不需要为大多数成人内容构建自己的审核层。您可以依赖模型的基础行为。但是,如果您需要特定的内容过滤器(例如,仅阻止血腥但允许性内容),您可能需要实施后处理或使用提示工程来引导模型。关键优势是基础模型不会任意拒绝这些主题。

隐私与数据使用

使用基于云的 LLM 时,隐私是一个主要问题。一些提供商使用您的提示词来训练他们的模型,这意味着您的数据可能被用于改进他们的商业产品。我们的服务确保提示词不用于训练。这对于希望保持对话数据专有的企业或个人至关重要。

此外,我们的注册过程只需要电子邮件和密码,无需电话号码或信用卡即可进行试用。这减少了您共享的个人数据量。虽然我们托管推理,但我们不声称对您输出的所有权。这种透明度允许您自信地将 API 集成到您的工作流程中,知道您的数据仅用于生成响应。

问答

无审查模型与无过滤模型有什么区别?

无审查模型通常会移除 RLHF 对齐层,使其能够根据企业安全政策而不拒绝回答问题。Unfiltered 可能指未经指令微调的模型,但这两个术语通常都意味着没有内容限制。我们的模型经过调整,可以在遵循指令的同时不拒绝回答。

无审查模型支持函数调用吗?

是的,我们的 API 支持工具/函数调用。这允许您将模型集成到需要与外部 API、数据库或计算器交互的应用程序中。该功能通过标准的 chat-completions 接口提供。

定价机制是怎样的?

我们采用按量付费模式,使用预付额度。成本为每 1M 输入 token $0.25,每 1M 输出 token $1.00。没有月费,且未使用的额度不会过期。您可以从 $10 起充值,充值金额越大,奖励越多。

我可以将其用于 NSFW 内容吗?

是的,该模型专为处理成人内容而设计,不会拒绝合法的 NSFW 主题。唯一的硬性限制是针对未成年人的性内容。这使其非常适合成人聊天机器人、角色扮演和创意写作。

uncensoredlocalllm.com

只差一张表单,即可获得密钥

创建账户,复制密钥,更改基础 URL。这就是全部设置。