返回软件首页 🔌

API设置台

AI 模型配置中心 — 集中管理所有 AI 接口,灵活切换,安全可控
功能介绍

API设置台是沙包国企党政通的 AI 模型配置中心。支持多供应商模型接入,一键测试连接,V2.0 模型路由自动选择最优模型,故障自动切换。支持完全本地部署,数据不出内网,满足国企信息安全要求。

支持完全本地部署(Ollama),数据不出内网
总体使用演示
API设置台 — AI 模型配置中心全流程 已上传
🌐
多供应商支持
支持 DeepSeek、智谱 GLM、通义千问、月之暗面 Kimi、Ollama(本地)五大供应商,灵活配置,按需切换。
🤖
DeepSeek
在线
性价比高,中文能力强,适合日常写作
🧠
智谱 GLM
在线
国产大模型,合规性好,政策敏感场景首选
☁️
通义千问
在线
阿里云生态,稳定性高,企业级服务
🌙
月之暗面 Kimi
在线
超长上下文,适合大文档处理,200万字无损
🏠
Ollama(本地)
本地
完全本地运行,数据不出内网,免费使用
🔄
V2.0 模型路由
智能路由引擎自动选择最优模型,支持故障自动切换。当当前模型不可用时,无缝切换到备用模型,保障业务连续性。
📊
健康检查与费用监控
实时检测各模型可用状态,显示当前模型调用费用,帮助用户合理控制成本。
💾
配置档案
保存多套配置方案,快速切换。适合不同场景(内网/外网、开发/生产)的快速切换。
本地模型配置指南

完全本地部署,数据不出内网。推荐使用 Ollama 部署本地模型,以下为适合本软件(国企党建公文写作)的模型推荐与配置方法。

📦
第一步:安装 Ollama
Ollama 是本地大模型运行框架,免费开源,支持 Windows / macOS / Linux。
  • 官网下载:https://ollama.com/download(Windows 版下载后双击安装即可)
  • 安装后打开命令行(CMD 或 PowerShell),输入 ollama --version 验证安装成功
  • Ollama 默认服务地址:http://localhost:11434
  • 安装后常驻后台,本软件通过该地址调用本地模型
🎯
第二步:拉取推荐模型
本软件以党建公文写作为主,推荐中文能力强、能本地运行的模型。按显卡显存选择:
  • 入门级(8GB 显存):qwen2.5:7b — 通义千问 7B,中文流畅,日常公文写作够用
  • 推荐级(16GB 显存):qwen2.5:14b — 中文综合最强,党建材料撰写首选
  • 推荐级(12GB 显存):glm4:9b — 智谱 GLM4,合规性好,政策敏感内容稳妥
  • 高配级(24GB+ 显存):qwen2.5:32b — 最强中文,长材料生成质量最高
  • 推理增强(16GB 显存):deepseek-r1:14b — 推理能力强,适合复杂材料分析与逻辑梳理
首选推荐:qwen2.5:14b(中文写作与党建材料综合表现最佳)

拉取命令(命令行执行,首次下载约 5~20GB,取决于模型大小):

ollama pull qwen2.5:14b
⚙️
第三步:在 API设置台 配置
模型拉取完成后,回到本软件 API设置台,按以下步骤接入:
  • 供应商选择:Ollama(本地)
  • Base URL:http://localhost:11434
  • 模型名称:qwen2.5:14b(与上面拉取的模型名一致)
  • API Key:本地模型无需填写,留空即可
  • 点击「测试连接」,显示绿色「在线」即配置成功,可开始使用
💻
显存与模型对照表
🥉
8GB 显存
入门
qwen2.5:7b / glm4:9b(量化版)
🥇
16GB 显存
推荐
qwen2.5:14b / glm4:9b / deepseek-r1:14b
💎
24GB+ 显存
高配
qwen2.5:32b / deepseek-r1:32b
🐌
无独显(纯 CPU)
较慢
qwen2.5:7b(可运行但速度较慢)
  • 显存查看:命令行输入 nvidia-smi 查看 GPU 显存
  • 模型切换:可拉取多个模型,在 API设置台 随时切换模型名称
  • 磁盘占用:每个模型约 5~20GB,建议预留 50GB 以上空间
企业集中部署方案

国企在单位服务器集中部署大模型,职工通过内网统一访问。一次部署,全员共用,数据不出企业,统一管控、统一计费、统一升级。

适合 30 人以上国企党委/党群部统一部署,职工无需各自配置模型
🏗️
方案架构
单位服务器部署大模型 → 内网开放 API → 职工电脑填服务器地址接入。
  • 服务器端:IT 部门在单位服务器安装 Ollama / vLLM,拉取模型,开放内网 API 端口
  • 职工端:打开 API设置台 → 供应商选 Ollama → Base URL 填服务器内网地址(如 http://10.0.0.100:11434)→ 填模型名 → 测试连接
  • 统一管控:IT 统一升级模型、统一监控用量、统一控制访问权限
  • 数据安全:所有请求在内网闭环,不连外网,满足涉密场景
🖥️
硬件配置推荐(按规模)
🏢
小型(30人以下)
入门
1 台服务器 + 1 张 RTX 4090(24GB)
跑 qwen2.5:14b / 32b
并发 3~5 人
🏭
中型(30~100人)
推荐
1 台服务器 + 2 张 RTX 4090 或 1 张 A100
跑 qwen2.5:32b / 72b
并发 10~20 人
🏛️
大型(100人+)
高配
多 GPU 服务器(4×A100 80GB)
跑 qwen2.5:72b 多实例
并发 50+ 人
💰
费用参考(自建 vs 云端 API)
自建一次投入硬件,长期省 API 费用;云端按量计费,重度使用成本高。以下为参考估算:
  • 小型自建:硬件 ¥2.5~3.5 万(含 1 张 RTX 4090)+ 年电费运维 ¥0.3~0.5 万
  • 中型自建:硬件 ¥6~10 万(含 2 张 4090 或 1 张 A100)+ 年电费运维 ¥0.5~1 万
  • 大型自建:硬件 ¥20 万+(多 A100 服务器)+ 年电费运维 ¥1~2 万
📊 云端 API 年费对比(以 50 人重度使用估算)
  • DeepSeek API:约 ¥2.5~10 万/年(按 token 用量,重度写作偏高)
  • 智谱 GLM / 通义千问:约 ¥3~12 万/年
  • 自建中型:硬件 ¥6~10 万(一次投入)+ 年运维 ¥0.5~1 万 → 2~3 年回本,之后每年省数万 API 费
结论:50 人以上、重度使用的国企,自建 2~3 年回本,长期更省;偶尔轻度使用可先用云端 API
📋
IT 部署步骤
  • ① 服务器装 Ollama:Linux / Windows Server 安装 Ollama,拉取模型(ollama pull qwen2.5:32b
  • ② 配置内网监听:设置环境变量 OLLAMA_HOST=0.0.0.0:11434,让内网可访问
  • ③ 开放防火墙端口:内网开放 11434 端口(仅内网,禁止外网)
  • ④ 职工配置:通知职工在 API设置台填服务器地址 + 模型名,测试连接即可使用
  • ⑤ 可选 vLLM:大并发场景用 vLLM 替代 Ollama,吞吐量更高(需 Docker + GPU 驱动)
典型场景
立即下载体验