Files
GarminHealthLab/backend/config.py
ericwyuan 8882bf44a4 [阶段4.3] 接入自建 AI 网关,修复多模型层的四个真实缺陷
改用甲骨文机上已有的 ai-gateway (129.146.203.203:5100):它本身就
OpenAI 兼容,内部串联 nvidia/gemini/ollama 并轮换 4 个 Gemini key,
比在客户端自己串联更能吸收单厂商的配额和超时。回包里的 provider
字段透传为 meta.upstream,网关侧发生降级时前端也看得见。

fix(ai): 目录里两个 NVIDIA 模型 id 根本不存在
- qwen/qwen2.5-72b-instruct 和 deepseek-ai/deepseek-r1 是我凭印象写的,
  实际 GET /v1/models 里没有,调用一律 404
- 改为该账号清单里确实存在的 nemotron-49b / mistral-large,
  并在注释里写明 id 必须取自实时清单、不能猜

fix(ai): 请求被本机代理劫持导致网关不可达
- requests 默认读 HTTP_PROXY/ALL_PROXY,把发往甲骨文公网 IP 的请求
  也塞进了 127.0.0.1:7897,120s 后超时
- 按 provider 区分:境外厂商(Gemini/NVIDIA)仍走代理,自建网关直连
  (session.trust_env=False)

fix(ai): 承诺的按模型裁剪从未实现
- 模块注释写着 payload 按 (模型窗口, 天数预算) 取小者裁剪,但实际是
  用全局预算构建一次 prompt 发给链上所有模型;365 天数据对 Gemini
  的 1M 窗口无碍,却会撑爆 128k 的模型
- 新增 max_days_for(),在循环内按各模型窗口分别构建 prompt

fix(ai): 推理模型的思考过程吃光输出预算
- 网关首选 nemotron-3-ultra-550b 是推理模型,回答前先输出一段
  chain-of-thought;默认 1024 tokens 全被思考占用,JSON 还没开始
  就被截断
- max_tokens 改为可按 provider 声明,网关条目给 3000

fix(ai): 配置在 import 时被冻结
- DEFAULT_CHAIN/TIMEOUT/DAY_BUDGET 是模块级常量,改环境变量不生效,
  且让开发机 .env 泄漏进测试进程(测试会读到真实 key 和链配置)
- 改为 default_chain()/default_timeout()/default_day_budget() 按调用读取
- conftest 增加 autouse fixture 清空全部 AI_* 变量,测试不再继承 .env

测试 (184 passed, 1 skipped):
- 新增 TestGatewayProvider: 透传 upstream、目标 URL/鉴权头、
  token 失效时继续降级
- 新增 TestProxyPolicy: 境外厂商与自建端点的代理策略相反
- 新增 TestPerModelSizing: 128k 模型收到的 prompt 必须小于 1M 模型
- 新增 TestMaxTokens: 推理端点预算大于默认,且真正写进两种 payload
- 新增 TestLazyConfig: 改环境变量立即生效
- mock 目标从 requests.post 改为 requests.Session.post

实测: 网关链路可返回合法 JSON,但 nemotron-550B 排队较久(约 160s),
故 AI_TIMEOUT_SECONDS 默认调到 180。

Co-Authored-By: Claude Haiku 4.5 <noreply@anthropic.com>
2026-08-23 17:44:51 +08:00

49 lines
2.1 KiB
Python

"""
Central configuration for the Garmin Health Lab Flask backend.
Reads settings from a `.env` file (backend/.env) and the process environment.
The same code runs against SQLite (local dev) or MariaDB (NAS production)
by switching DB_TYPE — business code never branches on the backend.
"""
import os
from dotenv import load_dotenv
# Load .env from the backend directory (falls back to cwd / parent search).
_BACKEND_DIR = os.path.dirname(os.path.abspath(__file__))
_ENV_PATH = os.path.join(_BACKEND_DIR, ".env")
if os.path.exists(_ENV_PATH):
load_dotenv(_ENV_PATH)
else:
load_dotenv() # walk up from cwd
# --- Database selection -----------------------------------------------------
DB_TYPE = (os.environ.get("DB_TYPE") or "sqlite").lower()
# SQLite (default, zero-config local development)
SQLITE_PATH = os.environ.get("DATABASE_PATH") or os.path.join(
_BACKEND_DIR, "data", "health.db"
)
# MariaDB (production, runs on the NAS)
MARIADB_SOCKET = os.environ.get("MARIADB_SOCKET") or ""
MARIADB_HOST = os.environ.get("MARIADB_HOST") or "127.0.0.1"
MARIADB_PORT = int(os.environ.get("MARIADB_PORT") or 3306)
MARIADB_USER = os.environ.get("MARIADB_USER") or "root"
MARIADB_PASSWORD = os.environ.get("MARIADB_PASSWORD") or ""
MARIADB_DATABASE = os.environ.get("MARIADB_DATABASE") or "garmin_health_lab"
# --- Auth -------------------------------------------------------------------
JWT_SECRET = os.environ.get("JWT_SECRET") or "dev_secret_change_me"
JWT_EXPIRY_DAYS = int(os.environ.get("JWT_EXPIRY_DAYS") or 7)
# --- Server -----------------------------------------------------------------
# BACKEND_PORT wins over PORT: `PORT` is set by many dev tools and PaaS
# runtimes for the *frontend*, and letting it through made Flask seize the
# React dev server's port during `npm run dev`.
PORT = int(os.environ.get("BACKEND_PORT") or os.environ.get("PORT") or 5000)
# Comma-separated list of allowed front-end origins (CORS).
_CORS_RAW = os.environ.get("CORS_ORIGIN") or "http://localhost:3000,http://localhost:5173"
CORS_ORIGINS = [o.strip() for o in _CORS_RAW.split(",") if o.strip()]