chaos
|
2b073f2e3f
|
fix: content=None 导致 TypeError + /v1/models 本地返回
|
2026-07-08 16:27:35 +08:00 |
|
chaos
|
29d6fac6cc
|
fix: 401 黑名单锁死 - 新Token也401时清空黑名单避免27分钟不可用
|
2026-07-08 15:50:57 +08:00 |
|
chaos
|
5899032aee
|
fix: compact 504 超时修复
- 降低 auto_compact 阈值: 1.2MB → 350KB (426KB 请求也会导致上游 504)
- 预截断: compact 前每条消息限制 500 字, 大幅减少 token 数
- 降低批次大小: 800KB → 350KB 每批
- 429 限流自动重试: 最多 2 次, 递增等待 (5s, 10s)
- 504 超时自动重试: 1 次, 降级为 auto_compact
- compact 内部 429/504 重试: 最多 3 次
- 全局请求日志: before_request 捕获所有请求
|
2026-07-08 15:12:29 +08:00 |
|
chaos
|
368ffbe66c
|
fix: 透明分批压缩 - /v1路由 + 超限自动compact无需客户端感知
关键改动:
1. /v1/<path> 路由: 与 /v2 相同代理逻辑,兼容标准OpenAI客户端
2. auto_compact(): chat/completions超限时自动分批压缩,返回标准OpenAI格式
- 客户端完全无感知,不需要调用特殊端点
- 支持stream=true(SSE)和stream=false
- X-Auto-Compact响应头标识自动压缩发生
3. 非chat/completions超限仍返回413清晰错误
4. 修复compact SSE与Waitress的direct_passthrough兼容问题
|
2026-07-08 14:21:38 +08:00 |
|
chaos
|
85ea33eb4e
|
fix: 解决 compact 命令断连问题 - 请求体超限413清晰错误 + /v2/compact分批压缩端点
根因: APIG请求体限制~1.25MB, 超限后JSON截断导致'model id缺失'400错误→客户端断连
修复:
1. 请求体超限校验: 返回413 + content_too_large清晰错误(而非上游的'model id缺失')
2. /v2/compact端点: 超长对话自动分批发送压缩,每批<800KB,最后合并总结
3. 动态超时: 根据请求体大小自动调整(60s→180s→300s)
4. 修复响应头转发: 剥离Content-Encoding避免客户端解压失败
5. 禁用flask-compress(与Waitress SSE兼容问题)
|
2026-07-08 14:06:21 +08:00 |
|
chaos
|
a2a96282de
|
feat: 启用响应压缩(gzip/brotli/zstd) + 优化SSE流式chunk_size
- 添加 flask-compress 中间件,长文本响应自动压缩(压缩率70-80%)
- 压缩阈值设为256字节,小响应不压缩
- SSE流式 chunk_size 从 4096 提升到 16384,减少分片开销
- 压缩白名单包含 text/event-stream,SSE也支持压缩
- 解决长文本响应体积过大导致超时/内存溢出的问题
|
2026-07-08 13:21:32 +08:00 |
|