ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SillyTavern性能优化:让config.yaml的6个设置快速砍半页面加载时间

SillyTavern性能优化:让config.yaml的6个设置快速砍半页面加载时间 SillyTavern性能优化让config.yaml的6个设置快速砍半页面加载时间【免费下载链接】SillyTavernLLM Frontend for Power Users.项目地址: https://gitcode.com/GitHub_Trending/si/SillyTavern凌晨一点你和AI角色聊到关键剧情发出去的一句话要等上五六秒才见回复滚动角色列表时页面卡得像幻灯片。这个开源的LLM 聊天前端本身不慢多半是少了几行配置。这是一份SillyTavern 性能优化清单按先查症、再开方、最后避坑的顺序走完10 分钟可验证。先给自己做个体检你对号入座几条不用装工具对着下面这张表数中了几条就行。中两条以上下面的方案就值得逐项做你能观察到的信号大概率的原因打开几百上千张角色卡的库要等好几秒所有卡一次性全量解析进内存保存很长的聊天记录时页面像卡死大 JSON 负载未压缩直接上传角色列表里每张图都加载得很慢原图按原始尺寸传输本地 Ollama 模型第一问很慢、隔一会儿又变慢模型答完就被从显存卸载升级版本后界面样式错乱、图标缺失浏览器里压着旧版静态资源服务器重启后第一次打开明显比后续慢Webpack 构建缓存未命中SillyTavern性能优化酒馆白昼场景背景把角色库改成用时才加载现象卡库越大列表页首屏越慢滚到哪都带延迟。原因服务端默认把每张角色卡完整解析后一次性吐给前端。做法在 default/config.yaml 里打开懒加载并保留两级缓存内存约 100MB按代码注释约合 3000 张卡performance: lazyLoadCharacters: true useDiskCache: true memoryCacheCapacity: 100mb预期收益大卡库的列表首屏从全量解析变成按需命中缓存重复打开同一卡库时读取走本地缓存秒级等待基本消失。改动逻辑可对照 src/endpoints/characters.js。让大请求体先压缩再上路现象几十轮的长对话点保存转圈好几秒期间整个界面像冻结。原因聊天记录存成 JSON动辄 1MB 以上默认是原样裸传。做法开启上行压缩只压 256KB 以上的负载小于这个值的请求压缩反而不划算performance: requestCompression: enabled: true minPayloadSize: 256kb maxPayloadSize: 8mb预期收益JSON 文本经 gzip 通常缩到原体积的 10%~20%1MB 的聊天存档上传时间按同样带宽能省掉 80% 以上的传输量。让图片缩略图替原图出门现象角色和背景列表里每张图都按原尺寸走网络列表还没滚完流量先花完了。原因1920x1080 的原始背景动辄几百 KB而列表格子只需要一丁点像素。做法缩略图默认已开启检查这几项没被人改小即可想更省把 quality 从 95 降到 80thumbnails: enabled: true format: jpg quality: 95 dimensions: { bg: [160, 90], avatar: [96, 144] }预期收益一张 500KB 级别的背景原图生成 160x90 的 jpg 缩略图通常不足 20KB同屏 20 张图时列表页带宽能降一个数量级。别让本地模型答完就下班现象本地跑的 Ollama 模型第一问等半分钟紧接着的第二问很快歇一会儿再问又变慢。原因keepAlive默认 0 会把模型立即从显存卸载下一问等于冷启动。做法给自己设一个有限的保活窗口比如 5 分钟ollama: keepAlive: 300预期收益5 分钟内的连续追问都走热模型第二问起的首字延迟从冷启动的几十秒回落到秒级同时显存不会无限期被占死。给浏览器缓存装一个精准清除现象刚升级完界面按钮错位、新功能的图标还是旧的手动强刷才恢复。原因浏览器攥着旧版 CSS/JS服务器升级了但没人通知它。做法打开 cacheBuster并务必用userAgentPattern圈定范围别全量清空cacheBuster: enabled: true userAgentPattern: firefox预期收益命中模式的浏览器在首次访问时被发一次Clear-Site-Data头样式错乱从每次升级都手动强刷变成自动处理且只影响你指定的浏览器。效果对比改完能差多少指标默认配置调整后3000 张卡的卡库列表首屏数秒级全量解析亚秒级懒加载缓存命中1MB 聊天存档上传裸传全量压缩后约 100~200KB20 张图的列表页带宽约 5~8MB原图约 0.5MB 以内缩略图Ollama 模型第二问首字延迟冷启动数秒~数十秒保活窗口内秒级解读有两点一是收益大头在传输量和重复解析而不是 CPU 快慢所以这套方案对低配机器更友好二是每一项都独立生效做哪条都能单独验证不用全押。SillyTavern性能优化赛博朋克卧室场景避坑指南这三处别做过头cacheBuster 不设 userAgentPattern 就是灾难所有用户每次首访都清光缓存静态资源重新下载一遍首屏反而变慢优化做了个寂寞。memoryCacheCapacity 不是越大越好Android 设备在代码里被明确禁用了内存缓存移动端把值调得再高也没用还可能加剧内存压力默认 100MB 就是按 3000 张卡估算的。maxPayloadSize 别设 0 当无限0 表示不设上限8MB 的巨型请求体光是压缩就要吃满 CPU 几个百分点256kb/8mb 这组默认值是成本和收益的平衡点。收尾回到那个凌晨改完这份清单重启服务回到开头那个场景发一句话看着回复在秒级内蹦出来再翻一次三千张卡的库——滚轮终于不卡了。下一步就一件事打开default/config.yaml把上面五段配置逐条落地然后用开头的体检表重新走一遍哪条还亮着就回来对哪个模块。更多背景可以看 README.md。【免费下载链接】SillyTavernLLM Frontend for Power Users.项目地址: https://gitcode.com/GitHub_Trending/si/SillyTavern创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表