从模型调用到应用接口
基于 FastAPI 封装智谱 AI 接口,提供流式与非流式响应,使用 SSE 将生成内容逐步返回调用方。将模型调用、文本处理与接口职责分开,便于应用接入。
摘要与轻量 RAG
对输入文本进行清洗和分块,使用 TF-IDF 与余弦相似度检索相关片段,再结合提示词组织回答。为文本摘要加入 Redis 缓存。这是一套轻量检索实现,未将其描述为向量数据库方案。
运行与交付
提供 Dockerfile 与 Docker Compose 配置,整理接口说明与运行方式。项目重点是 LLM API 集成和工程封装,不涉及基础模型训练。