使用 Canonical MLOps 栈和 LLM 构建实时交易欺诈检测系统
Ubuntu 演示使用 open weight 模型“system-one-qwen3.5-4b-scorer”,结合 KServe、vLLM 与 AWQ 量化,在本地构建交易风险分类实验。合并 LoRA 权重并采用 4-bit AWQ 后,模型内存需求据称可由约 18GB 降至约 5GB;教程还提供 MicroK8s、Charmed Kubeflow 部署及 curl 请求验证步骤。
推荐理由:提供从模型量化、KServe 部署到请求验证的完整实验路径,并明确环境、内存和耗时要求,适合评估本地实时分类方案。