在分布式集群中,一个节点上的故障,可能会导致其他节点也受到波及,甚至导致整个系统不可用。一旦出现问题,运维人员必须迅速定位到错误的根源,也就是找到第一条和故障相关的错误日志,而众所周知,一个多节点的系统所产生的日志量是非常多的,在生产环境中,可能只要几天就会产生数十万行的日志,这对于人工来说难以进行分析。因此,使用 AI 进行运维辅助成了当下研究的热点之一。
假设现在有一个 Kubernetes 集群的所有 pods 日志 (Logs) 、各个主机的观测指标导出 (Metrics) 以及 Ingress/Gateway 的流量数据 (Traces),请你构建一个系统,能实现以下功能:
- 对各个指标进行可视化展示
- 当资源使用量/流量出现异常的时候进行告警
- 生成合理的日报/周报
- 对日志进行分类,并对可疑日志进行记录
- (可选)结合用户提供的具体错误表现(如某 API 端点出现延迟严重增加),分析可能的错误归因和相关日志
- (可选)通过混合使用不同规模的模型,在成本和准确度之间做出平衡
- (可选)通过微调,使小规模模型对日志类文本的分析能力提升/对相关领域知识库优化
- (可选)提供 API 接口,允许开发人员导入更多遥测信息
- (可选)有良好的 UI/UX
- (可选)自己从真实的集群中获取观测数据,构建数据集
(上述要点不分顺序;本题工作量过大,因此请重点展示思路)
如果需要数据集或其他帮助,可以与出题人进行联系
2025.10.13 Updates
考虑到工作量,本题在单人完成时仅需完成前 2 点(即可视化展示和异常告警),3、4 两点作为思考题在问辩环节检查,不需要演示