现在很多服务商都提供了 LLM 的 api 接口以供用户调用,但是云服务并不总是可用,总有设备网络连接不稳定的时候,并且有些用户可能只是需要处理一些日常的事项,也不希望自己的数据全部上云。此时端侧大模型便是一个选项。
对于大部分人来说,能进行推理的设备不止一个(如电脑上的 CUDA 设备,手机上的 NPU ),但单个设备的推理速度有限,且内存限制影响显著。
请你提出一个方案,来充分利用端侧设备算力,构建本地 LLM 推理系统(可基于现有开源项目二次开发)。
可在与出题人交流进度之后,从出题人处获得提示
加分项
- 有实机演示(视频或现场)
- 实现多设备分布式推理和负载均衡
- 实现自动、无感知的服务降级
- 支持 Linux (CUDA)设备
- 支持 Windows (CUDA)设备
- 支持 Android 设备
- 支持 iOS / iPad OS (Metal)设备
- 支持 macOS (Metal)设备