-
LLM 推理服务完全指南:从一次"GPU 利用率很低、并发一高就排长队还 OOM"看懂批处理与请求队列
2023 年我做一个大模型推理服务把一个开源大模型部署在 GPU 上包一个 HTTP 接口对外提供。第一版我做得很省事来一个请求就调一次 model.generate 推理完返回。本地一个人测了测真不错发一个请求几秒就回来响应挺快。我心里很踏实模型推理嘛包成一个 HTTP 接口来一个请求调一次 generate 不就行了。可等这个服务真正上线扛起多用户的并发请求一串问题冒了出来。第一种最先把我打懵…- 0
- 0
GPU
幸运之星正在降临...
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠劵
-
¥优惠劵使用时效:无法使用使用时效:
之前
使用时效:永久有效优惠劵ID:×
没有优惠劵可用!

