我是在C++进行大模型推理框架的开发,问题是在本地拉起多个线程,每个线程绑定一个NPU Stream进行算子的launch,本意是想多线程并发launch NPU算子,但是经过profile发现最终会有单个线程acl_thread进行统一的launch。然后在GPU上是能够正常拉起多个线程进行算子的下发,这是torch_npu这边规定的吗,还是其他原因? 环境: 910B3 单卡 torch: 2.9.0+cpu torch_npu: 2.9.0 CANN:8.5.0
我是在C++进行大模型推理框架的开发,问题是在本地拉起多个线程,每个线程绑定一个NPU Stream进行算子的launch,本意是想多线程并发launch NPU算子,但是经过profile发现最终会有单个线程acl_thread进行统一的launch。然后在GPU上是能够正常拉起多个线程进行算子的下发,这是torch_npu这边规定的吗,还是其他原因?
环境:
910B3 单卡
torch: 2.9.0+cpu
torch_npu: 2.9.0
CANN:8.5.0