Skip to content

算子launch线程数量有误,全部由acl_thread进行算子下发 #140

Description

@AcK1ng

我是在C++进行大模型推理框架的开发,问题是在本地拉起多个线程,每个线程绑定一个NPU Stream进行算子的launch,本意是想多线程并发launch NPU算子,但是经过profile发现最终会有单个线程acl_thread进行统一的launch。然后在GPU上是能够正常拉起多个线程进行算子的下发,这是torch_npu这边规定的吗,还是其他原因?

环境:
910B3 单卡
torch: 2.9.0+cpu
torch_npu: 2.9.0
CANN:8.5.0

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

    Milestone

    No milestone

    Relationships

    None yet

    Development

    No branches or pull requests

    Issue actions