【玩机教程】海光K100_AI环境编译快手定制版llama.

一、Keye-VL-2.0-30B-A3B简介
快手Keye团队开源了Keye-VL-2.0-30B-A3B多模态大模型,采用DSA稀疏注意力机制,支持256K超长上下文,对小时级视频实现毫秒级时序推理。模型基于MoE架构,参数总量达300亿,在多模态理解和长视频时序感知任务上表现优异。

二、在海光K100_AI上选择llama.cpp的原因
海光K100_AI部署大模型面临生态困境,包括vLLM适配滞后、SGLang支持有限、Transformers兼容性问题。在主流框架不支持Keye-VL-2.0时,llama.cpp因其轻量级、跨平台和GGUF格式原生支持成为唯一可行选择。

三、环境说明
部署环境包括海光K100_AI(8卡,gfx928架构)、Ubuntu 22.04操作系统、DTK 26.04版本和Keye-VL-2.0-30B-A3B-BF16.gguf模型(约57GB)。

四、部署测试详细步骤
1. 模型下载:使用ModelScope下载Keye-VL-2.0-30B-A3B的GGUF模型文件。
2. 克隆快手定制版llama.cpp:获取适配Keye-VL的llama.cpp定制分支。
3. 环境配置与代码修改:
– 修改CMakeLists.txt适配DTK 26.04。
– 修改DTK系统头文件。
– 修改llama.cpp源码适配gfx928,包括强制使用MMQ内核、修改norm.cu文件、修改softmax相关文件、修改common.cuh和其他文件中的block_dims。

[IMG:n]

© 版权声明
THE END
喜欢就支持以下吧
点赞16赞赏 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容