如何计算CPU的理论最大内存带宽
在FastDecode文章中,红框里显示CPU的最大内存带宽,这是怎么计算的呢?
在FastDecode文章中,红框里显示CPU的最大内存带宽,这是怎么计算的呢?
在上一节学习了Transformer的搭建过程,但是对于实际推理的流程,比如参数如何加载?batch中的多个sequence如何并行地推理还不甚清楚。由于vLLM内容繁杂,故使用llama提供的generator来做推理过程的学习,顺便再重温一下llama2的…
学习LLM之前,首先就是要搞懂Transformer的原理并复现。主要参考了[该文章][2]
本节只展示我认为homework4中比较重要的部分,其余参考GitHub代码
在 executor 文件夹下定义不同类型的执行器,如NeuronExecutor、CPUExecutor、RayGPUExecutor、GPUExecutor
为什么需要Normalization?
__inin__.py 中定义 needle对外暴露的模块、类、函数
跟踪vllm在generation阶段的代码,发现其page_atttention有V1和V2两个版本。以其V2版本为例。
这是补档。当按1、2安装完之后,运行cuda的demo代码,一直报错。就是cuda的api用不了
前情提要:本来在实体机上想进行测试程序检验NUMA节点间的迁移,因为CPU型号问题无法开启NUMA(只有一个NUMA节点)。遂采用师兄的方法:使用qemu虚拟机来运行内核。