如何计算CPU的理论最大内存带宽
在FastDecode文章中,红框里显示CPU的最大内存带宽,这是怎么计算的呢?
深度学习、推理系统与 Linux,记录学习和实践。
在FastDecode文章中,红框里显示CPU的最大内存带宽,这是怎么计算的呢?
在上一节学习了Transformer的搭建过程,但是对于实际推理的流程,比如参数如何加载?batch中的多个sequence如何并行地推理还不甚清楚。由于vLLM内容繁杂,故使用llama提供的generator来做推理过程的学习,顺便再重温一下llama2的…
学习LLM之前,首先就是要搞懂Transformer的原理并复现。主要参考了[该文章][2]
本节只展示我认为homework4中比较重要的部分,其余参考GitHub代码
在 executor 文件夹下定义不同类型的执行器,如NeuronExecutor、CPUExecutor、RayGPUExecutor、GPUExecutor
为什么需要Normalization?
__inin__.py 中定义 needle对外暴露的模块、类、函数
跟踪vllm在generation阶段的代码,发现其page_atttention有V1和V2两个版本。以其V2版本为例。
这是补档。当按1、2安装完之后,运行cuda的demo代码,一直报错。就是cuda的api用不了
前情提要:本来在实体机上想进行测试程序检验NUMA节点间的迁移,因为CPU型号问题无法开启NUMA(只有一个NUMA节点)。遂采用师兄的方法:使用qemu虚拟机来运行内核。
首先,还是给出参考文献: 参考博客
一句话:引入虚拟内存后,进程与进程之间的虚拟内存地址空间是相互隔离,互不干扰的。
使用内核态来判断那个套接字描述符有数据
参考: https://bean-li.github.io/vfs-inode-dentry/
umask可用来设定[权限掩码]。[权限掩码]是由3个八进制的数字所组成,将 现有的存取权限减掉权限掩码后 ,即可产生建立文件时预设的权限。
ctrl+a :光标移到命令行最前面
上一篇博客我们在虚拟机中编译了Linux内核,并且使用Qemu和gdb进行调试,但是gdb的指令我还不熟练,还是想用vscode来调试,这样也更加方便
至少分8个核心(不然编译速度很慢,亲测)
这个在_config中改不了,经过查阅资料,发现在 hexo-theme-butterfly/source/css/_layout/aside.styl中进行更改,大约在324行
没有找到匹配的文章。