对GPU进行性能优化时,cudagraph是绕不开的话题。
不仅是GPU,大部分的xpu都会提供类似graph mode的优化,相比于每次分别由CPU进行kernel launch的eager mode,graph mode通常都会有较大性能提升,然而也经常容易出现各种各样的奇怪问题。
NVIDIA有一个简单的 博客 介绍,其中只使用了stream capture的形式来构造cudagraph,而且本质上就是多个kernel前后提交,根本无法展示cudagraph的复杂性。
本文尝试从底层原理出发,根据文档 和 …。
{dede:pagebreak/}
graalvm为啥国内没有流行起来,go写起来实在太恶心了,难道任凭go独霸云原生?
前后楼怎么共享宽带?
华为是真的遥遥领先吗?
国产手机APP为什么越来越臃肿?
PHP现在真的已经过时了吗?
飞书为什么大幅裁员?
Wayland与X11,你更喜欢哪一个?
网络小白如何建立一个网站,供别人下载文件(主要是PDF和MP3)?
据说go和c#的开发者都说自己比较节省内存,你们认为呢?
你身边身材最好的女生是什么样?
PHP现在真的已经过时了吗?
有一个乌克兰的朋友问我,中国人凭什么能享受和平,我该怎么说?
三只羊是不是被人做局了?
华为Pura 80首销遇冷,是否说明消费者已经开始对麒麟芯片性能有所觉醒?
如果郭嘉把大家的房贷都免掉了,会刺激消费吗?
如何评价【极客湾】在直播中实锤【B 站不交保护费就限流】?