Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
Show all changes
50 commits
Select commit Hold shift + click to select a range
13f6d8e
vulkan: add int8 coopmat quantized matmul shader
0cc4m Mar 7, 2026
e086b9c
apply scales inline
0cc4m Mar 7, 2026
5f034d6
use scalar sums
0cc4m Mar 7, 2026
1625608
probe and directly access coopmat values instead of going through shmem
0cc4m Aug 21, 2026
513f436
add q8_0 support
0cc4m Aug 24, 2026
b121ef3
add BK_STEP to shader, default to 2
0cc4m Aug 24, 2026
2a878d9
use larger workgroups
0cc4m Aug 24, 2026
5553b89
double buffering
0cc4m Aug 24, 2026
b453be3
preload scales
0cc4m Aug 24, 2026
14a6080
coopmat load first, then wmma
0cc4m Aug 24, 2026
95d14c9
use float for scales
0cc4m Aug 24, 2026
ad015d6
add faster RDNA int->float conversion
0cc4m Aug 24, 2026
31b9bc6
revert load reordering and scale pre-loading
0cc4m Aug 24, 2026
2335676
workgroup scheduling for cache proximity
0cc4m Aug 24, 2026
9f069f4
clean up
0cc4m Aug 24, 2026
15b3ce0
Revert "revert load reordering and scale pre-loading"
0cc4m Aug 24, 2026
57b4276
use wave32
0cc4m Aug 24, 2026
a9e0e89
increase large tile size
0cc4m Aug 24, 2026
ef5c629
Revert "increase large tile size"
0cc4m Aug 24, 2026
2b9c533
restructure for vgpr use
0cc4m Aug 24, 2026
57dd3f8
skip computation for inactive tiles
0cc4m Aug 24, 2026
ab6e84b
only force subgroup size 32 on AMD RDNA
0cc4m Aug 24, 2026
42a6269
use BK_STEP 4
0cc4m Aug 24, 2026
1825270
fix compilation
0cc4m Aug 24, 2026
eb46b8c
move quant-specific prefetch function out of main file
0cc4m Aug 24, 2026
d2a5ac6
add q4_1, q5_0, q5_1 support
0cc4m Aug 24, 2026
ed294e8
restructure mmq cm1 functions
0cc4m Aug 24, 2026
fa37db9
enable mul_mat_id support
0cc4m Aug 24, 2026
d8ed372
fix segfault
0cc4m Aug 24, 2026
3cd7643
fix mul_mat_id bug
0cc4m Aug 24, 2026
dc08fa9
support iq4_nl and mxfp4
0cc4m Aug 24, 2026
ba8402e
remove elem row/col fast path, invalid for RDNA4
0cc4m Aug 24, 2026
5037f02
use shmem arrays for LUTs
0cc4m Aug 24, 2026
ab94ffd
use 4-byte loads where possible
0cc4m Aug 24, 2026
4695f10
add q3_k, q4_k, q5_k, q6_k and nvfp4 support
0cc4m Aug 26, 2026
22f588c
fix l warptile
0cc4m Aug 26, 2026
3985f64
improve performance
0cc4m Aug 26, 2026
092661d
improve performance
0cc4m Aug 26, 2026
eeeaced
improvements
0cc4m Aug 27, 2026
2ba1d22
dedup b scales
0cc4m Aug 27, 2026
9ef5996
merge shmem arrays
0cc4m Aug 27, 2026
f252045
undo uint8_t, gate to RDNA3/4
0cc4m Aug 27, 2026
0eab519
add RDNA4 architecture, use for hardcoded coopmat elem thread access,…
0cc4m Aug 27, 2026
c30a874
improve offset application
0cc4m Aug 27, 2026
6421fbe
clean up
0cc4m Aug 28, 2026
04d7ef7
fix iq4_nl and nvfp4 performance
0cc4m Aug 28, 2026
584ae05
rdna4 tuning
0cc4m Aug 29, 2026
e85ff84
use BK_STEP 2 on MUL_MAT_ID
0cc4m Aug 29, 2026
8b194a1
adapt to upstream changes
0cc4m Aug 29, 2026
965e571
fix shmem support function, clean up comments
0cc4m Aug 29, 2026
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Loading
Loading