CK
← Back to C-Kernel-Engine Docs
Doxygen Source Documentation
Loading...
Searching...
No Matches
File List
Here is a list of all files with brief descriptions:
[detail level
1
2
3
4
]
▼
include
►
data_structures
►
tries
trie.h
►
tokenizer
hash_table.h
memory_pool.h
murmurhash3.h
tokenizer.h
true_bpe.h
utf8.h
bf16_utils.h
ck_features.h
CPU feature detection and dispatch macros
ck_metrics.h
ck_model_abi_v8.h
ck_model_api.h
Generic Model API - Model-agnostic interface for CK-Engine
ck_parity_api.h
C-Kernel-Engine Parity Testing API
ck_sampler_v8.h
ck_session_v8.h
ck_speed_profiles.h
ck_threadpool.h
Persistent pthread thread pool for CK-Engine inference
ck_tokenizer.h
ckernel_alloc.h
ckernel_audio.h
ckernel_bump_v5.h
ckernel_codegen.h
ckernel_codegen_v2.h
ckernel_dtype.h
ckernel_engine.h
ckernel_ir.h
ckernel_ir_v2.h
ckernel_ir_v2_lower.h
ckernel_kernel_specs.h
ckernel_mem_plan.h
ckernel_memory_layout.h
Single-Arena Memory Layout for CPU-Optimized Inference & Training
ckernel_model.h
ckernel_model_load_v4.h
ckernel_orchestration.h
ckernel_quant.h
Quantization block structures for weight-only quantization
ckernel_registry.h
ckernel_section_layout.h
Section-Based Memory Layout: Header / Body / Footer Pattern
cpu_features.h
fused_kernels.h
Fused Kernel API for Cache-Aware Attention Fusion
mega_fused_attention.h
Mega-Fused Attention Kernel
system_topology.h
▼
src
►
data_structures
►
tries
trie.c
trie.h
►
kernels
►
fused
attention_mlp_fused.c
Mega-Fused Attention + MLP Block
fused_rmsnorm_linear.c
Fused RMSNorm + Linear (GEMV) kernel
gemv_fused_quant_bias.c
Fused GEMV kernels with online quantization and bias
mega_fused_attention_avx.c
Mega-Fused Attention for AVX (256-bit) and AVX-512 (512-bit)
mega_fused_attention_decode_q5_0.c
Mega-fused attention decode with Q5_0 weights
mega_fused_attention_decode_q5_0.h
Mega-fused attention decode with Q5_0 weights - Header
mega_fused_attention_prefill.c
Mega-fused prefill attention kernel
mega_fused_attention_prefill_q8_0.c
Mega-fused prefill attention kernel with Q8_0 out-proj
mega_fused_outproj_mlp_prefill.c
Mega-fused post-attention block for prefill
prefill_fused_gemm.c
Fused kernels for prefill phase with proper 2D tiling
rmsnorm_q8_k_fused.c
Fused RMSNorm + Q8_K Quantization kernel
rmsnorm_qkv.c
Fused RMSNorm + QKV Projection
add_kernels_bf16.c
Element-wise addition kernels for BF16 tensors
attention_decode_fused.c
Fused attention decode kernel (legacy v6/v6.5)
attention_flash_true.c
Flash-style attention (online softmax, causal, streaming)
attention_kernels.c
Attention score/softmax/output kernels with SIMD (SSE/AVX/AVX512)
attention_kernels_sliding.c
Sliding-window flash attention kernels split from
attention_kernels.c
attention_oracle_ggml.c
Strict ggml-backed full-attention oracles for parity debugging
attention_oracle_ggml.h
audio_kernels.c
Numerically explicit audio frontend reference kernels
axpy_kernels.c
AXPY kernels for FP32: y = y + alpha * x
deepseek_kernels.c
Scalar reference kernels for DeepSeek-style research ops
deltanet_kernels.c
FP32 Gated DeltaNet kernels for Qwen3.5-style recurrent attention
dequant_kernels.c
Dequantization kernels for GGML-compatible formats
embedding_kernels.c
Token/position embedding lookup kernels
embedding_kernels_bf16.c
Token/position embedding lookup kernels for BF16
fp16_convert.c
FP32 <-> FP16 SIMD conversion utilities
geglu_kernels.c
GeGLU kernels split from
gelu_kernels.c
gelu_kernels.c
GELU activation kernels with SIMD (SSE/AVX/AVX512)
gelu_kernels_bf16.c
GELU activation kernels for BF16 tensors
gemm_batch_int8.c
Batch GEMM kernels for quantized weights with INT8 activations
gemm_fused_kernels.c
Fused GEMM Kernels with activations
gemm_head_major_output.c
Output projection from head-major attention (NO LAYOUT CONVERSION)
gemm_kernels.c
General matrix multiply (GEMM) kernels with SIMD (SSE/AVX/AVX512)
gemm_kernels_amx.c
AMX (Advanced Matrix Extensions) GEMM kernels
gemm_kernels_bf16.c
Optimized BF16 GEMM Kernels for AVX-512
gemm_kernels_f16.c
GEMM kernels with FP16 (half-precision) weights
gemm_kernels_nvfp4.c
Packed NVFP4 weight kernels for CPU inference
gemm_kernels_q4_0.c
GEMM/GEMV kernels with Q4_0 quantized weights
gemm_kernels_q4_1.c
GEMM/GEMV kernels with Q4_1 quantized weights
gemm_kernels_q4k.c
GEMM/GEMV kernels with Q4_K quantized weights
gemm_kernels_q4k_avx.c
AVX Q4_K x Q8_K matvec kernel for Sandy/Ivy Bridge
gemm_kernels_q4k_q8k.c
Q4_K (weights) x Q8_K (activations) kernels for inference
gemm_kernels_q4k_q8k_avx2.c
AVX2 Q4_K x Q8_K matvec kernel (inference only)
gemm_kernels_q4k_q8k_vnni.c
VNNI Q4_K x Q8_K matvec kernel (inference only)
gemm_kernels_q4k_sse.c
SSE4.1 Q4_K x Q8_K dot product kernels
gemm_kernels_q5_0.c
GEMM/GEMV kernels with Q5_0 quantized weights
gemm_kernels_q5_0_sse.c
SSE4.1 GEMM for Q5_0 quantized weights
gemm_kernels_q5_0_sse_v2.c
SSE-optimized GEMM kernels for Q5_0 x Q8_K quantization
gemm_kernels_q5_1.c
GEMM/GEMV kernels with Q5_1 quantized weights
gemm_kernels_q5_1_q8_1.c
Q5_1 x Q8_1 contract kernels used for ggml parity (Gemma-sensitive path)
gemm_kernels_q5_k.c
GEMM/GEMV kernels with Q5_K quantized weights
gemm_kernels_q6k.c
GEMM/GEMV kernels with Q6_K quantized weights
gemm_kernels_q6k_q8k.c
Q6_K (weights) x Q8_K (activations) kernels for inference
gemm_kernels_q6k_sse.c
SSE-optimized GEMM kernels for Q6_K x Q8_K quantization
gemm_kernels_q8_0.c
GEMM/GEMV kernels with Q8_0 quantized weights
gemm_kernels_q8_0_q8_0_contract.c
FP32 API adapters that enforce Q8_0 x Q8_0 activation contract
gemm_microkernel.c
GEMM Microkernel - High-Performance Register-Blocked Matrix Multiplication
gemma4_per_layer_embed.c
gemv_omp.c
gemv_omp.h
ggml_runtime_compat.h
hybrid_attention_kernels.c
hyper_connection_kernels.c
kv_cache_kernels.c
KV-cache helper kernels (head-major layout)
layernorm_kernels.c
LayerNorm forward/backward kernels with SIMD (SSE/AVX/AVX512)
layernorm_kernels_bf16.c
LayerNorm kernels for BF16 tensors
layout_kernels.c
logit_kernels.c
loss_kernels.c
Loss function kernels (cross-entropy, etc.)
loss_kernels_bf16.c
Loss function kernels for BF16 tensors
mamba2_kernels.c
mlp_fused_decode.c
Fully fused MLP decode kernel (T=1 token generation)
mlp_kernels.c
MLP (feed-forward) kernels with SIMD (SSE/AVX/AVX512)
mlp_kernels_bf16.c
Optimized BF16 MLP Kernels
optimizer_kernels.c
Optimizer kernels for training (AdamW, SGD)
optimizer_kernels_bf16.c
BF16 optimizer kernels for training
qk_norm_kernels.c
Per-head RMSNorm on Q and K (Qwen3-style QK norm)
quantize_row_q8_k_avx.c
AVX entrypoint for exact Q8_K row quantization
quantize_row_q8_k_avx2.c
AVX2 entrypoint for exact Q8_K row quantization
quantize_row_q8_k_avx512.c
AVX-512 entrypoint for exact Q8_K row quantization
quantize_row_q8_k_sse.c
SSE-optimized Q8_K row quantization kernel
qwen4_exp_kernels.c
recurrent_gate_kernels.c
recurrent_norm_kernels.c
recurrent_qk_norm_kernels.c
recurrent_split_kernels.c
recurrent_state_kernels.c
relu_kernels.c
ReLU activation kernels with SIMD (SSE/AVX/AVX512)
relu_kernels_bf16.c
ReLU activation kernels for BF16 tensors
rmsnorm_kernels.c
RMSNorm forward/backward kernels with SIMD (SSE/AVX/AVX512)
rmsnorm_kernels_bf16.c
RMSNorm kernels for BF16 tensors
rmsnorm_kernels_int4.c
RMSNorm kernels with INT4 output quantization
rmsnorm_kernels_int8.c
RMSNorm kernels with INT8 output quantization
rope_kernels.c
RoPE (Rotary Position Embedding) kernels with SIMD
rope_kernels_bf16.c
RoPE (Rotary Position Embedding) kernels for BF16
sigmoid_kernels.c
Sigmoid activation kernels with SIMD (AVX512)
sigmoid_kernels_bf16.c
Sigmoid activation kernels for BF16 tensors
softmax_kernels.c
Softmax forward/backward kernels with SIMD (SSE/AVX/AVX512)
softmax_kernels_bf16.c
Softmax kernels for BF16 tensors
ssm_kernels.c
FP32 SSM causal depthwise convolution kernels for qwen3next/Qwen3.5
swiglu_kernels.c
SwiGLU activation kernels with SIMD (SSE/AVX/AVX512)
swiglu_kernels_bf16.c
SwiGLU activation kernels for BF16 tensors
topk_kernels.c
Top-K selection kernels for MoE router dispatch
vision_kernels.c
Vision kernels (im2patch, patch embedding, etc.)
vision_kernels_bf16.c
Vision kernels for BF16 tensors (im2patch, etc.)
►
tokenizer
hash_table.c
memory_pool.c
murmurhash3.c
test_tokenizer.c
tokenizer.c
tokenizer_spm.c
true_bpe.c
utf8.c
►
v2_legacy
ck_tokenizer_v2.c
ckernel_codegen_v2.c
ckernel_codegen_v2_dispatch.c
ckernel_codegen_v2_emit.h
ckernel_codegen_v2_schedule.c
ckernel_codegen_v2_sections.c
ckernel_codegen_v2_struct.c
ckernel_ir_v2.c
ckernel_ir_v2_builder.c
ckernel_ir_v2_demo.c
ckernel_ir_v2_lower.c
►
v4_legacy
ckernel_model_load_v4.c
►
v6
ck_cli_v6.c
ck_tokenizer_v6.c
ckernel_alloc_v6.c
ckernel_codegen_v6.c
ckernel_ir_v6.c
v6_cli.c
C-Kernel-Engine v6 CLI
v6_inference.c
C-Kernel-Engine v6 Inference
v6_simple.c
Simplified v6 CLI using only generic kernels
►
v6.5
►
test_generated
ck-kernel-inference.c
AUTO-GENERATED: qwen2_0.5b_decode Implementation (IR v6 - Explicit Unrolled)
ck-kernel-inference.h
AUTO-GENERATED: qwen2_0.5b_decode Memory Layout
generic_api_test.c
AUTO-GENERATED: model Implementation (IR v6.5 - Explicit Unrolled)
int8_q4k_test.c
AUTO-GENERATED: model Implementation (IR v6.5 - Explicit Unrolled)
qwen2_int8.c
AUTO-GENERATED: qwen2_0.5b_decode Implementation (IR v6.5 - Explicit Unrolled)
ck_cli_v6.5.c
ck_tokenizer_v6.5.c
ckernel_alloc_v6.5.c
ckernel_codegen_v6.5.c
ckernel_ir_v6.5.c
test_bump_tokenizer.c
test_generic_api.c
Generic test/benchmark harness using ck_model_* API
test_inference_with_bump_tokenizer.c
v6.5_cli.c
v6.5_inference.c
v6.5_simple.c
►
v6.6
►
generated
ck-kernel-inference.c
AUTO-GENERATED: qwen2_0.5b_decode Implementation (IR v6 - Explicit Unrolled)
ck-kernel-inference.h
AUTO-GENERATED: qwen2_0.5b_decode Memory Layout
ck-kernel-prefill.c
►
test_generated
ck-kernel-inference.c
AUTO-GENERATED: qwen2_0.5b_decode Implementation (IR v6 - Explicit Unrolled)
ck-kernel-inference.h
AUTO-GENERATED: qwen2_0.5b_decode Memory Layout
generic_api_test.c
AUTO-GENERATED: model Implementation (IR v6.6 - Explicit Unrolled)
int8_q4k_test.c
AUTO-GENERATED: model Implementation (IR v6.6 - Explicit Unrolled)
qwen2_int8.c
AUTO-GENERATED: qwen2_0.5b_decode Implementation (IR v6.6 - Explicit Unrolled)
ck_cli_v6.6.c
ck_tokenizer_v6.6.c
ckernel_alloc_v6.6.c
ckernel_codegen_v6.6.c
ckernel_ir_v6.6.c
parallel_orchestration.c
[LEGACY] Parallel decode orchestration prototype — NOT USED by v6.6
test_bump_tokenizer.c
test_generic_api.c
Generic test/benchmark harness using ck_model_* API
test_inference_with_bump_tokenizer.c
v6.6_cli.c
v6.6_inference.c
v6.6_simple.c
backend_native.c
ck_cli_v5.c
ck_parallel_train.c
Thread-pool dispatch wrapper for FP32 training GEMM
ck_parity_api.c
C-Kernel-Engine Parity Testing API Implementation
ck_threadpool.c
Persistent pthread thread pool for CK-Engine inference
ck_tokenizer.c
ck_tokenizer_v2.c
ckernel_alloc.c
ckernel_codegen.c
ckernel_ir.c
ckernel_ir_demo.c
ckernel_kernel_specs.c
ckernel_mem_plan.c
ckernel_model_layout.c
ckernel_model_load.c
ckernel_orchestration.c
ckernel_registry.c
ckernel_strict.c
cpu_features.c
show_config.c
system_topology.c
Generated by
1.9.8