Before image gen, signal llama.cpp to offload layers to CPU, generate, signal back. llama.cpp supports --n-gpu-layers via API at runtime
Before image gen, signal llama.cpp to offload layers to CPU, generate, signal back. llama.cpp supports --n-gpu-layers via API at runtime