Fine tunned PaliGemma vision-language models using the ScienceQA dataset for visual question answering.
-
Updated
Oct 23, 2024 - Jupyter Notebook
Fine tunned PaliGemma vision-language models using the ScienceQA dataset for visual question answering.
Mitigating positional bias in LLaVA 1.5 (7B) on ScienceQA via per-head activation steering & PCA.
Vision-Language Model fine-tuning and evaluation on ScienceQA using Qwen3.5, LoRA, and PEFT.
QI-Budget: Quality-aware inference budgeting via dynamic visual-token routing for efficient VLM reasoning.
Efficient Vision-Language Model inference and LoRA fine-tuning on ScienceQA, with dynamic resolution, visual-token compression, latency analysis, and accuracy–efficiency trade-offs using Qwen3.5-0.8B.
To associate your repository with the scienceqa topic, visit your repo's landing page and select "manage topics."