FINE-TUNING COCKPIT • UNSLOTH & LORA COMPILER
NVIDIA LoRA & QLoRA Recipe Generator
Fine-tune 8B, 14B, and 70B models up to 5x faster with 80% less VRAM using Unsloth and FlashAttention-2.
fine_tune_unsloth.pyFlashAttention-2 Active
# Auto-generated by NEXUS AI Fine-Tuning Cockpit
# Optimized for RTX 4090 24GB with Unsloth + FlashAttention-2
import torch
from unsloth import FastLanguageModel
max_seq_length = 2048
dtype = None # Auto detection
load_in_4bit = True # 4-bit QLoRA cuts VRAM by 75%
model, tokenizer = FastLanguageModel.from_pretrained(
model_name = "meta-llama/Meta-Llama-3.1-8B",
max_seq_length = max_seq_length,
dtype = dtype,
load_in_4bit = load_in_4bit,
)
# Apply LoRA adapters
model = FastLanguageModel.get_peft_model(
model,
r = 16,
target_modules = ["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
lora_alpha = 32,
lora_dropout = 0,
bias = "none",
use_gradient_checkpointing = "unsloth",
random_state = 3407,
)
from trl import SFTTrainer
from transformers import TrainingArguments
from datasets import load_dataset
dataset = load_dataset("timdettmers/openassistant-guanaco", split = "train")
trainer = SFTTrainer(
model = model,
tokenizer = tokenizer,
train_dataset = dataset,
dataset_text_field = "text",
max_seq_length = max_seq_length,
args = TrainingArguments(
per_device_train_batch_size = 2,
gradient_accumulation_steps = 4,
warmup_steps = 10,
max_steps = 100,
learning_rate = 2e-4,
fp16 = not torch.cuda.is_bf16_supported(),
bf16 = torch.cuda.is_bf16_supported(),
logging_steps = 1,
output_dir = "nexus_lora_output",
),
)
trainer_stats = trainer.train()
# Save final adapters ready for NEXUS Private Vault deployment
model.save_pretrained_merged("nexus_final_model", tokenizer, save_method = "merged_16bit")
print("Training Complete! Ready to push to NEXUS Private Vault.")