Pharma TinyLlama β€” Stage 2 LoRA (Instruction SFT) β€” Unsloth

Stage 2 LoRA adapter from the Unsloth 3-stage pharma fine-tuning pipeline. Trained on pharma instruction data (Alpaca format) on top of the Stage 1 merged domain model using SFTTrainer.

Training details

Param Value
Base model ThakrePranjal/pharma-tinyllama-unsloth-stage1-merged (Stage 1 merged)
Trainer trl.SFTTrainer (Unsloth patched)
Data 48 instruction records, packing=False
Max steps 30
Learning rate 1e-4
LoRA r 16
LoRA alpha 32
Peak VRAM 1.014 GB
Train time 86s

Usage

from unsloth import FastLanguageModel
from peft import PeftModel

# Load Stage 1 merged as base
model, tokenizer = FastLanguageModel.from_pretrained(
    model_name="ThakrePranjal/pharma-tinyllama-unsloth-stage1-merged",
    max_seq_length=512,
    load_in_4bit=True,
)

model = PeftModel.from_pretrained(model, "ThakrePranjal/pharma-tinyllama-unsloth-stage2-lora")
FastLanguageModel.for_inference(model)

# Inference
prompt = "### Instruction:\nExplain metformin in simple language.\n\n### Response:\n"
inputs = tokenizer(prompt, return_tensors="pt").to("cuda")
output = model.generate(**inputs, max_new_tokens=150)
print(tokenizer.decode(output[0], skip_special_tokens=True))

Dataset

ThakrePranjal/pharma-instruction-dataset-unsloth

Pipeline

unsloth/tinyllama-bnb-4bit
    └── Stage 1 SFT β†’ merged β†’ [ThakrePranjal/pharma-tinyllama-unsloth-stage1-merged]
            └── Stage 2 SFT (THIS ADAPTER) β†’ merged β†’ [ThakrePranjal/pharma-tinyllama-unsloth-stage2-merged]
                    └── Stage 3 DPO        β†’ merged β†’ [ThakrePranjal/pharma-tinyllama-unsloth-final]
Downloads last month
7
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support

Model tree for ThakrePranjal/pharma-tinyllama-unsloth-stage2-lora

Dataset used to train ThakrePranjal/pharma-tinyllama-unsloth-stage2-lora