mh-v1b-imo-9b-t20

Part of the Meta-Harness v1b study — co-evolution GRPO (verl) where a shared-weight policy plays two roles: TA (grader/solver) and Proposer (harness editor via multi-turn SEARCH/REPLACE).

Domain IMO grading
Architecture Qwen3_5ForCausalLM — 32 layers, hidden 4096
Precision bf16 (merged from FSDP via verl.model_merger)
Notes No-reclaim co-evolution with proposer max_turn=20 (proposer reached up to 13 turns; the 5-turn control force-capped ~75% of trajectories). Tests whether more proposer search turns help.

Collection: https://huggingface.co/collections/hyunseoki/meta-harness-v1b-policy-x-harness-co-evolution-6a5c9877f74920e8922808bc

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer
tok = AutoTokenizer.from_pretrained("hyunseoki/mh-v1b-imo-9b-t20")
model = AutoModelForCausalLM.from_pretrained("hyunseoki/mh-v1b-imo-9b-t20", torch_dtype="bfloat16")
Downloads last month
11
Safetensors
Model size
9B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collection including hyunseoki/mh-v1b-imo-9b-t20