Qwen2.5-32B LexEnvs GRPO (LoRA adapter)

LoRA adapter for Qwen/Qwen2.5-32B-Instruct, trained with GRPO on credit card optimization tasks.

Most users should use the merged full weights instead: endishai/qwen2.5-32b-lexenvs-grpo.

On a held-out test set of 30 tasks, this adapter (applied to Qwen2.5-32B-Instruct) scores ~0.51 average reward, outperforming Claude Opus 4.6 (~0.41), Claude Sonnet 4.6 (0.396), and GPT-4o (0.363).

Usage

from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel

base = AutoModelForCausalLM.from_pretrained(
    "Qwen/Qwen2.5-32B-Instruct", torch_dtype="auto", device_map="auto",
)
model = PeftModel.from_pretrained(base, "endishai/qwen2.5-32b-lexenvs-grpo-lora")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-32B-Instruct")

See endishai/qwen2.5-32b-lexenvs-grpo for evaluation details.

Downloads last month
10
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for endishai/qwen2.5-32b-lexenvs-grpo-lora

Base model

Qwen/Qwen2.5-32B
Adapter
(216)
this model

Dataset used to train endishai/qwen2.5-32b-lexenvs-grpo-lora

Space using endishai/qwen2.5-32b-lexenvs-grpo-lora 1