endishai/lexenvs-tasks
RL Environment • Updated • 69
How to use endishai/qwen2.5-32b-lexenvs-grpo-lora with PEFT:
from peft import PeftModel
from transformers import AutoModelForCausalLM
base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen2.5-32B-Instruct")
model = PeftModel.from_pretrained(base_model, "endishai/qwen2.5-32b-lexenvs-grpo-lora")LoRA adapter for Qwen/Qwen2.5-32B-Instruct, trained with GRPO on credit card optimization tasks.
Most users should use the merged full weights instead: endishai/qwen2.5-32b-lexenvs-grpo.
On a held-out test set of 30 tasks, this adapter (applied to Qwen2.5-32B-Instruct) scores ~0.51 average reward, outperforming Claude Opus 4.6 (~0.41), Claude Sonnet 4.6 (0.396), and GPT-4o (0.363).
from transformers import AutoModelForCausalLM, AutoTokenizer
from peft import PeftModel
base = AutoModelForCausalLM.from_pretrained(
"Qwen/Qwen2.5-32B-Instruct", torch_dtype="auto", device_map="auto",
)
model = PeftModel.from_pretrained(base, "endishai/qwen2.5-32b-lexenvs-grpo-lora")
tokenizer = AutoTokenizer.from_pretrained("Qwen/Qwen2.5-32B-Instruct")
See endishai/qwen2.5-32b-lexenvs-grpo for evaluation details.