Tmax v1.1
See https://huggingface.co/collections/allenai/tmax for original release models and datasets.
Reinforcement Learning • 9B • Updated • 32Note DPPO terminal agent; main = step 200 (TB-Lite winner).
TMaxxx/qwen-4b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 4B • Updated • 27Note DPPO terminal agent; main = step 500 (TB-Lite winner).
TMaxxx/qwen-2b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 2B • Updated • 37Note DPPO terminal agent; main = step 400 (TB-Lite winner).
TMaxxx/qwen-27b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 2.65M • Updated • 34Note DPPO terminal agent; main = step 400 (TB-Lite winner).
TMaxxx/tmax-sft-8b-dppo-hardened-prefilter-sc3
Reinforcement Learning • 8B • Updated • 26Note DPPO terminal agent; main = step 500 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-cli-gym
Reinforcement Learning • 9B • Updated • 25Note DPPO terminal agent; main = step 100 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-endless-terminals
Reinforcement Learning • 9B • Updated • 27Note DPPO terminal agent; main = step 200 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-termigen
Reinforcement Learning • 9B • Updated • 30Note DPPO terminal agent; main = step 300 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-swe-smith
Reinforcement Learning • 9B • Updated • 24Note DPPO terminal agent; main = step 200 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-terminal-traj-16x48-oscar
Reinforcement Learning • 9B • Updated • 31Note DPPO terminal agent; main = step 200 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-openthoughts
Reinforcement Learning • 9B • Updated • 25Note DPPO terminal agent; main = step 500 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-litecoder-sc3
Reinforcement Learning • 9B • Updated • 34Note DPPO terminal agent; main = step 100 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-calibforge-sc3
Reinforcement Learning • 9B • Updated • 23Note DPPO terminal agent; main = step 100 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-seta-env-sc3
Reinforcement Learning • 9B • Updated • 24Note DPPO terminal agent; main = step 200 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-terminal-lego-sc3
Reinforcement Learning • 9B • Updated • 28Note DPPO terminal agent; main = step 200 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-facet-sc3
Reinforcement Learning • 9B • Updated • 26Note DPPO terminal agent; main = step 100 (TB-Lite winner).
TMaxxx/qwen35-9b-dppo-rts-sc3
Reinforcement Learning • 9B • Updated • 25Note DPPO terminal agent; main = step 200 (TB-Lite winner).
-
hamishivi/agent-task-openthoughts-agent-rl-5k
Viewer • Updated • 5k • 239 -
hamishivi/agent-task-litecoder-terminal-rl-preview
Viewer • Updated • 602 • 452 -
hamishivi/agent-task-terminal-lego-15k
Viewer • Updated • 15k • 840 -
hamishivi/agent-task-seta-env
Viewer • Updated • 4.57k • 424 -
hamishivi/agent-task-facet-terminal-6k
Viewer • Updated • 6.02k • 885 -
hamishivi/agent-task-recursive-task-synthesis
Viewer • Updated • 37.5k • 2.03k -
hamishivi/agent-task-calibforge
Viewer • Updated • 5.43k • 662