_base_: ../_base_/default.yaml model: reasoning_effort: medium train: batch_size: 10 accumulation: 1 gradient: minibatch_size: 8 merge_batch_size: 8 optimizer: learning_rate: 4 env: name: sealqa skill_init: skillopt/envs/sealqa/skills/initial.md split_dir: data/sealqa_split workers: 4 max_tool_turns: 12 limit: 0