问题/痛点描述
当前 mini-swe-agent 使用 LiteLLM 进行推理时,未显式设置 timeout 参数,导致使用 LiteLLM 默认的 600 秒超时。对于 SWE-bench / SWE-bench Pro 这类 agent 任务,单次推理的合适超时远低于 600 秒。过长的默认超时会导致问题发现不及时、资源占用时间过长。
建议方案
在 _get_minisweagent_config() 函数中,为 model_kwargs 设置 timeout 的默认值为 200 秒(使用 dict.setdefault,用户可通过 generation_kwargs 覆盖)。
涉及文件:
ais_bench/benchmark/tasks/swebench/swebench_infer.py
ais_bench/benchmark/tasks/swebench_pro/swebench_pro_infer.py
备选方案
- 让用户在每个配置文件中手动设置
timeout=200,但容易遗漏且不够友好
- 直接在 LiteLLM 层面修改全局默认值,但影响面太大
预期价值
- 所有 SWE-bench / SWE-bench Pro 场景默认获得合理的推理超时(200s)
- 用户仍可通过
generation_kwargs 自定义超时值
- 避免因 LiteLLM 默认 600s 超时导致的问题
参与意向
问题/痛点描述
当前 mini-swe-agent 使用 LiteLLM 进行推理时,未显式设置
timeout参数,导致使用 LiteLLM 默认的 600 秒超时。对于 SWE-bench / SWE-bench Pro 这类 agent 任务,单次推理的合适超时远低于 600 秒。过长的默认超时会导致问题发现不及时、资源占用时间过长。建议方案
在
_get_minisweagent_config()函数中,为model_kwargs设置timeout的默认值为 200 秒(使用dict.setdefault,用户可通过generation_kwargs覆盖)。涉及文件:
ais_bench/benchmark/tasks/swebench/swebench_infer.pyais_bench/benchmark/tasks/swebench_pro/swebench_pro_infer.py备选方案
timeout=200,但容易遗漏且不够友好预期价值
generation_kwargs自定义超时值参与意向