From 9f0183e34c2b339c15de22ca2d9f7ccf30e36de0 Mon Sep 17 00:00:00 2001 From: Ronald Tse Date: Tue, 1 Sep 2026 06:51:48 +0200 Subject: [PATCH] =?UTF-8?q?feat(eval):=20GLM=5FWORKERS=20env=20knob=20?= =?UTF-8?q?=E2=80=94=208=20default,=20lower=20for=20loaded=20endpoints?= MIME-Version: 1.0 Content-Type: text/plain; charset=UTF-8 Content-Transfer-Encoding: 8bit glm-4.7-flash currently sits behind sustained 429s (code 1305); hammering it with 8 concurrent workers burns the 5-retry budget into empty rows. The knob lets overloaded models run politely; empties remain self-healing on resume (#65). --- eval_sadeed_glm.py | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/eval_sadeed_glm.py b/eval_sadeed_glm.py index d9ff0a7..003d727 100644 --- a/eval_sadeed_glm.py +++ b/eval_sadeed_glm.py @@ -132,7 +132,8 @@ def work(i: int) -> tuple[int, str]: return i, call(session, key, inputs[i]) n_written = 0 - with ThreadPoolExecutor(max_workers=8) as ex: + workers = int(os.environ.get("GLM_WORKERS", "8")) + with ThreadPoolExecutor(max_workers=workers) as ex: futures = {ex.submit(work, i): i for i in todo} for fut in as_completed(futures): i, pred = fut.result()