You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
52 experiments analysed across 49 workflows. 26 are 🟢 READY on sample counts, but none has a PROMOTE or REJECT decision: outcome observations, guardrail metrics, or multi-variant support are still missing.
⚡ Quick Stats
Metric
Value
Active experiments
52
Ready for analysis (samples)
26
Decisions with sufficient evidence (PROMOTE/REJECT)
Charts and per-run success/duration statistics were not produced this run: the sandbox has no authenticated workflow-run listing and analyze returned no per-variant outcome observations (observations empty), so descriptive stats would not be meaningful.
No workflow declares a tracking issue: field, so no issue comments or labels were emitted.
Report action equals the core decision for every experiment.
🔁 Self-Tuning Continuation Plan
Top experiment actions
Fix observation pipeline for the ~24 insufficient_observations experiments (e.g. smokecopilot, smokegemini, gpclean, typist) so READY ones can reach PROMOTE/REJECT.
Back run_success_rate / empty_output_rate guardrails with supported metrics (cicoach, dailyfact, dailysecurityredteam) to clear guardrail_unsupported.
Reduce 3+ variant experiments (awfailureinvestigator, deepreport, dailyissuesreport, model_size family) to pairwise contrasts or add core multi-variant support; ste arms are under-sampled (3–42 runs).
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-30
52 experiments analysed across 49 workflows. 26 are 🟢 READY on sample counts, but none has a
PROMOTEorREJECTdecision: outcome observations, guardrail metrics, or multi-variant support are still missing.⚡ Quick Stats
smokecopilot,smokecopilotaoaiapikey,smokecopilotaoaientra)Reason-code breakdown
insufficient_observations: 26unsupported_multi_variant: 14insufficient_samples: 9guardrail_unsupported: 3📊 All experiments (core decisions, verbatim from `gh aw experiments analyze`)
prompt_compressionagentperformanceanalyzercaveman:72,verbose:59 (min 20)insufficient_observationssub_agent_strategyagentpersonaexplorerbatch:68,per_scenario:63 (min 20)insufficient_observationssub_agent_strategyarchitectureguardiansingle_agent:17,sub_agents:21 (min 20)insufficient_samplesaudit_decompositionauditworkflowsphased_sub_agents:48,single_agent:38 (min 264)insufficient_samplestone_variantawfailureinvestigatorassertive:165,clinical:161,narrative:164 (min 20)unsupported_multi_variantprompt_styleblogauditorconcise:4,detailed:7 (min 20)insufficient_samplestone_variantbreakingchangecheckerneutral:28,urgent:25 (min 20)insufficient_observationsprompt_stylecicoachconcise:39,detailed:59 (min 20)guardrail_unsupportedoutput_formatcopilotagentanalysisprose:34,ste:3,structured:43 (min 30)unsupported_multi_variantnlp_prompt_stylecopilotprnlpanalysisconcise:0,structured:0 (min 30)insufficient_samplessub_agent_strategydailyagentrxtraceoptimizersingle_agent:44,sub_agents:43 (min 20)insufficient_observationsdetail_leveldailyarchitecturediagrambrief:12,comprehensive:7 (min 20)insufficient_samplesprompt_styledailyastrostylelitemarkdownspellcheckconcise:77,detailed:72 (min 20)insufficient_observationsmodel_sizedailycachestrategyanalyzergpt-5.3-codex:13,gpt-5.3-codex-spark:11 (min 20)insufficient_samplesmodel_sizedailycavemanoptimizeragent:1,claude-haiku-4.5:72,claude-sonnet-4.6:34,claude-sonnet-5:9,small-agent:2 (min 20)unsupported_multi_variantoutput_formatdailycodemetricsexecutive_summary:54,full_detail:58,ste:16 (min 20)unsupported_multi_variantprompt_styledailycommunityattributionconcise:70,verbose:70 (min 20)insufficient_observationsoutput_formatdailycompilerqualityconcise:55,detailed:64,ste:17 (min 20)unsupported_multi_variantmodel_sizedailydochealeragent:2,claude-haiku-4.5:61,claude-sonnet-4.6:43,claude-sonnet-5:11,small-agent:1 (min 20)unsupported_multi_variantmodel_sizedailydocupdateragent:1,claude-haiku-4.5:49,claude-sonnet-4.6:47,claude-sonnet-5:14,small-agent:2 (min 20)unsupported_multi_variantreasoning_depthdailyfactmulti_candidate:41,single_pass:57 (min 30)guardrail_unsupportedmodel_sizedailyfunctionnamerinsufficient_observationsoutput_formatdailyissuesreportcollapsible:61,inline:63,ste:22 (min 20)unsupported_multi_variantprompt_styledailynewsconcise:63,detailed:51 (min 20)insufficient_observationsremove_redundant_context_v1dailyrenderingscriptsverifierinsufficient_observationslog_fetch_strategydailysafeoutputoptimizerinsufficient_observationsreasoning_depthdailysecurityredteamiterative:81,single_pass:59 (min 30)guardrail_unsupportedsemgrep_output_formatdailysemgrepscanbullet_list:28,prose:27,structured_sections:22 (min 30)unsupported_multi_varianttimeout_settingdailysubagentoptimizerdefault:2,relaxed:1,tight:1 (min 20)unsupported_multi_variantcaveman_modedataflowprdiscussiondatasetno:6,yes:10 (min 20)insufficient_samplesoutput_formatdeepreportannotated_brief:64,executive_brief:84,full_briefing:59,ste:42 (min 20)unsupported_multi_variantsummary_detaildependabotcampaignbrief:6,detailed:6 (min 20)insufficient_samplesprompt_styledependabotgocheckerconcise:19,detailed:18,step_by_step:16 (min 20)unsupported_multi_varianttool_verbositygpcleanfull_bash:60,minimal_toolset:68 (min 20)insufficient_observationsprompt_styleissuearboristconcise:48,detailed:39 (min 20)insufficient_observationsreasoning_depthplanbaseline:4,deep:2,shallow:1 (min 20)unsupported_multi_variantremove_redundant_context_v1prsouschefinsufficient_observationssub_agent_strategysmokeantigravitysingle_agent:99,sub_agents:109 (min 20)insufficient_observationscavemansmokecopilotno:186,yes:186 (min 20)insufficient_observationssubagent_modelsmokecopilotlarge:176,small:176 (min 20)insufficient_observationscavemansmokecopilotaoaiapikeyno:95,yes:95 (min 20)insufficient_observationssubagent_modelsmokecopilotaoaiapikeylarge:95,small:95 (min 20)insufficient_observationscavemansmokecopilotaoaientrano:81,yes:82 (min 20)insufficient_observationssubagent_modelsmokecopilotaoaientralarge:82,small:81 (min 20)insufficient_observationssub_agent_strategysmokecopilotsubagentsdelegated_sequential:17,inline_strict:14,single_agent_control:19 (min 30)unsupported_multi_variantsub_agent_strategysmokegeminisingle_agent:129,sub_agents:144 (min 20)insufficient_observationssub_agent_decompositionsmokepiparallel_sub_agents:42,single_agent:34 (min 20)insufficient_observationsprompt_style_testsmokeprojectinsufficient_observationssub_agent_strategysmoketemporaryidinsufficient_observationsmodel_sizetestqualitysentinelclaude-haiku-4.5:52,claude-sonnet-5:53 (min 20)insufficient_observationstone_styletypistconversational:49,formal:42 (min 20)insufficient_observationsprefetch_strategyweeklyblogpostwritereager:6,lazy:10 (min 20)insufficient_samplesNotes on scope
analyzereturned no per-variant outcome observations (observationsempty), so descriptive stats would not be meaningful.issue:field, so no issue comments or labels were emitted.🔁 Self-Tuning Continuation Plan
Top experiment actions
insufficient_observationsexperiments (e.g.smokecopilot,smokegemini,gpclean,typist) so READY ones can reach PROMOTE/REJECT.run_success_rate/empty_output_rateguardrails with supported metrics (cicoach,dailyfact,dailysecurityredteam) to clearguardrail_unsupported.awfailureinvestigator,deepreport,dailyissuesreport,model_sizefamily) to pairwise contrasts or add core multi-variant support;stearms are under-sampled (3–42 runs).Top eval actions
output_length_chars/output_token_countforoutput_formatexperiments (deepreport,dailyissuesreport,dailycodemetrics,dailycompilerquality).prompt_styleworkflows (dailynews,issuearborist,dailyastrostylelitemarkdownspellcheck).dailysecurityredteamprompts.Decision-pipeline gaps
run_success_rate,empty_output_rate,token_count_per_run,run_duration_ms(dailysafeoutputoptimizerhas no variant data).experiments listneeds theexperiments/*branches fetched locally;--repoonanalyzedid not work from the sandbox.caveman×subagent_model) into core analysis.dailyfunctionnamer,dailyrenderingscriptsverifier,prsouschef,smokeproject,smoketemporaryid,dailysafeoutputoptimizer.All reactions