{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:76PVNWT6SMYBLYDYYPOLQ5KQXI","short_pith_number":"pith:76PVNWT6","schema_version":"1.0","canonical_sha256":"ff9f56da7e933015e078c3dcb87550ba33a567111caad18cf35a2bc3b20896ed","source":{"kind":"arxiv","id":"2505.13291","version":1},"attestation_state":"computed","paper":{"title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Artur Dubrawski, Gus Welter, Micha{\\l} Wili\\'nski, Mononito Goswami, Xinyu Li, Yifu Cai","submitted_at":"2025-05-19T16:11:23Z","abstract_excerpt":"We introduce TimeSeriesGym, a scalable benchmarking framework for evaluating Artificial Intelligence (AI) agents on time series machine learning engineering challenges. Existing benchmarks lack scalability, focus narrowly on model building in well-defined settings, and evaluate only a limited set of research artifacts (e.g., CSV submission files). To make AI agent benchmarking more relevant to the practice of machine learning engineering, our framework scales along two critical dimensions. First, recognizing that effective ML engineering requires a range of diverse skills, TimeSeriesGym incorp"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.13291","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-05-19T16:11:23Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"eedccf3d6b555b28f7e823bae864063a7950decf3006482f23c02604f8e95431","abstract_canon_sha256":"2817d57a94ba6622b2e6236b97f87642bb3d1cbb0f1db929cb009d5566a4ebbe"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:05:27.844116Z","signature_b64":"FSdVa2QYCgCN5leoasKUAdqR8k/U9yE0/JHngy00lvb1QYswCAtUEWtfMNt4jBED2KztCdxeyjhTnCIK9UcFDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"ff9f56da7e933015e078c3dcb87550ba33a567111caad18cf35a2bc3b20896ed","last_reissued_at":"2026-07-05T11:05:27.843652Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:05:27.843652Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Artur Dubrawski, Gus Welter, Micha{\\l} Wili\\'nski, Mononito Goswami, Xinyu Li, Yifu Cai","submitted_at":"2025-05-19T16:11:23Z","abstract_excerpt":"We introduce TimeSeriesGym, a scalable benchmarking framework for evaluating Artificial Intelligence (AI) agents on time series machine learning engineering challenges. Existing benchmarks lack scalability, focus narrowly on model building in well-defined settings, and evaluate only a limited set of research artifacts (e.g., CSV submission files). To make AI agent benchmarking more relevant to the practice of machine learning engineering, our framework scales along two critical dimensions. First, recognizing that effective ML engineering requires a range of diverse skills, TimeSeriesGym incorp"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.13291","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.13291/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.13291","created_at":"2026-07-05T11:05:27.843710+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.13291v1","created_at":"2026-07-05T11:05:27.843710+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.13291","created_at":"2026-07-05T11:05:27.843710+00:00"},{"alias_kind":"pith_short_12","alias_value":"76PVNWT6SMYB","created_at":"2026-07-05T11:05:27.843710+00:00"},{"alias_kind":"pith_short_16","alias_value":"76PVNWT6SMYBLYDY","created_at":"2026-07-05T11:05:27.843710+00:00"},{"alias_kind":"pith_short_8","alias_value":"76PVNWT6","created_at":"2026-07-05T11:05:27.843710+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07834","citing_title":"Predicting Pseudo-nitzschia harmful algal blooms along the Portuguese Coast using satellite-derived predictors","ref_index":137,"is_internal_anchor":true},{"citing_arxiv_id":"2606.26350","citing_title":"OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00051","citing_title":"Business Utility of Large Language Models as Exploratory Data Analysis Agents","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25045","citing_title":"AION: Next-Generation Tasks and Practical Harness for Time Series","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10291","citing_title":"TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale","ref_index":7,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI","json":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI.json","graph_json":"https://pith.science/api/pith-number/76PVNWT6SMYBLYDYYPOLQ5KQXI/graph.json","events_json":"https://pith.science/api/pith-number/76PVNWT6SMYBLYDYYPOLQ5KQXI/events.json","paper":"https://pith.science/paper/76PVNWT6"},"agent_actions":{"view_html":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI","download_json":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI.json","view_paper":"https://pith.science/paper/76PVNWT6","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.13291&json=true","fetch_graph":"https://pith.science/api/pith-number/76PVNWT6SMYBLYDYYPOLQ5KQXI/graph.json","fetch_events":"https://pith.science/api/pith-number/76PVNWT6SMYBLYDYYPOLQ5KQXI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI/action/storage_attestation","attest_author":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI/action/author_attestation","sign_citation":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI/action/citation_signature","submit_replication":"https://pith.science/pith/76PVNWT6SMYBLYDYYPOLQ5KQXI/action/replication_record"}},"created_at":"2026-07-05T11:05:27.843710+00:00","updated_at":"2026-07-05T11:05:27.843710+00:00"}