{"as_of":"2026-08-16T10:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:725304e9b8aa2ece2699b98782be0b3797b931c56fbfe61522400d13cb2a66a8","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:19:00.060451Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:49:26.556497Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13291","snapshot_observed_at":"2026-08-04T16:49:26.556497Z","title":"Timeseriesgym: A scalable benchmark for (time series) machine learning engineering agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11575","last_updated":"2026-06-10T07:42:17Z","snapshot_observed_at":"2026-08-06T03:43:03.418957Z","submitted_at":"2025-09-15T04:39:50Z","title":"A Survey of Reasoning and Agentic Systems in Time Series with Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T16:49:26.556497Z"},"links":{"cited_paper":"/paper/2505.13291","citing_paper":"/paper/2509.11575"},"observation_digest":"sha256:4b291b0cc79935fb98a28462a3bb006f6bd3bc59272247a4e62d56382a8b5777","observation_id":"ea263905-0699-4356-beb2-4d25ed8ddebd","resolution":{"observed_at":"2026-08-04T16:49:26.556497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2505.13291","doi":"10.48550/arxiv.2505.13291","metadata_source":"pith","pith_arxiv_id":"2505.13291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Timeseriesgym: A scalable benchmark for (time series) machine learning engineering agents","venue":"cs.LG","work_id":"7da6d212-8004-4005-bf03-6a7001b4e3ea","year":2025},"citing_paper":{"arxiv_id":"2604.10291","last_updated":"2026-04-11T17:15:26Z","snapshot_observed_at":"2026-08-11T17:04:19.884604Z","submitted_at":"2026-04-11T17:15:26Z","title":"TimeSeriesExamAgent: Creating Time Series Reasoning Benchmarks at Scale","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:25:02.732205Z"},"links":{"cited_paper":"/paper/2505.13291","citing_paper":"/paper/2604.10291"},"observation_digest":"sha256:616109565ffdede0a1de2b4523e3a1cf4f157b4cc8c7bd434287c9f635c50a6f","observation_id":"feffffa7-2a42-4bac-9d78-5bf1e0b78556","resolution":{"observed_at":"2026-05-11T10:36:04.498123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2505.13291","doi":"10.48550/arxiv.2505.13291","metadata_source":"pith","pith_arxiv_id":"2505.13291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Timeseriesgym: A scalable benchmark for (time series) machine learning engineering agents","venue":"cs.LG","work_id":"7da6d212-8004-4005-bf03-6a7001b4e3ea","year":2025},"citing_paper":{"arxiv_id":"2605.25045","last_updated":"2026-05-24T12:42:12Z","snapshot_observed_at":"2026-08-14T04:06:50.228338Z","submitted_at":"2026-05-24T12:42:12Z","title":"AION: Next-Generation Tasks and Practical Harness for Time Series","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T11:24:42.704735Z"},"links":{"cited_paper":"/paper/2505.13291","citing_paper":"/paper/2605.25045"},"observation_digest":"sha256:fb2e8b903a97ecd3f5ecead91a61eb2b9a6361ecf520a647d590b785d2776410","observation_id":"e683b470-0353-44ab-8478-8501010056f6","resolution":{"observed_at":"2026-06-30T11:54:38.614553Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2505.13291","doi":"10.48550/arxiv.2505.13291","metadata_source":"pith","pith_arxiv_id":"2505.13291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Timeseriesgym: A scalable benchmark for (time series) machine learning engineering agents","venue":"cs.LG","work_id":"7da6d212-8004-4005-bf03-6a7001b4e3ea","year":2025},"citing_paper":{"arxiv_id":"2606.00051","last_updated":"2026-05-08T08:23:10Z","snapshot_observed_at":"2026-08-07T00:25:09.123345Z","submitted_at":"2026-05-08T08:23:10Z","title":"Business Utility of Large Language Models as Exploratory Data Analysis Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:17.416071Z"},"links":{"cited_paper":"/paper/2505.13291","citing_paper":"/paper/2606.00051"},"observation_digest":"sha256:2d742e76b05908c9a68c979aa1dbb185afc10e9f68618c3403a42f3b91e8df95","observation_id":"6aad474d-5e5c-404c-84a5-cce3e9d26bad","resolution":{"observed_at":"2026-06-30T23:35:06.916216Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2505.13291","doi":"10.48550/arxiv.2505.13291","metadata_source":"pith","pith_arxiv_id":"2505.13291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Timeseriesgym: A scalable benchmark for (time series) machine learning engineering agents","venue":"cs.LG","work_id":"7da6d212-8004-4005-bf03-6a7001b4e3ea","year":2025},"citing_paper":{"arxiv_id":"2606.26350","last_updated":"2026-06-24T19:42:55Z","snapshot_observed_at":"2026-08-13T04:48:02.836610Z","submitted_at":"2026-06-24T19:42:55Z","title":"OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T01:29:30.732471Z"},"links":{"cited_paper":"/paper/2505.13291","citing_paper":"/paper/2606.26350"},"observation_digest":"sha256:d3f1892b97eeb4e473a7e0fc2a879362752e8c19b2ace614cc3aba58160abbb2","observation_id":"29cec238-4a26-4be5-afbc-b14478c80094","resolution":{"observed_at":"2026-07-04T15:39:57.076434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2505.13291","doi":"10.48550/arxiv.2505.13291","metadata_source":"pith","pith_arxiv_id":"2505.13291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Timeseriesgym: A scalable benchmark for (time series) machine learning engineering agents","venue":"cs.LG","work_id":"7da6d212-8004-4005-bf03-6a7001b4e3ea","year":2025},"citing_paper":{"arxiv_id":"2607.07834","last_updated":"2026-07-08T18:14:24Z","snapshot_observed_at":"2026-07-31T18:01:58.402742Z","submitted_at":"2026-07-08T18:14:24Z","title":"Predicting Pseudo-nitzschia harmful algal blooms along the Portuguese Coast using satellite-derived predictors","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-07-10T17:05:13.705761Z"},"links":{"cited_paper":"/paper/2505.13291","citing_paper":"/paper/2607.07834"},"observation_digest":"sha256:eed5af1a9d1e1dfcf8c850d507c53ffed0a686bf8302e3592f251b130420191e","observation_id":"04118d40-c7c1-4cde-825b-e557454a790b","resolution":{"observed_at":"2026-07-10T17:07:25.685453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13291/citation-record","integrity":"/paper/2505.13291/integrity","json":"/paper/2505.13291/citation-record.json","paper":"/paper/2505.13291"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.479614Z","title":"SUPER: Evaluating agents on setting up and executing tasks from research repositories","venue":null,"work_id":"d5c4f61a-e4ee-43a1-9b3e-cb0146db3bb0","year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.884219Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:95fdd9b32a1ded6ba8c5f9368587f85fa3d40a419fc1cd321ce64047b07488e7","observation_id":"2ea33136-a37e-4b42-901c-e7988cb349c5","resolution":{"observed_at":"2026-08-15T20:19:00.483284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.468822Z","title":"TimeSeriesExam: A time series understanding exam","venue":null,"work_id":"8b359eb0-9636-4832-9d42-02a98d6ad4a2","year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.888541Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:42be1a6ea1fc484ac014c72db2b2db3a8eb82001b850622c9a345bda09f378e4","observation_id":"4603ccb4-9e91-4701-8246-15b282072923","resolution":{"observed_at":"2026-08-15T20:19:00.472619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:59.892321Z","title":"MLE-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.892321Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:8a145a62b07eaa0546cee93aacc64d1bc7a7e32259d1fc5f4204b2ff516b9985","observation_id":"0f1d8f87-d393-4504-8214-2171215022bf","resolution":{"observed_at":"2026-08-15T20:18:59.892321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.451510Z","title":"Item response theory for psychologists","venue":null,"work_id":"84b480f6-246e-4200-b7bd-7f87699c9a03","year":2013},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.896202Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:d5e6225f21bc5f9f0bfc56639f67928df8317b9c5d5e093b9ed51ae5080d7875","observation_id":"2551a59d-074f-4fa0-a940-d3b1b0746636","resolution":{"observed_at":"2026-08-15T20:19:00.455975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.440779Z","title":"Aqua: A benchmarking tool for label quality assessment","venue":null,"work_id":"3dabc0ce-00aa-4745-b83a-df9ea53a0aee","year":2023},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.900054Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:4e8255714b6aa6f2d1e1d298fe53f8ae42db3cafe4486878cb747bc9b7e7234e","observation_id":"74b0d594-04a3-44c9-a550-632f7fecef07","resolution":{"observed_at":"2026-08-15T20:19:00.444556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.427423Z","title":"MOMENT: A family of open time-series foundation models","venue":null,"work_id":"54212652-c71f-423c-8083-e533c2340598","year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.904301Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:1124fdbdacaafdd5acd48e23a604e0fea0f77348cf3cc9847d89540001a1f898","observation_id":"eee9b12d-0399-43c0-a564-dfac00d89c65","resolution":{"observed_at":"2026-08-15T20:19:00.432880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:59.909255Z","title":"Automated evaluation of retrieval-augmented language models with task-specific exam generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.909255Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:48d95bb684cb44fb7507dc722db42b68304f7751bd323c6223ce25580ceb2327","observation_id":"baf4cd05-914e-42da-b655-54ad818a79fa","resolution":{"observed_at":"2026-08-15T20:18:59.909255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.407636Z","title":"Map it anywhere: Em- powering bev map prediction using large-scale public datasets","venue":null,"work_id":"4a9993f7-62c4-4516-9575-79271601587a","year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.912972Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:9e43d5e162973a8ab4bb1fd4450f5978fd7c5f4d8bfeaaccd7695172ff0b765d","observation_id":"f7edd78a-4889-4e5f-9a8f-a61a701885af","resolution":{"observed_at":"2026-08-15T20:19:00.412201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.395640Z","title":"MLAgentbench: Evaluating language agents on machine learning experimentation","venue":null,"work_id":"e17e5852-54e7-4155-a718-42b26e4f3665","year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.916398Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:d249060a290ef890bfc24b01d2c1619a95b727525d974e1977d8cc9eb23dd8b5","observation_id":"9e2be6ea-c999-4fd3-8d3e-73d494fd487e","resolution":{"observed_at":"2026-08-15T20:19:00.399911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-15T20:18:59.919766Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.919766Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:b3f98fb8bca9958650cff509f76eb7dee21bcad110a86ec8efba86c7d4b3b0b9","observation_id":"0de5330c-fcde-499a-9c7c-a04e796a8402","resolution":{"observed_at":"2026-08-15T20:18:59.919766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13138","last_updated":"2025-02-18T18:57:21Z","snapshot_observed_at":"2026-08-05T07:03:00.655237Z","submitted_at":"2025-02-18T18:57:21Z","title":"AIDE: AI-Driven Exploration in the Space of Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13138","snapshot_observed_at":"2026-08-15T20:18:59.923904Z","title":"Aide: Ai-driven exploration in the space of code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.923904Z"},"links":{"cited_paper":"/paper/2502.13138","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:1fce9657022a67e509429a789ed40d7e8a7ab5ca95b394678e597b9ac207b334","observation_id":"6805f4ca-e3ab-47dd-8fed-15a7cae08f69","resolution":{"observed_at":"2026-08-15T20:18:59.923904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:59.927902Z","title":"DSBench: How far are data science agents from becoming data science experts? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.927902Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:343808867afc3facd82230c47d85d59c1683640b9a038497c3cc46703bbebe3a","observation_id":"f9e5819d-35a1-4dfb-8df7-63fff78cc1e8","resolution":{"observed_at":"2026-08-15T20:18:59.927902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T20:18:59.931309Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.931309Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:e86cc27fb38d813c5131eab4c07c3cc2110128e8092fb2e64a2717dc5301dde0","observation_id":"0b099e41-9d2c-41c1-abba-424777f6191b","resolution":{"observed_at":"2026-08-15T20:18:59.931309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.378010Z","title":"G-eval: Nlg evaluation using gpt-4 with better human alignment","venue":null,"work_id":"969aac91-007e-4e61-aa28-9e75f68def4b","year":2023},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.934996Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:6b347aa42b776004b1c1a2ff99b50428bdd70be9992e0a1b2a601e349a2b5fd8","observation_id":"2dd110d3-20f9-449e-abc6-3fd204066dbd","resolution":{"observed_at":"2026-08-15T20:19:00.381929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.366164Z","title":"The kolmogorov-smirnov test for goodness of fit","venue":null,"work_id":"30348e4d-2204-4ef2-a624-f64179039b63","year":1951},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.938380Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:33b4dc92744f86877f5a2df705f35e8957759f9eaf9ddb4c19fe007dcb251945","observation_id":"05465f35-87ea-4539-88ee-f4780c762ea4","resolution":{"observed_at":"2026-08-15T20:19:00.371348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.355150Z","title":"GAIA: a benchmark for general ai assistants","venue":null,"work_id":"2305064d-05dd-49b3-bf05-de343f894d79","year":2023},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.941538Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:47043cb153ae5f92da7b89ace30db320f785e10963441bff34ed17206db567dc","observation_id":"03241c31-c9d5-40ff-bd77-0c16fc90e1d5","resolution":{"observed_at":"2026-08-15T20:19:00.359555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.344270Z","title":"MLGym: A new framework and benchmark for advancing ai research agents, 2025","venue":null,"work_id":"19312b87-1b86-4cb9-b296-75e04c85e6c8","year":2025},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.944738Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:b5f97bfb328bf0d38c2bcc0c0a067fb88ae2c97e80708e205afa482bc4a92a87","observation_id":"fade1209-042c-44bf-ae32-42151cc45c7f","resolution":{"observed_at":"2026-08-15T20:19:00.348525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00964","last_updated":"2025-02-19T05:09:01Z","snapshot_observed_at":"2026-08-09T17:02:32.208398Z","submitted_at":"2025-02-03T00:04:49Z","title":"ML-Dev-Bench: Comparative Analysis of AI Agents on ML development workflows","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00964","snapshot_observed_at":"2026-08-15T20:18:59.948386Z","title":"ML-Dev-Bench: Comparative analysis of ai agents on ml development workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.948386Z"},"links":{"cited_paper":"/paper/2502.00964","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:8f2ec98bd7194f842d57e326e035d6a0bd76787d8e6fcf1015c1bfe3b730bc15","observation_id":"7f02a243-9282-402d-a7ad-4fb36d30ad65","resolution":{"observed_at":"2026-08-15T20:18:59.948386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.332946Z","title":"Meta kaggle, 2022","venue":null,"work_id":"fe907353-0b16-4d33-b010-463d2d34e576","year":2022},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.952032Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:4a96c259a6d0c6e6c300a7cfd7ad4e73ef4889b3dd3122559e151d5bd6b5420f","observation_id":"b64c1703-19b1-4272-a90a-529bd47e4473","resolution":{"observed_at":"2026-08-15T20:19:00.337871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09835","last_updated":"2024-08-21T13:36:30Z","snapshot_observed_at":"2026-08-14T14:51:28.100849Z","submitted_at":"2023-11-16T12:03:21Z","title":"ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09835","snapshot_observed_at":"2026-08-15T20:18:59.955968Z","title":"ML-Bench: Evaluating large language models and agents for machine learning tasks on repository-level code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.955968Z"},"links":{"cited_paper":"/paper/2311.09835","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:04bd92a0d0bb0947160ab0e50ed325808ff030ed013b58dd2696ed13cb42bf9b","observation_id":"ebfff6ab-3eb5-467d-97f9-cefbfd68fe81","resolution":{"observed_at":"2026-08-15T20:18:59.955968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:18:59.960760Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.960760Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:7a2cc2a5b9fad4242f6a27bedf180bc5b9944b6256cfb259719acdf2995e2d7c","observation_id":"1cc08aad-4bf9-4fbb-ba59-55f3d00d6a1b","resolution":{"observed_at":"2026-08-15T20:18:59.960760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-12T16:49:37.896696Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-15T20:18:59.964481Z","title":"Re-bench: Evaluating frontier ai r&d capabilities of language model agents against human experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.964481Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:f52a3e1164ba3651f71c2f74d859db4f98e09ca76712cdba9215c01746b51bf1","observation_id":"79ec15b4-8781-468b-8d3e-beeea998a9e1","resolution":{"observed_at":"2026-08-15T20:18:59.964481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04047","last_updated":"2026-04-10T06:16:18Z","snapshot_observed_at":"2026-07-06T19:28:18.775189Z","submitted_at":"2024-10-05T06:04:19Z","title":"TS-Reasoner: Domain-Oriented Time Series Inference Agents for Reasoning and Automated Analysis","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04047","snapshot_observed_at":"2026-08-15T20:18:59.968530Z","title":"Beyond forecasting: Compositional time series reasoning for end-to-end task execution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.968530Z"},"links":{"cited_paper":"/paper/2410.04047","citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:028c2a95cb9df8d784b6678c5aa91fab7d3ecdd30fda568f0d5d5d876cedad94","observation_id":"2da82a0e-27e2-4d9d-9d73-ee1733c96bab","resolution":{"observed_at":"2026-08-15T20:18:59.968530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.316607Z","title":null,"venue":null,"work_id":"7cf889d6-88ad-44e6-ad9e-d7ac87940cbd","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.973515Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:c09db092e9f1871f0db048f2c532db3417edd27dd1e95dc9706509249f10fe10","observation_id":"affb81bf-98c2-4afa-b852-e3cc5300c2f4","resolution":{"observed_at":"2026-08-15T20:19:00.320077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.306840Z","title":null,"venue":null,"work_id":"a0d407a8-e594-4c58-a86b-cbb08abd77c3","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.977584Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:ba196a5d07ee746c93a5cf45ec7c8e44a7e564b68a795e5e5bdd42a502789738","observation_id":"fc8b3daa-860a-4ffa-9f00-37b2105021c5","resolution":{"observed_at":"2026-08-15T20:19:00.310430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.294703Z","title":"We reduced the RAM allowance to 10 GiB (from 100 GiB) as we did not observe any memory-related issues during our tests","venue":null,"work_id":"99f5066f-f262-431b-9381-74318f3fb29b","year":2025},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.981275Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:90f81672190994d8cceda1865f28f0182faf1174ff7470ef4715410988164caf","observation_id":"cdd0b947-2141-4618-ad1a-0022bec2f6ab","resolution":{"observed_at":"2026-08-15T20:19:00.298682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.282635Z","title":null,"venue":null,"work_id":"43804839-c909-4699-8188-00b6f34e7e98","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.985803Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:7c2f5a7e100a268a18b59fe4f3846894823c49e52d684590f4cdd324eddf7a69","observation_id":"71dd60f2-747e-4fda-8c24-00f9f61841f5","resolution":{"observed_at":"2026-08-15T20:19:00.287524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.270915Z","title":"file=@${SUBMISSION_FILE}","venue":null,"work_id":"1e775cda-a462-4bbe-9fb8-9d3fdaaae8e2","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.990880Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:7d6149fc14ed8f079cf0bee88fea184769792254c47185a1e159de619bd7fcc1","observation_id":"6b067f90-be27-45bd-be5f-a7e27ab89d28","resolution":{"observed_at":"2026-08-15T20:19:00.274655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.259629Z","title":null,"venue":null,"work_id":"6e21c108-54fb-46e1-b282-a5ca6823887b","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.995079Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:396985b7d201d3ea4d3daf527d81a88ba9735aaeecb956e5ab20a621a2114499","observation_id":"86454d14-50b0-4e57-ab32-d80b8bfc08a2","resolution":{"observed_at":"2026-08-15T20:19:00.264405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.248803Z","title":null,"venue":null,"work_id":"f31c79c8-ccd7-49c9-88fa-f28b6e493c62","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:18:59.999813Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:d09559160992a14bdc98a8fa9da7d808ce64ebcb6ff93ff8859552de03f0bebe","observation_id":"8f20f3d0-f33e-4309-9404-63d093dbeb87","resolution":{"observed_at":"2026-08-15T20:19:00.253077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.238029Z","title":"w\") as f: f.write(code) event_outq.put((","venue":null,"work_id":"93758916-aff7-4c5b-b8c3-e83b32c3dcef","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.011662Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:4d58742ea7465f4bc91b4d0fab4aa1336168995532a9fbe65342ad3c0ba397f3","observation_id":"adfc6117-0448-4be0-bc8b-56407914ea1e","resolution":{"observed_at":"2026-08-15T20:19:00.242645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.226953Z","title":null,"venue":null,"work_id":"e9ceb4ca-8053-4011-9fc5-8910881ae78f","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.018548Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:8de1e548ce2037048bda0859d17851df67ce69d66c267fcd50e668d78e227654","observation_id":"d1203a5f-8534-4917-9d24-dda3defafbdb","resolution":{"observed_at":"2026-08-15T20:19:00.231710Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.216457Z","title":null,"venue":null,"work_id":"75df9788-b82f-4509-9505-26ca2f2d6e46","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.024919Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:7e88ad41675c26fdc9608790fdee4a18832f66be3720321793a7214ef46a4d69","observation_id":"07fd6ac8-6821-4a9d-9067-056491a52640","resolution":{"observed_at":"2026-08-15T20:19:00.220289Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.204523Z","title":null,"venue":null,"work_id":"89794692-c2c7-4e6f-9761-a7ab1966e15d","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.035085Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:7f7cf4d9805483502ce7237ba414f319578a883d605cf40188d8a6dc1dfcbda5","observation_id":"0da4dbc9-95cd-4635-a32d-fb213656d409","resolution":{"observed_at":"2026-08-15T20:19:00.208913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.194058Z","title":null,"venue":null,"work_id":"a9535a7f-eba1-4469-97e3-1f45c3515e66","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.041244Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:46a84da31ad19ca6462623c3c952fe5282857be79d93100cd11e2802e1c0dcc9","observation_id":"ad253fbf-878e-492d-81b5-ea5d409a2e8a","resolution":{"observed_at":"2026-08-15T20:19:00.197763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.183619Z","title":null,"venue":null,"work_id":"b322902e-26cf-4cce-abd9-3c778276e917","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.047603Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:64617b9372019da36f86d071708b5a46be0c47fe202e672ec2d73a4d2c5f4d84","observation_id":"cdf6dfc7-54b8-4483-b095-e1d9e7549ae5","resolution":{"observed_at":"2026-08-15T20:19:00.187150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.172486Z","title":null,"venue":null,"work_id":"23940f85-add5-4d61-92db-076a158eee9c","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.052123Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:e9ac02efecc2129dbbd132e25bd5df1a39e87a3d4078db77399ccddb5af87e76","observation_id":"4cff18ce-501e-4da7-9c1f-c9506117f5bd","resolution":{"observed_at":"2026-08-15T20:19:00.176865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.161709Z","title":null,"venue":null,"work_id":"935fb7a2-7032-42ac-be4a-ab9060d6479b","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.056510Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:49381ddd4d1e95e63c0024e84c4057e22ff7db1c30d6cd6063d0e1e4b10d55be","observation_id":"c8ad2f47-c0f2-4d1d-85df-133ae275e399","resolution":{"observed_at":"2026-08-15T20:19:00.166111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:19:00.149233Z","title":null,"venue":null,"work_id":"71c98fef-854c-460c-84ab-a1ed6f006ae1","year":null},"citing_paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:19:00.060451Z"},"links":{"citing_paper":"/paper/2505.13291"},"observation_digest":"sha256:40f74c98ebd15c93217a9f86cae1e4a38c2cd51bb422b2be29db06b70902f068","observation_id":"02df5ee5-b26e-44d6-b218-b29fc537e572","resolution":{"observed_at":"2026-08-15T20:19:00.154520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13291","last_updated":"2025-05-19T16:11:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:13:53.875819Z","submitted_at":"2025-05-19T16:11:23Z","title":"TimeSeriesGym: A Scalable Benchmark for (Time Series) Machine Learning Engineering Agents"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 6 inbound Pith citation observations for arXiv:2505.13291."}