{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b51be8fad522ad078edd1506a4e5e7f8b1591460ef74b5f3be8b3bb01b1549ba","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:24:02.385113Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T01:39:49.218941Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:25:45.948001Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.07039","last_updated":"2026-05-07T23:38:50Z","snapshot_observed_at":"2026-08-02T16:36:23.528400Z","submitted_at":"2026-05-07T23:38:50Z","title":"PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:39.349292Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.07039"},"observation_digest":"sha256:1b53b5b4ca6c274960dbd00b4d150925443a86131073fe17dec179aafa82c91c","observation_id":"b3137228-5778-4160-88a4-893fd1c75603","resolution":{"observed_at":"2026-05-11T05:00:56.352524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-12T01:13:35.990078Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:cda49c1b3cb962824d8c45d1f7fffe0639f9ca8276a241f3a608eb9e378f362f","observation_id":"5630521f-8c37-4617-a14a-a9b49de7a90b","resolution":{"observed_at":"2026-05-12T08:21:25.286968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":2},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-06-30T23:12:57.154537Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:8f58c2b5926a562e2cfb9693d8655a67e1f073dbaf70c0257f08c8baf1a16c9a","observation_id":"57a77419-c52c-4371-a291-6d2b39a723ff","resolution":{"observed_at":"2026-07-01T13:25:45.958176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-12T17:14:49.310598Z","title":"Reinforcement learning for machine learning engineering agents.arXiv preprint arXiv:2509.01684, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08678","last_updated":"2026-07-06T13:36:13Z","snapshot_observed_at":"2026-07-31T14:41:52.251938Z","submitted_at":"2026-05-09T04:29:46Z","title":"MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-07-12T17:14:49.310598Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.08678"},"observation_digest":"sha256:7ae8948ae90fe05ea21a27cd6bf83352f06ef092fe7189c9272cb078364edb7d","observation_id":"86ff746c-ce33-464e-926e-0bee3a1a5c7f","resolution":{"observed_at":"2026-07-12T17:14:49.310598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":"2509.01684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-01T13:25:45.948001Z","title":"Reinforcement learning for machine learning engineering agents","venue":null,"work_id":"9bcd1420-adc0-4af1-b20b-f675b7fc5209","year":2025},"citing_paper":{"arxiv_id":"2605.12913","last_updated":"2026-05-13T02:40:28Z","snapshot_observed_at":"2026-07-06T23:24:32.412966Z","submitted_at":"2026-05-13T02:40:28Z","title":"Revisiting DAgger in the Era of LLM-Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T19:56:06.762156Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2605.12913"},"observation_digest":"sha256:fc3c1a5d22a46026bbe616bcb86ef9b92c0f5f399ab63ca6be4af85c8b64004b","observation_id":"83d2cc52-cd90-48ae-a519-dba65306dc3c","resolution":{"observed_at":"2026-05-14T19:57:53.418198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-14T11:28:23.511747Z","title":"Reinforcement learning for machine learning engineering agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10474","last_updated":"2026-07-11T20:53:04Z","snapshot_observed_at":"2026-08-02T07:22:05.963032Z","submitted_at":"2026-07-11T20:53:04Z","title":"Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T11:28:23.511747Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2607.10474"},"observation_digest":"sha256:5ff36589936e9d7371cf2aae61e02f45d2d3a049919f31aecb44765637e51042","observation_id":"082a7f23-a38a-4140-b7dd-43e98d831d0b","resolution":{"observed_at":"2026-07-14T11:28:23.511747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01684","snapshot_observed_at":"2026-07-31T01:39:49.218941Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25090","last_updated":"2026-07-27T21:30:39Z","snapshot_observed_at":"2026-08-07T19:23:56.811379Z","submitted_at":"2026-07-27T21:30:39Z","title":"Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-31T01:39:49.218941Z"},"links":{"cited_paper":"/paper/2509.01684","citing_paper":"/paper/2607.25090"},"observation_digest":"sha256:eb19d5e71ad533614b3f6e6da7d99227816b84a09ca34a0921b65f1d1c9c092b","observation_id":"b223f18e-0fb4-47d0-86b2-c12b00bf2c00","resolution":{"observed_at":"2026-07-31T01:39:49.218941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01684/citation-record","integrity":"/paper/2509.01684/integrity","json":"/paper/2509.01684/citation-record.json","paper":"/paper/2509.01684"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T12:24:02.221626Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.221626Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:5f3dfc0593197585d7364b092fcde6667414310a8ae4a6b8b58a9fb56ffa34c7","observation_id":"4bf46cd9-754d-4002-aa2b-02ba6e56517d","resolution":{"observed_at":"2026-08-05T12:24:02.221626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.225364Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.225364Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:440d6783a7b4a55d6fa10fee67256df9a45123cddf93b33917231930d6259037","observation_id":"144bf1fe-35c3-4062-83d3-ac95553d6215","resolution":{"observed_at":"2026-08-05T12:24:02.225364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07738","last_updated":"2025-02-09T08:15:44Z","snapshot_observed_at":"2026-07-06T17:58:52.016903Z","submitted_at":"2024-04-11T13:36:29Z","title":"ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07738","snapshot_observed_at":"2026-08-05T12:24:02.228568Z","title":"Researchagent: Iterative research idea generation over scientific literature with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.228568Z"},"links":{"cited_paper":"/paper/2404.07738","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:2129b641a0f4c552e298424b8ce2c63c8bca6059c3e568447ca84c6f4ef0cffc","observation_id":"594ff46b-6c87-4ac0-8d3a-9f4b2bdd3cc8","resolution":{"observed_at":"2026-08-05T12:24:02.228568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03302","last_updated":"2024-04-14T21:02:16Z","snapshot_observed_at":"2026-08-03T01:30:37.931398Z","submitted_at":"2023-10-05T04:06:12Z","title":"MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03302","snapshot_observed_at":"2026-08-05T12:24:02.231780Z","title":"Mlagentbench: Evaluating language agents on machine learning experimentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.231780Z"},"links":{"cited_paper":"/paper/2310.03302","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:c666c8666fb1de4eabf7080e65b018c7de33315f2957eaa080f38abbf6b5778a","observation_id":"47afa8af-5f77-41d0-8d91-daac13edd68a","resolution":{"observed_at":"2026-08-05T12:24:02.231780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-05T12:24:02.235163Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.235163Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4e8ace23558599efe14ef2ef335e3a12e5333ff5a4e90de3a77da474f4c4ae48","observation_id":"9966b5d1-224c-4fea-9a94-78f61bc54f1f","resolution":{"observed_at":"2026-08-05T12:24:02.235163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T12:24:02.238210Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.238210Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:1827c421ea16480dc98d890ef37f9fcf9637155ed4382474fd04e17b0b07ad01","observation_id":"9576ef01-37db-4382-b092-150327a1b092","resolution":{"observed_at":"2026-08-05T12:24:02.238210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-05T12:24:02.241388Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.241388Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:fe7ca536b07f23a6be28043b829305bc0d8dc31b8d9bac4bebb4e58a9b9f65de","observation_id":"c020786e-7f1e-4d7b-8ad6-9f2aee623858","resolution":{"observed_at":"2026-08-05T12:24:02.241388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.244194Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.244194Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4d07985c90be805b3edbc68ab2a211150c9c3995812de49ce3532d83149977dc","observation_id":"1f2ffa2e-60cf-4c26-9e4a-77610ae19182","resolution":{"observed_at":"2026-08-05T12:24:02.244194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T12:24:02.246946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.246946Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:872ffbacdbf5b582cfaacee5df94f5f1ac637864bef63848f057bf61fdb6de32","observation_id":"0e0cd02a-24e6-4518-85a8-972d9b855e2a","resolution":{"observed_at":"2026-08-05T12:24:02.246946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.249817Z","title":"Markov decision processes: discrete stochastic dynamic programming","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.249817Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:abfcbd9b3322422e98a6df85ab81ad824f881933617630fff7553a61cce578ea","observation_id":"901e5f44-53a8-4c0b-96f4-3e9d5675e960","resolution":{"observed_at":"2026-08-05T12:24:02.249817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.115067Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":"1ff3a38b-b27b-4dc0-af4a-48562f3c9d98","year":1992},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.252457Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:14e0ddd4654a8ee7c166528d2b880382458bb8716156f061d61023e238f1ab5d","observation_id":"9383b62b-6c1f-4e93-858a-e3c44dd157c0","resolution":{"observed_at":"2026-08-05T12:24:03.118040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T12:24:02.254998Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.254998Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:605a63dfec58a6c51066178a7ef99d6ed112f510b2af4514923b5fb03181ccd3","observation_id":"d2c05991-2083-4e0e-b769-9c67a13b0e83","resolution":{"observed_at":"2026-08-05T12:24:02.254998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.106626Z","title":"Efficient exploration in reinforcement learning","venue":null,"work_id":"5c8f4d79-a9df-4f7d-b546-129eda29d091","year":1992},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.257737Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:3e42252319bc927e09e18adcca6d6db566392248769bb8dc3485843076d1cc1b","observation_id":"ce8144c7-d782-4342-ba92-85ec442ee0c6","resolution":{"observed_at":"2026-08-05T12:24:03.109462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.098323Z","title":"On the sample complexity of reinforcement learning","venue":null,"work_id":"631231fb-3685-4c7a-a23d-e67fa8ca5133","year":2003},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.259983Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8fcc7e3d053b76abb2905abada8c4488b6b93840a04730c69898a1282ee808d2","observation_id":"df3c1527-bd08-4cde-9319-751b1c54317c","resolution":{"observed_at":"2026-08-05T12:24:03.101100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.089696Z","title":"Rllib: Abstractions for distributed reinforcement learning","venue":null,"work_id":"888293d4-b93c-4145-bfb8-5076f46d0276","year":2018},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.262328Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:25548e0d17b9d4d6cbb6a21a80407851c23f7de25b3f3f6b2f2acbb538c49018","observation_id":"23b6d3c8-25cc-4ef7-bd32-6497a846884b","resolution":{"observed_at":"2026-08-05T12:24:03.092922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.00979","last_updated":"2022-09-20T17:15:51Z","snapshot_observed_at":"2026-08-06T09:10:55.331167Z","submitted_at":"2020-06-01T14:38:52Z","title":"Acme: A Research Framework for Distributed Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.00979","snapshot_observed_at":"2026-08-05T12:24:02.264694Z","title":"Acme: A research framework for distributed reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.264694Z"},"links":{"cited_paper":"/paper/2006.00979","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:b5f77d08cf9194134e29b31eebe8d260438679a3074a0bdbacfeda534468cb26","observation_id":"3e505bb6-a99a-4cf9-9558-1c793b2d0777","resolution":{"observed_at":"2026-08-05T12:24:02.264694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T12:24:02.267302Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.267302Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:fd7ef4bd1fe2255166c31cbcb88a8c7fcb996f16b94ed958ea2ff2791fe9ea22","observation_id":"ebc7e94f-e431-4133-bf0c-d2d9da6c37a8","resolution":{"observed_at":"2026-08-05T12:24:02.267302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.270253Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.270253Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:9b1064414910fb3962f6d41e2e3d1de28493b6b919ce9638fad3c70a0c327851","observation_id":"c69dd7fe-66c9-4769-9702-7e26521eac41","resolution":{"observed_at":"2026-08-05T12:24:02.270253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.076035Z","title":"LangChain, October 2022","venue":null,"work_id":"559d2000-31d8-4acd-ab1b-8e65c9cd4e34","year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.272628Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:dd66f75df464c6745431ab31d57f7a594488274e10c7443f2d6c0bc93a0f6227","observation_id":"87eb226d-023f-4db7-a7d6-41b1764864f8","resolution":{"observed_at":"2026-08-05T12:24:03.078785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.274949Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.274949Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4e4cc2b75a10b4cda22866e48d8bf8441a5b7f1d5ad45167503e74b3d8e5a4a0","observation_id":"f032b7bd-e628-47bf-871d-e3551d297aa3","resolution":{"observed_at":"2026-08-05T12:24:02.274949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09835","last_updated":"2024-08-21T13:36:30Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T12:03:21Z","title":"ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09835","snapshot_observed_at":"2026-08-05T12:24:02.277658Z","title":"Ml-bench: Evaluating large language models and agents for machine learning tasks on repository-level code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.277658Z"},"links":{"cited_paper":"/paper/2311.09835","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:765fdad16a24084200d3c82acf5c637a8a85b105f0d0a81eeca1c59d5dc4133f","observation_id":"744c909d-1d45-4ef6-aa4d-29e09ab1a074","resolution":{"observed_at":"2026-08-05T12:24:02.277658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20424","last_updated":"2024-11-05T19:46:38Z","snapshot_observed_at":"2026-07-06T19:40:21.797132Z","submitted_at":"2024-10-27T12:44:25Z","title":"AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20424","snapshot_observed_at":"2026-08-05T12:24:02.281057Z","title":"Autokaggle: A multi-agent framework for autonomous data science competitions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.281057Z"},"links":{"cited_paper":"/paper/2410.20424","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:9d84266ace7425760fd2fdc8b6df713dc62a348a921e6073cfa0abc8959da846","observation_id":"bbc19c93-e2ff-42b8-b25e-cd50ec355bb9","resolution":{"observed_at":"2026-08-05T12:24:02.281057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.284049Z","title":"Mlrc-bench: Can language agents solve machine learning research challenges? arXiv preprint arXiv:2504.09702, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.284049Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:257450086a2ad1c45e164fd73fca20dea36b88047094d592b06ebae17a73ab09","observation_id":"61707d3e-b884-480a-81fa-d9330985d6e4","resolution":{"observed_at":"2026-08-05T12:24:02.284049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.286622Z","title":"Large language models orchestrating structured reasoning achieve kaggle grandmaster level","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.286622Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:66ce5e1592f3610a693df6df8289ce2e1bf4355071f78b4959f218bd3b5a3756","observation_id":"526feaf1-92f5-44d8-b182-03db1f964a93","resolution":{"observed_at":"2026-08-05T12:24:02.286622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06664","last_updated":"2025-03-09T15:29:46Z","snapshot_observed_at":"2026-08-07T17:18:49.579181Z","submitted_at":"2025-03-09T15:29:46Z","title":"Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06664","snapshot_observed_at":"2026-08-05T12:24:02.289207Z","title":"Exploring llm agents for cleaning tabular machine learning datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.289207Z"},"links":{"cited_paper":"/paper/2503.06664","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:ea3402565cdbe0a860fb382b4fcdb993bf438dedfa37fa304efb595e4bc6e414","observation_id":"b49b0a67-8f9d-4605-8bc0-3af9bf940daa","resolution":{"observed_at":"2026-08-05T12:24:02.289207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15627","last_updated":"2025-05-06T15:53:34Z","snapshot_observed_at":"2026-07-06T20:26:26.110538Z","submitted_at":"2025-01-26T18:25:26Z","title":"HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI","version":2},"cited_work":{"arxiv_id":"2501.15627","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15627","snapshot_observed_at":"2026-08-05T12:24:02.722405Z","title":"HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI","venue":"cs.LG","work_id":"d7f039e2-b713-4be7-810d-9f28274f881e","year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.292197Z"},"links":{"cited_paper":"/paper/2501.15627","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:774169a205ecf7672d076b108688cd1c88a90861a39354b11907c3ecc7cf3943","observation_id":"4ad69974-7d04-4d41-9bf4-127080bd50a7","resolution":{"observed_at":"2026-08-05T12:24:02.725488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02499","last_updated":"2023-05-04T02:09:43Z","snapshot_observed_at":"2026-08-06T19:10:16.774831Z","submitted_at":"2023-05-04T02:09:43Z","title":"AutoML-GPT: Automatic Machine Learning with GPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02499","snapshot_observed_at":"2026-08-05T12:24:02.294801Z","title":"Automl-gpt: automatic machine learning with gpt (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.294801Z"},"links":{"cited_paper":"/paper/2305.02499","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:62aab5d71d61aa5190e1c9806e8bc40aed73087a63acb25b1fd8fd6403e3133d","observation_id":"e5ce4061-220c-472e-a887-5c0ffc568eca","resolution":{"observed_at":"2026-08-05T12:24:02.294801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01881","last_updated":"2025-02-26T13:57:13Z","snapshot_observed_at":"2026-07-06T17:24:37.090243Z","submitted_at":"2024-02-02T20:12:05Z","title":"Large Language Model Agent for Hyper-Parameter Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01881","snapshot_observed_at":"2026-08-05T12:24:02.297408Z","title":"Large language model agent for hyper-parameter optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.297408Z"},"links":{"cited_paper":"/paper/2402.01881","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4f167a51d72e7d6e58e9b90817a5eec111f4f8abb9dbf67e902a8c2fae12a4c5","observation_id":"f59c9e87-c56e-446c-ab10-a4a91451733a","resolution":{"observed_at":"2026-08-05T12:24:02.297408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10478","last_updated":"2024-12-25T16:38:51Z","snapshot_observed_at":"2026-07-06T19:51:09.829522Z","submitted_at":"2024-11-11T21:54:26Z","title":"Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10478","snapshot_observed_at":"2026-08-05T12:24:02.299995Z","title":"Large language models for constructing and optimizing machine learning workflows: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.299995Z"},"links":{"cited_paper":"/paper/2411.10478","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:ca6bc2d9c5ee1b6063892b176e72b40dbc717f0d4715df88133bc405ed771888","observation_id":"33638af2-a3fa-4291-bb47-147f2d248376","resolution":{"observed_at":"2026-08-05T12:24:02.299995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13138","last_updated":"2025-02-18T18:57:21Z","snapshot_observed_at":"2026-08-05T07:03:00.655237Z","submitted_at":"2025-02-18T18:57:21Z","title":"AIDE: AI-Driven Exploration in the Space of Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13138","snapshot_observed_at":"2026-08-05T12:24:02.302689Z","title":"Aide: Ai-driven exploration in the space of code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.302689Z"},"links":{"cited_paper":"/paper/2502.13138","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4303d84ea8ca0bec6956392cc848fdd89a1387c66455ce1e1366e10e25b42185","observation_id":"1bf3b52d-1d92-4dc9-99c0-deaf8c7e7ba6","resolution":{"observed_at":"2026-08-05T12:24:02.302689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.305241Z","title":"I-mcts: Enhancing agentic automl via introspective monte carlo tree search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.305241Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:07be2449f32bb845e46d3cfecd680baef1673e4d6a9120cc8ea36b858c629196","observation_id":"32b4121b-5f6d-406c-a8f9-763cddf1b368","resolution":{"observed_at":"2026-08-05T12:24:02.305241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-05T12:24:02.307581Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.307581Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:128b83f6d623ce12f74d1e89bc1043e61ea7e7821ad4774578cd550840d8558c","observation_id":"f69bf019-b73c-4d00-bfab-c8cbadbbab01","resolution":{"observed_at":"2026-08-05T12:24:02.307581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12334","last_updated":"2025-08-23T18:44:57Z","snapshot_observed_at":"2026-07-06T18:32:44.452493Z","submitted_at":"2024-06-18T06:59:24Z","title":"What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12334","snapshot_observed_at":"2026-08-05T12:24:02.310282Z","title":"What did i do wrong? quantifying llms’ sensitivity and consistency to prompt engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.310282Z"},"links":{"cited_paper":"/paper/2406.12334","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:e0a952dd4d09f6b15f4fa3e613e65856be10d916b83262777ccaa9a93165cb33","observation_id":"f040e31f-271f-434e-905f-a6f0fe38d6ab","resolution":{"observed_at":"2026-08-05T12:24:02.310282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:03.059816Z","title":"Policy gradient meth- ods for reinforcement learning with function approximation","venue":null,"work_id":"19506c5c-22ba-4fea-b31a-a7babfba3b00","year":1999},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.313162Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f3feb06cde0ab2b7d835e94bb7d1cc1373790929de1c9ce71d3376337af53b5b","observation_id":"47208247-8f1c-4afa-a06e-06c1ced3c7b3","resolution":{"observed_at":"2026-08-05T12:24:03.063124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.315451Z","title":"A natural policy gradient","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.315451Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:150576924ff2caceeef976a288d4123ebcb70867e0dac4ef76f7dd3ffeb27349","observation_id":"b4c2fccd-badd-4374-bad3-4d06a283d41d","resolution":{"observed_at":"2026-08-05T12:24:02.315451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.317898Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.317898Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:198e34a6676fdfda7688f4947139c0a577181129700331f0192364e073eba9f5","observation_id":"2ce322a9-b301-4171-9f00-edee91f7b9eb","resolution":{"observed_at":"2026-08-05T12:24:02.317898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.320421Z","title":"Q-learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.320421Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:dd4241bb836afa1cc7a99baf07e973f43d7659751781742377c4e001ef1a52db","observation_id":"9c921657-35d1-4b7f-9254-1fb19008fabf","resolution":{"observed_at":"2026-08-05T12:24:02.320421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.322903Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.322903Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:cfe07faf1d04b6aa3b3ea6639a8464b8363e6b04101ca121f2792482073509d6","observation_id":"01289653-dd89-4bdf-b7b1-b015b37a0994","resolution":{"observed_at":"2026-08-05T12:24:02.322903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.325271Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.325271Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:19b62d625714beaf92b307090f5a49d2280865338ae7f26e1d05bf574cc0fa4c","observation_id":"c862a379-db9e-4500-a98d-c075fb028046","resolution":{"observed_at":"2026-08-05T12:24:02.325271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.02878","last_updated":"2018-10-31T20:11:05Z","snapshot_observed_at":"2026-08-03T09:05:59.371784Z","submitted_at":"2017-09-08T23:13:01Z","title":"TensorFlow Agents: Efficient Batched Reinforcement Learning in TensorFlow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.02878","snapshot_observed_at":"2026-08-05T12:24:02.327658Z","title":"Tensorflow agents: Efficient batched reinforcement learning in tensorflow","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.327658Z"},"links":{"cited_paper":"/paper/1709.02878","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:5bc0cb34842dcbaee7c9c0c0a33dd9619da5bf69d855c4068b8100cddde85faf","observation_id":"5ff97f97-2147-4292-8299-ebd823436c31","resolution":{"observed_at":"2026-08-05T12:24:02.327658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.330223Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.330223Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:5a38b6631a25222bca4ddec8f0787758a997fcd0c9c1362b480f29b54e026057","observation_id":"0789f35c-5da4-4f0e-98f8-939f45184155","resolution":{"observed_at":"2026-08-05T12:24:02.330223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.332833Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.332833Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:2ec49580675019a1ab67011134f1d0175685e70f2890c51b783eccd0a149f859","observation_id":"e821198e-723f-440c-a807-9c844497fc6a","resolution":{"observed_at":"2026-08-05T12:24:02.332833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.335340Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.335340Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:29cae76d5a6066aae77b05ffd444cafb0f3279bcf0adbc94212b398b606db1e0","observation_id":"fba52266-aafe-477b-87f4-e98595bc8d66","resolution":{"observed_at":"2026-08-05T12:24:02.335340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.337694Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.337694Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:553e90e31e646772888a0be0d23cc10ede982f202673e1597fa70b231ce9ff91","observation_id":"0c9982e0-0b5c-44a5-846c-e75b2aa4f9eb","resolution":{"observed_at":"2026-08-05T12:24:02.337694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.340124Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.340124Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:9315b0a2fea514d0183fedbeecc3945dbc05049997dbb0bcff89a2174428e3bd","observation_id":"791f7e20-5df9-4eac-bc45-a78e5bbeb58e","resolution":{"observed_at":"2026-08-05T12:24:02.340124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.342410Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn’t","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.342410Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:7877cb64ce9cac2b935c0e1de562db4df24a3964bdd0f82a783c631332ac70cb","observation_id":"110fa51b-0c9e-426f-aed5-b3fd2a2f26c8","resolution":{"observed_at":"2026-08-05T12:24:02.342410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-05T12:24:02.344754Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.344754Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f4d789beae666226224a809b541c6b343ee3a00ab21f3a0f2f2a0ef6f186b033","observation_id":"a9be106b-4916-4424-b1d1-011921a36fee","resolution":{"observed_at":"2026-08-05T12:24:02.344754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:24:02.347414Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.347414Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:e7dab2ed0098e7d796e6a3b740add34b7c48841fcf1bbf7a0f4a7e69a109f499","observation_id":"8d4775dd-103e-4381-b55a-ae26a0d00da0","resolution":{"observed_at":"2026-08-05T12:24:02.347414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.992857Z","title":"Agentbench: Evaluating llms as agents, 2023","venue":null,"work_id":"48989a94-2b17-4c0d-948f-1c1f4afd188d","year":2023},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.349884Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8702c7a384a165b2056fff8ec188b1a31f3f9fa7c2dfd49459f7cca44590b3cc","observation_id":"054e1061-806e-475b-af2f-b24adf327aa1","resolution":{"observed_at":"2026-08-05T12:24:02.995813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10198","last_updated":"2022-04-22T01:45:49Z","snapshot_observed_at":"2026-07-06T13:02:32.003396Z","submitted_at":"2022-04-18T17:23:11Z","title":"Context-Aware Language Modeling for Goal-Oriented Dialogue Systems","version":2},"cited_work":{"arxiv_id":"2204.10198","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.10198","snapshot_observed_at":"2026-08-05T12:24:02.489048Z","title":"Context-Aware Language Modeling for Goal-Oriented Dialogue Systems","venue":"cs.CL","work_id":"08394768-7a19-41d2-8c84-c90d8c80c909","year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.352831Z"},"links":{"cited_paper":"/paper/2204.10198","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:5c534aafab729bb5c72eb02be0e78a4804b0a89a667ee11e0122eac9eb861686","observation_id":"f725624d-fd98-4f03-9ba1-766c3fe32d60","resolution":{"observed_at":"2026-08-05T12:24:02.492803Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.984217Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":"8bb25634-4562-4588-8288-08f958dc02c4","year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.355657Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f0ca4aac17529c6753ee15b82bff00f4b691916b980497a12b1450b47affabe2","observation_id":"6d631304-f8d8-4a31-bb62-83143c552e6e","resolution":{"observed_at":"2026-08-05T12:24:02.987270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08426","last_updated":"2022-04-18T17:43:21Z","snapshot_observed_at":"2026-07-06T13:01:23.308354Z","submitted_at":"2022-04-18T17:43:21Z","title":"CHAI: A CHatbot AI for Task-Oriented Dialogue with Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08426","snapshot_observed_at":"2026-08-05T12:24:02.358017Z","title":"Chai: A chatbot ai for task-oriented dialogue with offline reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.358017Z"},"links":{"cited_paper":"/paper/2204.08426","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:4a5fb23f56c1cf514d612c32e41d49789eb80a770f3dddb601a8d9ed8475bc3e","observation_id":"c4b31ec5-ca97-4e35-a30f-4380ee3cba57","resolution":{"observed_at":"2026-08-05T12:24:02.358017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.975415Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried and Uri Alon, and Graham Neubig","venue":null,"work_id":"f3519a27-44f8-4a52-91a3-e13ed0c1b3b8","year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.360468Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:8bf09a6814e8528736a05ef6949eb9b6473dca33d45e4010a84d6e2674174426","observation_id":"e560e437-4891-4104-bbe9-cfd7031438cb","resolution":{"observed_at":"2026-08-05T12:24:02.978372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.08941","last_updated":"2015-09-11T23:16:13Z","snapshot_observed_at":"2026-07-06T04:22:23.546609Z","submitted_at":"2015-06-30T05:51:11Z","title":"Language Understanding for Text-based Games Using Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1506.08941","doi":null,"metadata_source":"pith","pith_arxiv_id":"1506.08941","snapshot_observed_at":"2026-08-05T12:24:02.467557Z","title":"Language Understanding for Text-based Games Using Deep Reinforcement Learning","venue":"cs.CL","work_id":"9e124b26-8aa6-488b-8150-cc59b3657d07","year":2015},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.362897Z"},"links":{"cited_paper":"/paper/1506.08941","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f3f8a34ed109a86c41330ddf9cad4087909ecff7432b82b15b6146118606dbaf","observation_id":"a9c7e422-c2ae-4624-8714-edd191db63da","resolution":{"observed_at":"2026-08-05T12:24:02.472444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11871","last_updated":"2023-05-01T04:42:27Z","snapshot_observed_at":"2026-08-04T02:07:56.186059Z","submitted_at":"2022-06-05T18:38:42Z","title":"Offline RL for Natural Language Generation with Implicit Language Q Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11871","snapshot_observed_at":"2026-08-05T12:24:02.365511Z","title":"Offline rl for natural language generation with implicit language q learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.365511Z"},"links":{"cited_paper":"/paper/2206.11871","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:02bdcf943165389fd45defa24c4ef691172cc785c0a1f634a5baab251dc873c6","observation_id":"bd9f13a9-47f1-4a00-b732-6889e6f75555","resolution":{"observed_at":"2026-08-05T12:24:02.365511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-07T22:34:15.668776Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10325","snapshot_observed_at":"2026-08-05T12:24:02.368310Z","title":"Process reward models for llm agents: Practical framework and directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.368310Z"},"links":{"cited_paper":"/paper/2502.10325","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:743d6d70e06854a2e3a2aa9579863ddd393242d936b6f075e5d4ddede7e62c4f","observation_id":"ef0ee11a-e246-440f-8cbe-5c3556f6446b","resolution":{"observed_at":"2026-08-05T12:24:02.368310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-05T12:24:02.371405Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.371405Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:d2458e695f53cb405852653ea2ddacd3ac9999e973646b42986d5fe2873f4c5d","observation_id":"86d3afb9-4361-46b8-b3d1-ff99a13bd789","resolution":{"observed_at":"2026-08-05T12:24:02.371405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-03T10:06:52.418096Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-05T12:24:02.374376Z","title":"Generative reward models.arXiv preprint arXiv:2410.12832, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.374376Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:07084c2d3f0881986593ec8cfd7a80a307951fe79474c316e8afadf72091540f","observation_id":"afebba1c-3ec7-4a55-b95c-cf857a34b4f3","resolution":{"observed_at":"2026-08-05T12:24:02.374376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-03T07:29:21.763809Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-05T12:24:02.377155Z","title":"Au- tonomous evaluation and refinement of digital agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.377155Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:6954f87dcd2b22d8bb0c40f375ba9c625abb3a5ed09f306960561904ebbb45df","observation_id":"b270066d-cec2-4cf4-9af0-0983af8ac565","resolution":{"observed_at":"2026-08-05T12:24:02.377155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04764","last_updated":"2024-02-07T11:27:45Z","snapshot_observed_at":"2026-08-05T18:35:49.744409Z","submitted_at":"2024-02-07T11:27:45Z","title":"Code as Reward: Empowering Reinforcement Learning with VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04764","snapshot_observed_at":"2026-08-05T12:24:02.379856Z","title":"Code as reward: Empowering reinforcement learning with vlms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.379856Z"},"links":{"cited_paper":"/paper/2402.04764","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:52b563be308d0ea51214be1e89a793067cf41c1f3110fc15ab33f14e735944d3","observation_id":"5ef0f259-b734-480b-83f0-32aa46ffb8de","resolution":{"observed_at":"2026-08-05T12:24:02.379856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11239","last_updated":"2024-10-02T11:07:14Z","snapshot_observed_at":"2026-08-03T08:44:22.056144Z","submitted_at":"2024-09-17T14:40:02Z","title":"LLM-as-a-Judge & Reward Model: What They Can and Cannot Do","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11239","snapshot_observed_at":"2026-08-05T12:24:02.382469Z","title":"Llm-as-a-judge & reward model: What they can and cannot do","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.382469Z"},"links":{"cited_paper":"/paper/2409.11239","citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:f259d9a47f016f5aff733d6defbd1e4195fcc8c6a45d5cc2aaebc3483221f9f1","observation_id":"a27a564b-280b-4a49-950f-36f9344456a2","resolution":{"observed_at":"2026-08-05T12:24:02.382469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:24:02.966925Z","title":"‘ re- quest_id,requester_received_pizza t3_i8iy4,0 t3_1mfqi0,0 etc “‘ • Data snippet: -> /workdir/random-acts-of-pizza/prepared/public/test.json: [","venue":null,"work_id":"579f77f5-7100-4b32-9bf8-173a579762a3","year":2022},"citing_paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T12:24:02.385113Z"},"links":{"citing_paper":"/paper/2509.01684"},"observation_digest":"sha256:c49795cb20c302ba4b0301a45d2aa3251e6e252f5259fe78f0543578e8f5c04b","observation_id":"d6fa3e54-ec90-476f-bda8-0103cde99a26","resolution":{"observed_at":"2026-08-05T12:24:02.969875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01684","last_updated":"2025-09-01T18:04:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:18:57.894257Z","submitted_at":"2025-09-01T18:04:10Z","title":"Reinforcement Learning for Machine Learning Engineering Agents"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":3,"verified_fuzzy":10},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 7 inbound Pith citation observations for arXiv:2509.01684."}