Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Learning for Machine Learning Engineering Agents

As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 7 inbound Pith citation observations for arXiv:2509.01684.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.01684 v1

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T12:24:02.385113Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 7 of 7 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T01:39:49.218941Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T13:25:45.948001Z

Reference resolution

62 of 62 outbound references displayed

  • verified exact3
  • verified fuzzy10
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4bf46cd9-754d-4002-aa2b-02ba6e56517d · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

Reinforcement Learning for Machine Learning Engineering Agents SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.221626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.221626Z digest=sha256:962a712656558a2f3ee67586fb6d794925c6dad9e2c0df0adafb0723e1f74984

Observation 144bf1fe-35c3-4062-83d3-ac95553d6215 · outbound

This paper cites Swe-agent: Agent-computer interfaces enable automated software engineering.

Reinforcement Learning for Machine Learning Engineering Agents Swe-agent: Agent-computer interfaces enable automated software engineering

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.225364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.225364Z digest=sha256:d69f0f928d9b53d3ada46ca065b62d1cd52e976a9369ad46bb31dc9b566ca534

Observation 594ff46b-6c87-4ac0-8d3a-9f4b2bdd3cc8 · outbound

This paper cites ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models.

Reinforcement Learning for Machine Learning Engineering Agents ResearchAgent: Iterative Research Idea Generation over Scientific Literature with Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.228568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.228568Z digest=sha256:3ed1e8ad96a0bff5f314ebbe220046147d5e852c0ea50530de8be09246709faa

Observation 47afa8af-5f77-41d0-8d91-daac13edd68a · outbound

This paper cites MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation.

Reinforcement Learning for Machine Learning Engineering Agents MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.231780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.231780Z digest=sha256:987fcb7289f9f0a50787798f958ce2e95b554fa24b7a0210e54f158c881305ad

Observation 9966b5d1-224c-4fea-9a94-78f61bc54f1f · outbound

This paper cites MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering.

Reinforcement Learning for Machine Learning Engineering Agents MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.235163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.235163Z digest=sha256:9e813a59fb5eae5fa68888e2460bffae7d8701e7ba467d8a6e97a9adea0d548d

Observation 9576ef01-37db-4382-b092-150327a1b092 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

Reinforcement Learning for Machine Learning Engineering Agents Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.238210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.238210Z digest=sha256:ce831c297b596c4629534204e8d1ee53ab79c4923688e1785523fc548a602504

Observation c020786e-7f1e-4d7b-8ad6-9f2aee623858 · outbound

This paper cites Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models.

Reinforcement Learning for Machine Learning Engineering Agents Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.241388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.241388Z digest=sha256:630c28dba9a947ef25a47a56f8da4df4a665e2e59ecdcbcffeb8514c0c4228c5

Observation 1f2ffa2e-60cf-4c26-9e4a-77610ae19182 · outbound

This paper cites Reinforcement learning: An introduction, volume 1.

Reinforcement Learning for Machine Learning Engineering Agents Reinforcement learning: An introduction, volume 1

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.244194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.244194Z digest=sha256:19094b3640800dae728a57c9772def0ceb36b18e94d2825ecd9f8ceb5f2d6c19

Observation 0e0cd02a-24e6-4518-85a8-972d9b855e2a · outbound

This paper cites Qwen2.5 Technical Report.

Reinforcement Learning for Machine Learning Engineering Agents Qwen2.5 Technical Report

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.246946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.246946Z digest=sha256:36fe8f3c35b06b393ff35eb412ebe08918364d43c758fa5f0478604bdebd932d

Observation 901e5f44-53a8-4c0b-96f4-3e9d5675e960 · outbound

This paper cites Markov decision processes: discrete stochastic dynamic programming.

Reinforcement Learning for Machine Learning Engineering Agents Markov decision processes: discrete stochastic dynamic programming

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.249817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.249817Z digest=sha256:b739b60fa74bae27822296df90791a8dd6ffe85540479f8d003143d835b6cbb0

Observation 9383b62b-6c1f-4e93-858a-e3c44dd157c0 · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

Reinforcement Learning for Machine Learning Engineering Agents Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.118040Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.252457Z digest=sha256:426d9c7477c01535a9c0b520fe1a1ff3dc99f5b4efd8e9ad6b14bf07e3c6e636

Observation d2c05991-2083-4e0e-b769-9c67a13b0e83 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Reinforcement Learning for Machine Learning Engineering Agents Proximal Policy Optimization Algorithms

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.254998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.254998Z digest=sha256:aeed3eb530d20815561c6dd7f03d0c7c12c6f548b1837eeca33eaeef1e9a5a11

Observation ce8144c7-d782-4342-ba92-85ec442ee0c6 · outbound

This paper cites Efficient exploration in reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents Efficient exploration in reinforcement learning

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.109462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.257737Z digest=sha256:de9ae814aa5c1fdd3f95b92dc103aa064f20cdc9406d008b8265edd77011adc0

Observation df3c1527-bd08-4cde-9319-751b1c54317c · outbound

This paper cites On the sample complexity of reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents On the sample complexity of reinforcement learning

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.101100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.259983Z digest=sha256:e3510187c97ac6fdd1589a0846c3d54063bb1111522a47b3f0ee6af906dea9cc

Observation 23b6d3c8-25cc-4ef7-bd32-6497a846884b · outbound

This paper cites Rllib: Abstractions for distributed reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents Rllib: Abstractions for distributed reinforcement learning

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.092922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.262328Z digest=sha256:071b8a96a84c5eafae631fbd37bb4f9a0496a735849e1100203e7227883c502f

Observation 3e505bb6-a99a-4cf9-9558-1c793b2d0777 · outbound

This paper cites Acme: A Research Framework for Distributed Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents Acme: A Research Framework for Distributed Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.264694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.264694Z digest=sha256:3ee73efe7fc2a537ce782b4f255446dfc75cb0a603843da961025ca5a1a2d077

Observation ebc7e94f-e431-4133-bf0c-d2d9da6c37a8 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

Reinforcement Learning for Machine Learning Engineering Agents HybridFlow: A Flexible and Efficient RLHF Framework

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.267302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.267302Z digest=sha256:5eb7e3dc420906414be11b4f081dea21eea28f89a9a8424e0c4c27678788b490

Observation c69dd7fe-66c9-4769-9702-7e26521eac41 · outbound

This paper cites Openhands: An open platform for ai software developers as generalist agents.

Reinforcement Learning for Machine Learning Engineering Agents Openhands: An open platform for ai software developers as generalist agents

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.270253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.270253Z digest=sha256:409d40a563b7cfd2dee1c5f700e9df894ae43e010c0ad2f959b63552b038f626

Observation 87eb226d-023f-4db7-a7d6-41b1764864f8 · outbound

This paper cites LangChain, October 2022.

Reinforcement Learning for Machine Learning Engineering Agents LangChain, October 2022

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.078785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.272628Z digest=sha256:e306113b01f11cbcfc5024c3fa028cf2432fb64fd2aed234ce094ea7dbb2d92d

Observation f032b7bd-e628-47bf-871d-e3551d297aa3 · outbound

This paper cites an unresolved cited work.

Reinforcement Learning for Machine Learning Engineering Agents Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.274949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.274949Z digest=sha256:437fc6629c41bbabf1fb146ffd958ee350928e9416e3cfbc197fb0be2e77f228

Observation 744c909d-1d45-4ef6-aa4d-29e09ab1a074 · outbound

This paper cites ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code.

Reinforcement Learning for Machine Learning Engineering Agents ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.277658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.277658Z digest=sha256:0c861e07600575c0e850854d1881bff8d7096aaf52ce46f6dfbc06846e561b02

Observation bbc19c93-e2ff-42b8-b25e-cd50ec355bb9 · outbound

This paper cites AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions.

Reinforcement Learning for Machine Learning Engineering Agents AutoKaggle: A Multi-Agent Framework for Autonomous Data Science Competitions

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.281057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.281057Z digest=sha256:67d41e6778ed4233238b255acfa8b8ac098fed4b8b9a54d972ba7d99830f1037

Observation 61707d3e-b884-480a-81fa-d9330985d6e4 · outbound

This paper cites Mlrc-bench: Can language agents solve machine learning research challenges? arXiv preprint arXiv:2504.09702, 2025.

Reinforcement Learning for Machine Learning Engineering Agents Mlrc-bench: Can language agents solve machine learning research challenges? arXiv preprint arXiv:2504.09702, 2025

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.284049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.284049Z digest=sha256:5913350e148969f53a085954abd812da0cf13e68b6b6b8ba6ac87439353a3781

Observation 526feaf1-92f5-44d8-b182-03db1f964a93 · outbound

This paper cites Large language models orchestrating structured reasoning achieve kaggle grandmaster level.

Reinforcement Learning for Machine Learning Engineering Agents Large language models orchestrating structured reasoning achieve kaggle grandmaster level

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.286622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.286622Z digest=sha256:320e18948ec298d7590d79bf98228c6d66a7a6847bbbb52f58aa0c9952b78d0f

Observation b49b0a67-8f9d-4605-8bc0-3af9bf940daa · outbound

This paper cites Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets.

Reinforcement Learning for Machine Learning Engineering Agents Exploring LLM Agents for Cleaning Tabular Machine Learning Datasets

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.289207Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.289207Z digest=sha256:867951027ecc77e6a87429270bae0c4b7803d267c95346badbc8cc9dda18f013

Observation 4ad69974-7d04-4d41-9bf4-127080bd50a7 · outbound

This paper cites HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI.

Reinforcement Learning for Machine Learning Engineering Agents HardML: A Benchmark For Evaluating Data Science And Machine Learning knowledge and reasoning in AI

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-08-05T12:24:02.725488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.292197Z digest=sha256:a70fb8d11761da1b8a5623a174d7eb166d37919bdf20d5c1c0068796143ceda2

Observation e5ce4061-220c-472e-a887-5c0ffc568eca · outbound

This paper cites AutoML-GPT: Automatic Machine Learning with GPT.

Reinforcement Learning for Machine Learning Engineering Agents AutoML-GPT: Automatic Machine Learning with GPT

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.294801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.294801Z digest=sha256:da1b0d41f4e91f7c261104acb88e8f65c8c87cbadeed8b0bdc2569f0ecdfce08

Observation f59c9e87-c56e-446c-ab10-a4a91451733a · outbound

This paper cites Large Language Model Agent for Hyper-Parameter Optimization.

Reinforcement Learning for Machine Learning Engineering Agents Large Language Model Agent for Hyper-Parameter Optimization

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.297408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.297408Z digest=sha256:6a6ff7e3b71ac6ce621177fc6ac8d7998143783ff4abc3a0d0852603d2d1dba1

Observation 33638af2-a3fa-4291-bb47-147f2d248376 · outbound

This paper cites Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey.

Reinforcement Learning for Machine Learning Engineering Agents Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.299995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.299995Z digest=sha256:9a2d99c413051f55031f0d10095bc8b689121b7e77291598f12bc4f7096e1f92

Observation 1bf3b52d-1d92-4dc9-99c0-deaf8c7e7ba6 · outbound

This paper cites AIDE: AI-Driven Exploration in the Space of Code.

Reinforcement Learning for Machine Learning Engineering Agents AIDE: AI-Driven Exploration in the Space of Code

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.302689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.302689Z digest=sha256:a474fcce0db5d993135cb07b7b595b83a6dffdac1f33f19ade5883996dc90007

Observation 32b4121b-5f6d-406c-a8f9-763cddf1b368 · outbound

This paper cites I-mcts: Enhancing agentic automl via introspective monte carlo tree search.

Reinforcement Learning for Machine Learning Engineering Agents I-mcts: Enhancing agentic automl via introspective monte carlo tree search

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.305241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.305241Z digest=sha256:f5f98096db84a891f36497f0a89c121819965b4f42ffeda5f0548f6294a558fd

Observation f69bf019-b73c-4d00-bfab-c8cbadbbab01 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

Reinforcement Learning for Machine Learning Engineering Agents Large Language Models Cannot Self-Correct Reasoning Yet

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.307581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.307581Z digest=sha256:007e6ee9e7579a047279843bd64ec6bcda0bf45a941de4c30789f492b0eae169

Observation f040e31f-271f-434e-905f-a6f0fe38d6ab · outbound

This paper cites What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering.

Reinforcement Learning for Machine Learning Engineering Agents What Did I Do Wrong? Quantifying LLMs' Sensitivity and Consistency to Prompt Engineering

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.310282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.310282Z digest=sha256:c82738ae3f7494eeeec43f56f5346dea087b28c7beabf211604d232909ce1a52

Observation 47208247-8f1c-4afa-a06e-06c1ced3c7b3 · outbound

This paper cites Policy gradient meth- ods for reinforcement learning with function approximation.

Reinforcement Learning for Machine Learning Engineering Agents Policy gradient meth- ods for reinforcement learning with function approximation

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:03.063124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.313162Z digest=sha256:a8309d537f1ab07d336ac7d5fea6420dea71ead0536332d0b251dfcfa5e518cc

Observation b4c2fccd-badd-4374-bad3-4d06a283d41d · outbound

This paper cites A natural policy gradient.

Reinforcement Learning for Machine Learning Engineering Agents A natural policy gradient

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.315451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.315451Z digest=sha256:002279639d1b4f2340134cdc67413279723b3ec70369ad31600db925d3826c95

Observation 2ce322a9-b301-4171-9f00-edee91f7b9eb · outbound

This paper cites Trust region policy optimization.

Reinforcement Learning for Machine Learning Engineering Agents Trust region policy optimization

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.317898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.317898Z digest=sha256:42c3b3ff18247cca339c9d95bf89947731cd7ab4c72b1d913e5e418bff33ef74

Observation 9c921657-35d1-4b7f-9254-1fb19008fabf · outbound

This paper cites Q-learning.

Reinforcement Learning for Machine Learning Engineering Agents Q-learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.320421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.320421Z digest=sha256:9efd067ab0e31e2359a5fd16e74c8b836f9a6332835fc5df2f164d2557f2150d

Observation 01289653-dd89-4bdf-b7b1-b015b37a0994 · outbound

This paper cites Mujoco: A physics engine for model-based control.

Reinforcement Learning for Machine Learning Engineering Agents Mujoco: A physics engine for model-based control

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.322903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.322903Z digest=sha256:58afc040ad57bf67bcd3ead55bc89598e5613606aaf3449d17cb4c6c2bca5571

Observation c862a379-db9e-4500-a98d-c075fb028046 · outbound

This paper cites The arcade learning environment: An evaluation platform for general agents.

Reinforcement Learning for Machine Learning Engineering Agents The arcade learning environment: An evaluation platform for general agents

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.325271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.325271Z digest=sha256:e86e2675a867aec5497ff8717d2f806b2147a5786e9c12d4fcbb2b37d100c3f0

Observation 5ff97f97-2147-4292-8299-ebd823436c31 · outbound

This paper cites TensorFlow Agents: Efficient Batched Reinforcement Learning in TensorFlow.

Reinforcement Learning for Machine Learning Engineering Agents TensorFlow Agents: Efficient Batched Reinforcement Learning in TensorFlow

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.327658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.327658Z digest=sha256:317b17c4be3c16e10547ce45c205fd8e4bd0b968e4e4ec69935c07fbd7f920af

Observation 0789f35c-5da4-4f0e-98f8-939f45184155 · outbound

This paper cites Training language models to follow instructions with human feedback.

Reinforcement Learning for Machine Learning Engineering Agents Training language models to follow instructions with human feedback

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.330223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.330223Z digest=sha256:b014c736068449db979db6a32cf1020f4d0bdcc739d3a9921a2ed49d5283254d

Observation e821198e-723f-440c-a807-9c844497fc6a · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Reinforcement Learning for Machine Learning Engineering Agents Direct preference optimization: Your language model is secretly a reward model

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.332833Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.332833Z digest=sha256:4703a31f4f5df0c38bc819f132dfd8e77b02b22fa8e8c51ec4d683f76f30c8e9

Observation fba52266-aafe-477b-87f4-e98595bc8d66 · outbound

This paper cites Brown, Miljan Martic, Shane Legg, and Dario Amodei.

Reinforcement Learning for Machine Learning Engineering Agents Brown, Miljan Martic, Shane Legg, and Dario Amodei

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.335340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.335340Z digest=sha256:2ad2ae0c820dc29933ace50cf0a00e44fcd8d8665400cceb9ba448907264cbcb

Observation 0c9982e0-0b5c-44a5-846c-e75b2aa4f9eb · outbound

This paper cites Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B.

Reinforcement Learning for Machine Learning Engineering Agents Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.337694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.337694Z digest=sha256:557adc4ccf94d895b9ee2dbf760af9cef5edf7428a6dfe659406ffe7b6b1d055

Observation 791f7e20-5df9-4eac-bc45-a78e5bbeb58e · outbound

This paper cites Rlaif: Scaling reinforcement learning from human feedback with ai feedback.

Reinforcement Learning for Machine Learning Engineering Agents Rlaif: Scaling reinforcement learning from human feedback with ai feedback

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.340124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.340124Z digest=sha256:d626230c99eaac4ba99606185aae08e4c358bdfe5e0531640390501aaf812841

Observation 110fa51b-0c9e-426f-aed5-b3fd2a2f26c8 · outbound

This paper cites Reinforcement learning for reasoning in small llms: What works and what doesn’t.

Reinforcement Learning for Machine Learning Engineering Agents Reinforcement learning for reasoning in small llms: What works and what doesn’t

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.342410Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.342410Z digest=sha256:c523acd4a5e1af9830a3ca5b5e100874041fc0813956d45c8999a3907dc37a45

Observation a9be106b-4916-4424-b1d1-011921a36fee · outbound

This paper cites SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution.

Reinforcement Learning for Machine Learning Engineering Agents SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.344754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.344754Z digest=sha256:5755c7da9c15cdd85ffaa5a36476498aecc6600e4494b8c42045f1d26c91d2be

Observation 8d4775dd-103e-4381-b55a-ae26a0d00da0 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.347414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.347414Z digest=sha256:1102d95c7869ee6701711f2932a8e382c39ce8d8986bacdde5674e2fc8a1941f

Observation 054e1061-806e-475b-af2f-b24adf327aa1 · outbound

This paper cites Agentbench: Evaluating llms as agents, 2023.

Reinforcement Learning for Machine Learning Engineering Agents Agentbench: Evaluating llms as agents, 2023

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.995813Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.349884Z digest=sha256:2ca306516b01cc71427907d0d8510c00b21ee21aceb56f1b8153889edb31bb33

Observation f725624d-fd98-4f03-9ba1-766c3fe32d60 · outbound

This paper cites Context-Aware Language Modeling for Goal-Oriented Dialogue Systems.

Reinforcement Learning for Machine Learning Engineering Agents Context-Aware Language Modeling for Goal-Oriented Dialogue Systems

Reference 50

Resolution
verified exact
local_arxiv, observed 2026-08-05T12:24:02.492803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.352831Z digest=sha256:9b9f2ac2fa7b3c651c7debb315a7d81672898ebbb24e399a98057e60d100f0e1

Observation 6d631304-f8d8-4a31-bb62-83143c552e6e · outbound

This paper cites Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning.

Reinforcement Learning for Machine Learning Engineering Agents Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.987270Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.355657Z digest=sha256:dfcd3f70b82971fbca718e5fd92a4aa8df1b999d4c705af7b3e52578f226773f

Observation c4b31ec5-ca97-4e35-a30f-4380ee3cba57 · outbound

This paper cites CHAI: A CHatbot AI for Task-Oriented Dialogue with Offline Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents CHAI: A CHatbot AI for Task-Oriented Dialogue with Offline Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.358017Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.358017Z digest=sha256:cf438f29b456b31f8f46a49b4083eab14454f8c375a436f9196db9b11078c0e2

Observation e560e437-4891-4104-bbe9-cfd7031438cb · outbound

This paper cites Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried and Uri Alon, and Graham Neubig.

Reinforcement Learning for Machine Learning Engineering Agents Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried and Uri Alon, and Graham Neubig

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.978372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.360468Z digest=sha256:97db671e52f6dfcb7d13e41a41de3a5e7beda48b56854a93c56211517d9ec793

Observation a9c7e422-c2ae-4624-8714-edd191db63da · outbound

This paper cites Language Understanding for Text-based Games Using Deep Reinforcement Learning.

Reinforcement Learning for Machine Learning Engineering Agents Language Understanding for Text-based Games Using Deep Reinforcement Learning

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-08-05T12:24:02.472444Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.362897Z digest=sha256:c491f9b6863d55094c194d7513806f8f7921252c37e848df9c35555099861898

Observation bd9f13a9-47f1-4a00-b732-6889e6f75555 · outbound

This paper cites Offline RL for Natural Language Generation with Implicit Language Q Learning.

Reinforcement Learning for Machine Learning Engineering Agents Offline RL for Natural Language Generation with Implicit Language Q Learning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.365511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.365511Z digest=sha256:0c37f6ee8dfa0d6c373e7529791d4b368ebbd490fab5bdd06935099ab7d5f26a

Observation ef0ee11a-e246-440f-8cbe-5c3556f6446b · outbound

This paper cites Process Reward Models for LLM Agents: Practical Framework and Directions.

Reinforcement Learning for Machine Learning Engineering Agents Process Reward Models for LLM Agents: Practical Framework and Directions

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.368310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.368310Z digest=sha256:5a0ce896d99bfca685f1ae6cac20ae1d601406b1ca1ba48ebfd110df15018381

Observation 86d3afb9-4361-46b8-b3d1-ff99a13bd789 · outbound

This paper cites Generative Verifiers: Reward Modeling as Next-Token Prediction.

Reinforcement Learning for Machine Learning Engineering Agents Generative Verifiers: Reward Modeling as Next-Token Prediction

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.371405Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.371405Z digest=sha256:ff8b4c4b9f041599137d12a2fd95bcb87c127fea07ff57c1d8b3bbca565ad8b7

Observation afebba1c-3ec7-4a55-b95c-cf857a34b4f3 · outbound

This paper cites Generative Reward Models.

Reinforcement Learning for Machine Learning Engineering Agents Generative Reward Models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.374376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.374376Z digest=sha256:faefb90f5cb0f289ea2c44029bfb6cddfe2c30f809347aa02bb68faba1dd1941

Observation b270066d-cec2-4cf4-9af0-0983af8ac565 · outbound

This paper cites Autonomous Evaluation and Refinement of Digital Agents.

Reinforcement Learning for Machine Learning Engineering Agents Autonomous Evaluation and Refinement of Digital Agents

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.377155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.377155Z digest=sha256:6b1fac145ba875b554e88a879cec7da4d1e3492d54d97e5a5c62af1ac325cec3

Observation 5ef0f259-b734-480b-83f0-32aa46ffb8de · outbound

This paper cites Code as Reward: Empowering Reinforcement Learning with VLMs.

Reinforcement Learning for Machine Learning Engineering Agents Code as Reward: Empowering Reinforcement Learning with VLMs

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.379856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.379856Z digest=sha256:c71ab02371a1468036cd62d9c93bc58ebaaf32bdc5a5a0e7eacb9120fea83b76

Observation a27a564b-280b-4a49-950f-36f9344456a2 · outbound

This paper cites LLM-as-a-Judge & Reward Model: What They Can and Cannot Do.

Reinforcement Learning for Machine Learning Engineering Agents LLM-as-a-Judge & Reward Model: What They Can and Cannot Do

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-05T12:24:02.382469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:24:02.382469Z digest=sha256:276f5837e147bdb1509a116ae1ba06bd75225af807466353bd273ffff48525db

Observation d6fa3e54-ec90-476f-bda8-0103cde99a26 · outbound

This paper cites ‘ re- quest_id,requester_received_pizza t3_i8iy4,0 t3_1mfqi0,0 etc “‘ • Data snippet: -> /workdir/random-acts-of-pizza/prepared/public/test.json: [.

Reinforcement Learning for Machine Learning Engineering Agents ‘ re- quest_id,requester_received_pizza t3_i8iy4,0 t3_1mfqi0,0 etc “‘ • Data snippet: -> /workdir/random-acts-of-pizza/prepared/public/test.json: [

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T12:24:02.969875Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T12:24:02.385113Z digest=sha256:ba01e407adffd340f55813ec9ec70bc60854496eef094242d5ee4217781f9ded

Pith citing papers

Observation b3137228-5778-4160-88a4-893fd1c75603 · inbound

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents cites this paper.

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents Reinforcement Learning for Machine Learning Engineering Agents

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-11T05:00:56.352524Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-11T00:54:39.349292Z digest=sha256:33102793ecbf06974176d4380c24b2e8ca3128897bbbb6b5c58f8a9743cb6f9f

Observation 5630521f-8c37-4617-a14a-a9b49de7a90b · inbound

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI cites this paper.

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI Reinforcement Learning for Machine Learning Engineering Agents

Reference 114

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:21:25.286968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-12T01:13:35.990078Z digest=sha256:2c9bdfcde0dd4e383d5dd0369eae69a65ee587a4a7050f363c20d0f617e438b5

Observation 57a77419-c52c-4371-a291-6d2b39a723ff · inbound

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI cites this paper.

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI Reinforcement Learning for Machine Learning Engineering Agents

Reference 116

Resolution
verified exact
arxiv_id, observed 2026-07-01T13:25:45.958176Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-06-30T23:12:57.154537Z digest=sha256:8b058dcc9d6126c8caca97ac08d49317e46e8b26a04a03929ae7ec048a45af92

Observation 86ff746c-ce33-464e-926e-0bee3a1a5c7f · inbound

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI cites this paper.

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI Reinforcement Learning for Machine Learning Engineering Agents

Reference 115

Resolution
unresolved
no resolver link, observed 2026-07-12T17:14:49.310598Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T17:14:49.310598Z digest=sha256:4c81f3b00cb280afbd5aba5b2dedb9e205ca88ed87d4c4e5168fa36bd8b50bcc

Observation 83d2cc52-cd90-48ae-a519-dba65306dc3c · inbound

Revisiting DAgger in the Era of LLM-Agents cites this paper.

Revisiting DAgger in the Era of LLM-Agents Reinforcement Learning for Machine Learning Engineering Agents

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:57:53.418198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-14T19:56:06.762156Z digest=sha256:1ba8309eac2ff3e69100b7cbcdaefe02cffe5d344d7008dfa25199c4648e9a92

Observation 082a7f23-a38a-4140-b7dd-43e98d831d0b · inbound

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards cites this paper.

Reinforcement Learning with Verifiable Physics: Post-training LLMs with Continuous Rewards Reinforcement Learning for Machine Learning Engineering Agents

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-14T11:28:23.511747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:28:23.511747Z digest=sha256:deef832b8e2b4f74856d33fbf6562a55582e160f4d4856b9f8554cdffa9fc851

Observation b223f18e-0fb4-47d0-86b2-c12b00bf2c00 · inbound

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering cites this paper.

Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering Reinforcement Learning for Machine Learning Engineering Agents

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-31T01:39:49.218941Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T01:39:49.218941Z digest=sha256:3a2f251ae7ddcb207e55127bd518a2315710bb52320bd4281c2d42145d9fc427