{"as_of":"2026-08-09T13:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ca6f5eda673098f55ada9f4cfc7f6308847ac21d267e2b1c8d1c6f1a74429cd","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:16:08.504844Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:47:59.075366Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:18:55.557008Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-06T21:34:46.041153Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T13:48:53.691192Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2509.16941"},"observation_digest":"sha256:e60834fb7aeb385ecea6d74b3c3bb5938486c683e17959c2054720528afbeb54","observation_id":"781e070c-9bf1-4920-951e-e58502d4508d","resolution":{"observed_at":"2026-05-12T13:48:53.748215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-04T11:02:07.533516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07315","last_updated":"2026-06-05T00:30:48Z","snapshot_observed_at":"2026-08-09T09:17:42.101421Z","submitted_at":"2025-10-08T17:59:19Z","title":"SWE-IF: Aligning Code Evaluation with Human Preference","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:02:07.533516Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2510.07315"},"observation_digest":"sha256:7e4de5c60d5025a8939e9b5a4e44cb661427e00e34c419bcb3c13494af58a955","observation_id":"5b423429-604d-4cd8-81b3-3549e256206a","resolution":{"observed_at":"2026-08-04T11:02:07.533516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-03T07:17:13.394276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.20789","last_updated":"2026-05-29T01:36:45Z","snapshot_observed_at":"2026-08-06T06:19:33.132630Z","submitted_at":"2026-01-28T17:27:08Z","title":"SERA: Soft-Verified Efficient Repository Agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T07:17:13.394276Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2601.20789"},"observation_digest":"sha256:4f606a87ff6c45c38462d4d4579e99eead5e5a07cb623efe7bb58407c41f2f21","observation_id":"be23bde6-0887-4ca3-8224-7e9394f1323a","resolution":{"observed_at":"2026-08-03T07:17:13.394276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-12T22:37:45.905230Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.10491","last_updated":"2026-06-26T21:15:41Z","snapshot_observed_at":"2026-07-12T22:37:39.012623Z","submitted_at":"2026-04-12T06:50:43Z","title":"Fate of Secondary Droplets Produced by High-speed Raindrops Interacting with a Liquid Pool","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T22:37:45.905230Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2604.10491"},"observation_digest":"sha256:45e1ec63c429a12f0c7c260262de558045ed3907c74437d2a71426489ae69bae","observation_id":"e5d51157-6f35-401b-8ef8-9bbce2b3ba2b","resolution":{"observed_at":"2026-07-12T22:37:45.905230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2604.10493","last_updated":"2026-04-12T06:51:47Z","snapshot_observed_at":"2026-08-05T15:06:05.225966Z","submitted_at":"2026-04-12T06:51:47Z","title":"SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:21:12.961613Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2604.10493"},"observation_digest":"sha256:5ed1a4e0173eee85e918c4dcf21e4551787c7216cb4e649d0fde5b938fe6d511","observation_id":"185f9dde-b76d-43cc-aa4a-48b40b711c9d","resolution":{"observed_at":"2026-05-11T09:00:59.385102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:7c739e009f202384ac47b1d63b524ff45d668e4c3d85b808f61b8dbd30e301a0","observation_id":"b3de5738-ffac-4b63-a2f8-55a9dce22fc5","resolution":{"observed_at":"2026-05-10T23:15:49.121327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2605.12969","last_updated":"2026-05-30T10:28:38Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T04:02:36Z","title":"Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T20:21:26.640493Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2605.12969"},"observation_digest":"sha256:5d0640e5c95ea6dbdca5bde93a42e98e52f33570b02f95abd3e7472bbf6ad337","observation_id":"740bad67-0768-4658-9cd9-47c50619a692","resolution":{"observed_at":"2026-05-14T20:22:54.783701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2605.12969","last_updated":"2026-05-30T10:28:38Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T04:02:36Z","title":"Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T21:42:49.452347Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2605.12969"},"observation_digest":"sha256:8765f1d90ba352dfb7f07cf9f99aed227b7eadbb5a14ce5837043b1bf64b2201","observation_id":"7bfd02ae-5fcf-4231-b1ec-fc33107928ff","resolution":{"observed_at":"2026-05-20T21:43:45.447084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.01619","last_updated":"2026-06-08T06:27:26Z","snapshot_observed_at":"2026-08-02T17:32:43.717169Z","submitted_at":"2026-06-01T03:12:05Z","title":"ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T14:49:40.239199Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.01619"},"observation_digest":"sha256:6bc833ae0458279dca28ca00a9f4cb26e1a195e839a4125bade127491ef6970f","observation_id":"3a167a8b-7dcc-41da-90bf-ab85eb4d7060","resolution":{"observed_at":"2026-07-01T22:56:20.921429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-08T12:21:41.888056Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:10:06.685591Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:e52e006b8b03d0c4ab20c0a0cabf385973a4ac181d7b04f5bcec777ed748e91b","observation_id":"076142ad-da01-4de0-a46d-bc4db2f109f8","resolution":{"observed_at":"2026-07-02T02:16:26.212323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-12T15:15:09.675778Z","title":"Agent-RLVR: Training software engineering agents via guidance and environment rewards.arXiv:2506.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-08T12:21:41.888056Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T15:15:09.675778Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:0016ed6eb9da994d3345a25ace404c8933392d4b9a7054de30ba2dafbff69baf","observation_id":"9c15bb12-a2e7-4b9f-8422-7f29e39538a1","resolution":{"observed_at":"2026-07-12T15:15:09.675778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.03963","last_updated":"2026-06-09T15:09:32Z","snapshot_observed_at":"2026-08-05T23:50:00.007370Z","submitted_at":"2026-06-02T17:50:15Z","title":"AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:03:54.185019Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.03963"},"observation_digest":"sha256:0225c55557a4c0345fb1c88f47694ad5a9218de5b985cb103df93c971c21037a","observation_id":"b55f1ba7-cf7d-4b55-b1b0-60b03a905c3b","resolution":{"observed_at":"2026-07-02T03:26:29.320110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-05T04:59:46.668803Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:e46207d276c60b0bb364a144b63ba20a82901445ab6ae887149c068112d7b487","observation_id":"cdbe7401-d4c8-4938-b932-ec10e1591b6f","resolution":{"observed_at":"2026-07-03T14:58:33.180739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":"2506.11425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-03T20:18:55.557008Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards","venue":null,"work_id":"8004998c-b315-4791-bd76-2c438beeb63e","year":2025},"citing_paper":{"arxiv_id":"2607.01465","last_updated":"2026-07-01T20:55:07Z","snapshot_observed_at":"2026-08-08T13:34:00.921694Z","submitted_at":"2026-07-01T20:55:07Z","title":"Beyond Next-Token Prediction: An RLVR Proof of Concept for Tool-Use Agents on Atlassian Workflows","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-03T20:18:07.134598Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.01465"},"observation_digest":"sha256:25490f4b06be1930b36d819dd434aebb4ca21fb89ccfb40cf241fd39012ba9f3","observation_id":"8f126582-5c6b-4f46-86c0-ef9ee3d9f93d","resolution":{"observed_at":"2026-07-03T20:18:55.558939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agent-rlvr: Training software engineering agents via guidance and environment rewards.arXiv preprint arXiv:2506.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-06T23:48:50.589215Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:d37d56efc22cb3f342472159cabce415cc329cb8eacc953802b7a5908b8f4731","observation_id":"daced041-f2dc-4f63-8d6b-cc3dd8ae344b","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-02T14:50:10.280348Z","title":"Wang, Xiang Deng, Yuntao Ma, Nikhil Barhate, and Sean M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-06T07:49:27.049032Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:10.280348Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:989467c3cba2bb4958d0155b28c25006ba1fe30584c510421199fd3b6af9c100","observation_id":"6bd6e6ce-b523-4888-a300-1909ca46bcc4","resolution":{"observed_at":"2026-08-02T14:50:10.280348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-01T02:44:29.759049Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.759049Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:17544f19f337f0e08a8d7b139e120fd65f13923ef8b5bc44db9fb3be1d26b39a","observation_id":"003a6523-95fe-4860-8329-fc4f1bbafd50","resolution":{"observed_at":"2026-08-01T02:44:29.759049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11425","snapshot_observed_at":"2026-08-05T19:47:59.075366Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03392","last_updated":"2026-08-04T09:43:46Z","snapshot_observed_at":"2026-08-09T03:26:37.438853Z","submitted_at":"2026-08-04T09:43:46Z","title":"Self-Evolving Coding Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T19:47:59.075366Z"},"links":{"cited_paper":"/paper/2506.11425","citing_paper":"/paper/2608.03392"},"observation_digest":"sha256:2b75c0a5aa15df4738490bbeaac923677afc2bd579b7925192978ca54058c0aa","observation_id":"a67c7176-23ad-40d9-a1f1-c3825501dc7b","resolution":{"observed_at":"2026-08-05T19:47:59.075366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11425/citation-record","integrity":"/paper/2506.11425/integrity","json":"/paper/2506.11425/citation-record.json","paper":"/paper/2506.11425"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:16:08.416963Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.416963Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:ada3d9d0ffbebe7dd9a3cc0173d499746013d2f6447dd17b9ff674b2ab9b7fd2","observation_id":"2e8a4e8c-3519-4492-9a04-355aaf229ffb","resolution":{"observed_at":"2026-08-07T04:16:08.416963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.788977Z","title":"Jimenez, John Yang, Leyton Ho, Tejal Patwardhan, Kevin Liu, and Aleksander Madry","venue":null,"work_id":"3de8afa3-7984-4946-952a-3e2a7c3a23d7","year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.420827Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:07a0e1f3c0903796628e7399d117e9ac8b31524778aac9bf4a2a24fbc15149ac","observation_id":"2be21a07-10c6-4a7e-8a2c-de4d7ffe1fbd","resolution":{"observed_at":"2026-08-07T04:16:08.792345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.779422Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Francis Christiano","venue":null,"work_id":"82b6c304-901f-44f3-a7ff-172bdd7934fa","year":2020},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.424091Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:ac58ff38b8fad45a089a365333c35aef0cd0840557630d706b8b831cfbfda658","observation_id":"26e9f587-880d-4a73-af48-7edce2138133","resolution":{"observed_at":"2026-08-07T04:16:08.782440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T04:16:08.427531Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.427531Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:6718254e7a2847a5cbb38355511955e5fe138993e4374eaf92ad5b43e0a121be","observation_id":"9ef3b7a6-547a-4159-8202-4cc7b3f3955b","resolution":{"observed_at":"2026-08-07T04:16:08.427531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T04:16:08.431125Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.431125Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:16be9bdf6b2b0ad274ee9e9f2aedf7bdaed71963ae78708a6b707a29f600c332","observation_id":"52a0bac0-0a79-48b3-9954-97d235ffae56","resolution":{"observed_at":"2026-08-07T04:16:08.431125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T04:16:08.434730Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.434730Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:b24901ceed1b419012b1f8c910b6776c8b96c5da5e18305c1f6e3e73e379603b","observation_id":"648ece32-822b-46ac-bbb7-c8210ea004b3","resolution":{"observed_at":"2026-08-07T04:16:08.434730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T04:16:08.438286Z","title":"Measur- ing coding challenge competence with apps.ArXiv, abs/2105.09938, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.438286Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:e617bd12e67301d0592ffdb5d4e304cddbf2dde4bb086a72a389ea8bf3c37a59","observation_id":"296b8740-ec45-45a5-ac84-fbdb4c8ad79e","resolution":{"observed_at":"2026-08-07T04:16:08.438286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03733","last_updated":"2024-10-18T23:53:07Z","snapshot_observed_at":"2026-07-06T19:11:09.921186Z","submitted_at":"2024-09-05T17:44:49Z","title":"Planning In Natural Language Improves LLM Search For Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03733","snapshot_observed_at":"2026-08-07T04:16:08.441362Z","title":"Hendryx, Summer Yue, and Hugh Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.441362Z"},"links":{"cited_paper":"/paper/2409.03733","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:00efb58a6138149dc3f2013c5d4651d14487ff240ff3996415b3ecf6174c5fd8","observation_id":"d0d8936d-8db1-40fc-b6db-a3e511e0c6b0","resolution":{"observed_at":"2026-08-07T04:16:08.441362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T04:16:08.444325Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.444325Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:fab50606bacd2e01de3481803606a07398673cb2af89ef20578d5d16f1796f2d","observation_id":"4315de77-c1db-4f60-8992-5305968fe354","resolution":{"observed_at":"2026-08-07T04:16:08.444325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21139","last_updated":"2025-06-06T07:53:20Z","snapshot_observed_at":"2026-07-06T20:14:49.976782Z","submitted_at":"2024-12-30T18:15:39Z","title":"Training Software Engineering Agents and Verifiers with SWE-Gym","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21139","snapshot_observed_at":"2026-08-07T04:16:08.447400Z","title":"Training software engineering agents and verifiers with swe-gym.ArXiv, abs/2412.21139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.447400Z"},"links":{"cited_paper":"/paper/2412.21139","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:a133ac047a2749cafd9dfe9bf5b0c483440559be2f62bd6afba048b04eab4b97","observation_id":"d9d2ea16-8ced-45e5-b3b9-8b4c7e20e7a4","resolution":{"observed_at":"2026-08-07T04:16:08.447400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.450383Z","title":"STar: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.450383Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:dba8522055da4580fa27710669c47187c850a544d597eead3ba6df26da311a40","observation_id":"ca8a7a1b-1699-4885-a4f5-e1e89984aa7a","resolution":{"observed_at":"2026-08-07T04:16:08.450383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T04:16:08.453021Z","title":"Doucet, Orhan Firat, and Nando de Freitas","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.453021Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:ef27be7b9c6270e071018de9b43591c806526346f494ea54ce9bf9f2bf01e3bc","observation_id":"3a744ce8-b809-4fce-8d52-db70b358bad4","resolution":{"observed_at":"2026-08-07T04:16:08.453021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-07T04:16:08.456160Z","title":"Agentless: Demystifying llm-based software engineering agents.ArXiv, abs/2407.01489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.456160Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:b0cae95c9e915ff84171bd2306d0f4b091bfa3fb94597a50083c1923837d7077","observation_id":"beb20196-bca5-4497-ad80-500001be350b","resolution":{"observed_at":"2026-08-07T04:16:08.456160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:16:08.763289Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yueqi Song, Bowen Li, Jaskirat Singh, Hoang H","venue":null,"work_id":"b6cfca7e-3399-4f16-b87e-2197e220c226","year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.459059Z"},"links":{"citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:07277f829313a71de5a21c3c85eb6984a842d17f55b4b3c827fbd64489cde0b6","observation_id":"1326b1c1-5622-47b3-b55f-f8146d15cacb","resolution":{"observed_at":"2026-08-07T04:16:08.767942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05040","last_updated":"2025-05-07T04:06:41Z","snapshot_observed_at":"2026-07-06T20:18:35.429115Z","submitted_at":"2025-01-09T07:54:24Z","title":"SWE-Fixer: Training Open-Source LLMs for Effective and Efficient GitHub Issue Resolution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05040","snapshot_observed_at":"2026-08-07T04:16:08.461930Z","title":"Swe- fixer: Training open-source llms for effective and efficient github issue resolution.ArXiv, abs/2501.05040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.461930Z"},"links":{"cited_paper":"/paper/2501.05040","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:6984e1a0a39410cef3275f81d70c73b90acbfbdeca099918f75a4261251b2bdc","observation_id":"0d47d712-a232-45d9-8689-ce8afc3db309","resolution":{"observed_at":"2026-08-07T04:16:08.461930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T04:16:08.464749Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution.ArXiv, abs/2502.18449, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.464749Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:76afc0a470bc89caa6236d2c9029fda8b38acc334b1bddc76e09a390401d67aa","observation_id":"23dfffdb-63d4-418f-819d-d61496ea7326","resolution":{"observed_at":"2026-08-07T04:16:08.464749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-07-06T18:08:04.815730Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-08-07T04:16:08.467524Z","title":"Hendryx, Russell Kaplan, Michele Lunati, and Summer Yue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.467524Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:e0c426a95d16f317c0410add70aa8ec0607b1ce30c780ff961d60e558c312bd6","observation_id":"1925b323-2750-4627-87d1-38c89723b7df","resolution":{"observed_at":"2026-08-07T04:16:08.467524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T04:16:08.471002Z","title":"Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Chris Wilhelm, Luca Soldaini, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.471002Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:14bb8ecff3fc0f60223fa7befab4c0fa4cfe2d503872e07e2986647329bef898","observation_id":"1e6cc14a-eafc-44b5-8a91-32cb06d268a9","resolution":{"observed_at":"2026-08-07T04:16:08.471002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:16:08.473951Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.473951Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:dd6fe6b99ce77394cc3a93d881390779ec694b766a47dc2e585396031b4ee8c3","observation_id":"28a93968-05ef-4510-b354-23379f10466e","resolution":{"observed_at":"2026-08-07T04:16:08.473951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01769","last_updated":"2024-12-02T18:11:30Z","snapshot_observed_at":"2026-08-04T23:09:46.525183Z","submitted_at":"2024-12-02T18:11:30Z","title":"Commit0: Library Generation from Scratch","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01769","snapshot_observed_at":"2026-08-07T04:16:08.477293Z","title":"Chiu, Claire Cardie, Matthias Gall’e, and Alexander M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.477293Z"},"links":{"cited_paper":"/paper/2412.01769","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:3c899653e7fe971dbf3449e00cadd42d7b246f9257b2a0220204312754cbaa6a","observation_id":"9c9ef027-3deb-4379-bb19-94e1e6950ccf","resolution":{"observed_at":"2026-08-07T04:16:08.477293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-07T04:16:08.480495Z","title":"Jimenez, Alexander Wettig, Kilian Adriano Lieret, Shunyu Yao, Karthik Narasimhan, and Ofir Press","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.480495Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:553947277fffcb18b5671b9ec3dbaa5d591500a28446688a864b7bdef03a386f","observation_id":"ccac6345-da87-4ac5-a2ed-e3325ea68349","resolution":{"observed_at":"2026-08-07T04:16:08.480495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-07T04:16:08.483469Z","title":"React: Synergizing reasoning and acting in language models.ArXiv, abs/2210.03629, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.483469Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:d86556783d1763cc3d80d3918f57b96923a3af334f9647ff40b094e958185452","observation_id":"76698c99-b65f-464a-9946-d155b06aff8d","resolution":{"observed_at":"2026-08-07T04:16:08.483469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T04:16:08.486283Z","title":"Proximal policy optimization algorithms.ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.486283Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:6cd2ef4b46fd9c7f1106a0f03a3e7f09e47b11ffac5ff8757bdbbea4a01803d3","observation_id":"110172c0-7cf8-4510-8de3-9f3642ec23ee","resolution":{"observed_at":"2026-08-07T04:16:08.486283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T04:16:08.489630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.489630Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:f72e632730b47aca1f3911f9de39c104dbc0b030363969ac961b832598c0c05a","observation_id":"228809fc-4eca-4d16-96c0-1a1a8348cfe5","resolution":{"observed_at":"2026-08-07T04:16:08.489630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-09T01:39:11.956106Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-07T04:16:08.492855Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments.ArXiv, abs/2404.07972, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.492855Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:cb079bbca9619618c93fcd2d30d07887fca8b76beffd73dcad8e141333a8c904","observation_id":"e082b267-d4f3-424e-adf6-f4a1d9132bfd","resolution":{"observed_at":"2026-08-07T04:16:08.492855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-07-06T15:40:50.807376Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-07T04:16:08.495825Z","title":"Mind2web: Towards a generalist agent for the web.ArXiv, abs/2306.06070, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.495825Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:918aee87af3af49fe509f3c8cfaed72eea2696dfd35024153266c170ff303dcb","observation_id":"c4f109a2-c72f-48c7-b4d2-63befd7472aa","resolution":{"observed_at":"2026-08-07T04:16:08.495825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01290","last_updated":"2025-01-02T15:10:52Z","snapshot_observed_at":"2026-08-06T20:27:37.215791Z","submitted_at":"2025-01-02T15:10:52Z","title":"ToolComp: A Multi-Tool Reasoning & Process Supervision Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01290","snapshot_observed_at":"2026-08-07T04:16:08.498785Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.498785Z"},"links":{"cited_paper":"/paper/2501.01290","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:8aafa8d2af0ace2a149b7591374f63aa31aa7b99813f7feef6f0c459474e6327","observation_id":"05cff3f7-a161-4d6c-9da5-72e6cb9872cf","resolution":{"observed_at":"2026-08-07T04:16:08.498785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T04:16:08.501801Z","title":"Ui-tars: Pioneering automated gui interaction with native agents.ArXiv, abs/2501.12326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.501801Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:02ea424b0fc693c0b063c1cf7f2c3293f16460c3896e4e4f2914c853834492e3","observation_id":"83c58c56-16f3-4c58-97a3-5084691e6531","resolution":{"observed_at":"2026-08-07T04:16:08.501801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T04:16:08.504844Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning.ArXiv, abs/2411.02337, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:16:08.504844Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2506.11425"},"observation_digest":"sha256:d142c2a3afb74264fb91f8f120affd645c763c1cf22fc2c3a42b9a5a5b14dc99","observation_id":"e6aefe98-2f29-4ad0-b8e9-c6a42f5efe51","resolution":{"observed_at":"2026-08-07T04:16:08.504844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11425","last_updated":"2025-06-20T23:32:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T18:07:24.589112Z","submitted_at":"2025-06-13T02:46:53Z","title":"Agent-RLVR: Training Software Engineering Agents via Guidance and Environment Rewards"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 18 inbound Pith citation observations for arXiv:2506.11425."}