{"as_of":"2026-08-05T17:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:654a2b1fb45a0f5cf8ecab8448c17eeb2d536e562671ceb4fbde35d8c35e8c69","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:07:41.709278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:f0f7616a300963afde18bc61a2047243a71179cb2b312ba843e23eace07ca4d1","observation_id":"3457b9dc-10c2-4919-a7e1-b14f2383e45d","resolution":{"observed_at":"2026-05-22T21:42:10.644431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":239,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:50ea0df26fca2839c5af069c639a2d816082aa605f26f94210db6feb92862151","observation_id":"f0b54aee-9a64-4042-8e4e-87c7a403a11f","resolution":{"observed_at":"2026-05-14T22:23:15.235989Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9f1824d88d8bbecc22e1e8ee9bfd4eaf3701331485da7c2d232de38ce782273b","observation_id":"27fec0da-b0ed-4402-8749-072a4a15b231","resolution":{"observed_at":"2026-05-18T19:21:48.155281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-04T16:07:41.709278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:41.709278Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:17905b70d358b7c1c699ce6b8e87885e6d2d8d9dcdd5c4d8f7370566b5b59f74","observation_id":"304bfd78-5a1d-49be-85a6-c7d1143f7396","resolution":{"observed_at":"2026-08-04T16:07:41.709278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-04T07:56:47.157332Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.24803","last_updated":"2026-07-15T00:10:20Z","snapshot_observed_at":"2026-08-05T09:19:56.278937Z","submitted_at":"2025-10-28T00:48:20Z","title":"MASPRM: Multi-Agent System Process Reward Model","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T07:56:47.157332Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2510.24803"},"observation_digest":"sha256:91442fbb0241e1326493d26a327593f3bf34bcd4450b4fa06d874342d734d330","observation_id":"e81255b8-ca8b-4fa4-a25f-17e737f2a235","resolution":{"observed_at":"2026-08-04T07:56:47.157332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-07-13T10:21:59.840828Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04266","last_updated":"2026-04-05T21:08:00Z","snapshot_observed_at":"2026-08-03T09:07:46.754285Z","submitted_at":"2026-04-05T21:08:00Z","title":"Data-Driven Boundary Control of Distributed Port-Hamiltonian Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T10:21:59.840828Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2604.04266"},"observation_digest":"sha256:2d6e9cbe4372018551c9ec15ec3043c35bea550183fac8a2a23c4dca888f4d97","observation_id":"de32141f-abe3-4509-93cc-45d894a952b1","resolution":{"observed_at":"2026-07-13T10:21:59.840828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.00425","last_updated":"2026-05-08T06:22:47Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:54:37Z","title":"AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:27.170349Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.00425"},"observation_digest":"sha256:a33ef003d1ade4723a429ff6b0355b8673c4f594701244e7ac2b65ae2ef69e3f","observation_id":"22f2de34-a371-4ce2-b11a-eef553f488d6","resolution":{"observed_at":"2026-05-11T15:26:18.975571Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.00425","last_updated":"2026-05-08T06:22:47Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T05:54:37Z","title":"AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T00:58:25.685484Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.00425"},"observation_digest":"sha256:3af8ea7ad13d721e8212640293da5d8db1ab0c4261642daa8bc3e398c8ff0f59","observation_id":"9666a72f-dfef-43e1-bd3e-ee0228a6f0c9","resolution":{"observed_at":"2026-05-11T04:55:59.092413Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.02572","last_updated":"2026-05-04T13:25:05Z","snapshot_observed_at":"2026-07-06T23:15:37.099197Z","submitted_at":"2026-05-04T13:25:05Z","title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T18:13:25.735085Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.02572"},"observation_digest":"sha256:214e00f4a13232ef63b6886adb3d8ff25218015f9745ae9677279eb6c0c108e7","observation_id":"50229213-8e0e-4377-b128-5992bc15bec6","resolution":{"observed_at":"2026-05-09T06:40:40.871952Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:98f474a1a4be6ff1371548c1fc163c4f6f6c1cc5abdec77cd03026ec2053e776","observation_id":"382e89b3-92ad-4b34-bb7b-3d76051a0f45","resolution":{"observed_at":"2026-05-11T20:06:08.576391Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:815d2d79c2203a3e580d47f991f0691af4ec70215c0942dc98f0829b7a1eef67","observation_id":"d52c3d8e-7bd5-4694-94fe-a29cfe5534c4","resolution":{"observed_at":"2026-05-11T04:05:55.449951Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:dd276bd68a4374942f35cb8e54a2979f28914497e6c9343467333621e4345577","observation_id":"2c3b6a66-ac9c-40cf-821e-dc58d0261018","resolution":{"observed_at":"2026-05-13T07:17:28.354727Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.07462","last_updated":"2026-05-08T09:10:17Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:10:17Z","title":"The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-11T01:54:49.131461Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.07462"},"observation_digest":"sha256:174a7ae889f128ae1cfaf4d3b6582c317d770f999ab0f25659714e5b499f92b7","observation_id":"2934e963-22e7-4960-a723-0874c1b24a90","resolution":{"observed_at":"2026-05-11T01:55:51.077592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.08013","last_updated":"2026-05-08T17:02:31Z","snapshot_observed_at":"2026-07-06T23:20:19.821342Z","submitted_at":"2026-05-08T17:02:31Z","title":"Learning CLI Agents with Structured Action Credit under Selective Observation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T02:59:26.100818Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.08013"},"observation_digest":"sha256:7b95cc6b7a6da0ee1f4d58770416455854c2f73c29e871e66542003914220ea7","observation_id":"f1433239-4e12-45fa-82cb-2a0b6dc58a1b","resolution":{"observed_at":"2026-05-11T03:00:56.404376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.09934","last_updated":"2026-05-11T03:32:55Z","snapshot_observed_at":"2026-08-03T16:23:18.233908Z","submitted_at":"2026-05-11T03:32:55Z","title":"TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:06.869916Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.09934"},"observation_digest":"sha256:eb4e98c8f1e9d798bf61b6b6b5d49977d26971ef64eee85397867cd3e5ccc8a9","observation_id":"ecac87d8-5a88-43b1-9ccb-d7f7f7d9cb13","resolution":{"observed_at":"2026-05-12T06:11:26.217109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-05T17:11:49.497401Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T10:41:25.205368Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:c4c744011a083b42b2d8d350c2187764b91c79908f34bf41cf7c88e3c79e5c40","observation_id":"3855bf6f-9883-4cc3-a03b-cf51c2395fa6","resolution":{"observed_at":"2026-05-20T10:43:12.466063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-03T02:23:31.245503Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution.arXiv preprint arXiv:2505.20732, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.17877","last_updated":"2026-07-31T02:25:17Z","snapshot_observed_at":"2026-08-05T17:11:49.497401Z","submitted_at":"2026-05-18T05:39:30Z","title":"PAIR: Prefix-Aware Internal Reward Model for Multi-Turn Agent Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T02:23:31.245503Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2605.17877"},"observation_digest":"sha256:584bd9f5076d5e9780fdb0b8cef3351102c946f3218c1ae0d9435e4eba5dff1d","observation_id":"5acadc1f-90eb-4d04-9270-06b3eefa2206","resolution":{"observed_at":"2026-08-03T02:23:31.245503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:3b744181d9a8d4df5e701481bc1c4ef71c386c8f49d80234b8027d1e41ee1190","observation_id":"a23f6867-d8b8-48f4-8732-18d302cf835e","resolution":{"observed_at":"2026-07-01T20:46:14.319626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.02372","last_updated":"2026-06-01T15:21:17Z","snapshot_observed_at":"2026-07-06T23:42:49.173711Z","submitted_at":"2026-06-01T15:21:17Z","title":"COMAP: Co-Evolving World Models and Agent Policies for LLM Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T14:27:50.260308Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.02372"},"observation_digest":"sha256:c5b21cb39092c0c5adeb05db16b676dd3ce86d737c806bea67754d40d8111066","observation_id":"c73e13c1-8c37-46c2-acd5-04a4f3a70e37","resolution":{"observed_at":"2026-07-01T23:16:24.853779Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.02373","last_updated":"2026-06-01T15:21:41Z","snapshot_observed_at":"2026-08-02T17:23:05.614302Z","submitted_at":"2026-06-01T15:21:41Z","title":"Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:08.052988Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.02373"},"observation_digest":"sha256:3b980567f183ff9d0125816ccfe479dca8fb5412097d859717b152694d18cc59","observation_id":"b9f02781-c1f8-4734-b987-c1863f1b9afa","resolution":{"observed_at":"2026-07-01T23:26:22.069256Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.10507","last_updated":"2026-06-09T07:35:14Z","snapshot_observed_at":"2026-08-05T06:17:13.116592Z","submitted_at":"2026-06-09T07:35:14Z","title":"HIPIF: Hierarchical Planning and Information Folding for Long-Horizon LLM Agent Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T13:04:28.758614Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.10507"},"observation_digest":"sha256:371475406ab43f57bf143419b6b621a5d77e89de7f2763d9af731f11850c02a8","observation_id":"c8a41327-e0fb-49c0-96b9-f28ddc71507e","resolution":{"observed_at":"2026-07-03T05:47:41.649865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-05T04:59:46.668803Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:9c21e59bbd53a6e20b4288c7966f296544cdcb98cdd97356b60540de14a77bce","observation_id":"c18f4942-7020-4032-9661-2d3c217938cd","resolution":{"observed_at":"2026-07-03T14:58:33.194023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.17871","last_updated":"2026-06-16T12:42:09Z","snapshot_observed_at":"2026-07-06T23:53:25.839293Z","submitted_at":"2026-06-16T12:42:09Z","title":"StepGuard: Guarding Web Navigation via Single-Step Calibration","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T01:34:10.325378Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.17871"},"observation_digest":"sha256:c4d9cdb14449f625d149026094b4175923344b165359762ea74c4390c162f4af","observation_id":"c8f816ba-2c2f-4e0f-921f-f10b18a962b6","resolution":{"observed_at":"2026-06-27T01:40:21.157758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.25451","last_updated":"2026-06-24T06:26:34Z","snapshot_observed_at":"2026-07-06T23:59:52.373272Z","submitted_at":"2026-06-24T06:26:34Z","title":"Learning with a Single Rollout via Monte Carlo Pass@k Critic","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-25T20:53:10.016447Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.25451"},"observation_digest":"sha256:1a2a3bd47f9dc10ddf6fd97b228f957cb929ff6b43ac5596ae2ea924ed854de8","observation_id":"570946be-579d-46af-94b6-074622e7402d","resolution":{"observed_at":"2026-07-04T20:00:08.366859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2606.25852","last_updated":"2026-06-24T14:02:13Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:02:13Z","title":"Semantic Consistency Policy Optimization for Reinforcement Learning of LLM Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-25T20:16:39.347676Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2606.25852"},"observation_digest":"sha256:72df77846ed12357132b5891cd618c2dabfc5d791e6cfa0bd7983f4e9b4f9f58","observation_id":"113cc57d-5f88-4b68-af43-ac634976f5e7","resolution":{"observed_at":"2026-07-04T20:20:07.672378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution.arXiv preprint arXiv:2505.20732, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-05T03:26:47.178615Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:99a0ff8c20817d211162b449ad586eac9147c8ee44dc1d550ca724f6dfa7c48e","observation_id":"4c434fbc-c40c-4bbe-92b9-e9566d9fb4e0","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2607.06184","last_updated":"2026-07-07T12:09:46Z","snapshot_observed_at":"2026-07-10T23:18:21.696963Z","submitted_at":"2026-07-07T12:09:46Z","title":"What Resolve Rate Hides: Trajectory Structure Diagnostics for Coding Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-08T14:16:25.641101Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.06184"},"observation_digest":"sha256:74861f9c5dbab6522753bdef4d2fb237b7f756210155f197eb2c358787a8648b","observation_id":"af49ee17-bcf4-4c1f-b102-7978cdce4208","resolution":{"observed_at":"2026-07-08T14:25:02.465192Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":"2505.20732","doi":"10.48550/arxiv.2505.20732","metadata_source":"pith","pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution","venue":"cs.CL","work_id":"bdf6b0d6-89db-4ff6-8ea9-29971abfcd69","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-07-11T23:20:06.266376Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:18144d8087f5d70b84cc50acf004f4202382911249aa4909c0a875538860883d","observation_id":"8148a7e5-e65c-4119-b98f-7bc318c68640","resolution":{"observed_at":"2026-07-09T11:16:11.361536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-02T03:10:51.611387Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-03T09:27:56.000634Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.611387Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:d1ad25b94588cca7d83578407319dc8458865f45150362edae6a7b4b90eb042a","observation_id":"74c730fc-3178-4f5e-97f1-0176e0f8fc29","resolution":{"observed_at":"2026-08-02T03:10:51.611387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-01T22:51:02.115809Z","title":"arXiv preprint arXiv:2505.20732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-03T09:59:43.125361Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.115809Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:e25e633c8c996c67f3b5355885b00a455db4c1d0730459feb88cda4c2d0aab47","observation_id":"9ff0fa1f-36fc-4df7-9af0-d5877a854285","resolution":{"observed_at":"2026-08-01T22:51:02.115809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-01T11:54:59.427547Z","title":"Spa-rl: Reinforcing llm agents via stepwise progress attribution.arXiv preprint arXiv:2505.20732, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22724","last_updated":"2026-07-22T04:01:56Z","snapshot_observed_at":"2026-08-05T14:51:20.518517Z","submitted_at":"2026-07-22T04:01:56Z","title":"Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:54:59.427547Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.22724"},"observation_digest":"sha256:48430dc212361fd0b096c3a7f452af60dd0bc56f924abb69fef055c480f5da47","observation_id":"69741546-e41a-4506-a1df-59b33b37d407","resolution":{"observed_at":"2026-08-01T11:54:59.427547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20732","snapshot_observed_at":"2026-08-01T02:58:29.306083Z","title":"arXiv preprint arXiv:2505.20732 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25308","last_updated":"2026-07-28T05:39:01Z","snapshot_observed_at":"2026-08-05T09:28:39.486019Z","submitted_at":"2026-07-28T05:39:01Z","title":"CAST: Game Solvers as Turn-Level Teachers for LLM Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T02:58:29.306083Z"},"links":{"cited_paper":"/paper/2505.20732","citing_paper":"/paper/2607.25308"},"observation_digest":"sha256:57a0fe91b38f113dbb92838fe2d27e115d53d4dc41ed03d2972f946e25a62918","observation_id":"53dc83e9-f27f-480a-9822-b56bb3da7a01","resolution":{"observed_at":"2026-08-01T02:58:29.306083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20732/citation-record","integrity":"/paper/2505.20732/integrity","json":"/paper/2505.20732/citation-record.json","paper":"/paper/2505.20732"},"outbound":[],"paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2505.20732."}