{"as_of":"2026-08-09T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac04bde3906a9fff1e9b70da230f5acfb6361497d24d05130ffa0e63a3e87f6c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:53:00.775393Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T06:11:26.257349Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-07T13:53:00.775393Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning.arXiv preprint arXiv:2411.03817, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-07T13:45:29.055916Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:00.775393Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:183a321e0bb564bba162fa2c9c901c3deebc7bb877a2fee8d755c30d681ffafe","observation_id":"38195950-c328-47a4-ad6c-91b93efe3b7d","resolution":{"observed_at":"2026-08-07T13:53:00.775393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-04T19:28:56.630716Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-08T10:27:53.369430Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.630716Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:941978ae2fbdf4593050ae3bc6b2498adcdf336f94fa033014515156e3c5dec1","observation_id":"90f14950-d6d6-49b2-a74a-88977f7ab7ac","resolution":{"observed_at":"2026-08-04T19:28:56.630716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.03817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":"3083983b-0b59-42d1-ab02-3d8cf8ecb075","year":2024},"citing_paper":{"arxiv_id":"2604.09459","last_updated":"2026-04-13T12:08:22Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:36.341574Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2604.09459"},"observation_digest":"sha256:58cf09b49d349ff7b53155cf2609a682c6afc1391e6c7c051d323eb50f5d0413","observation_id":"aaea0a6c-e4f9-4013-8306-16a29ccd7fee","resolution":{"observed_at":"2026-05-11T07:30:58.359285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.03817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":"3083983b-0b59-42d1-ab02-3d8cf8ecb075","year":2024},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:cf92074cef556843b602e5249463e2384123ae8550da7f63e1dced52f53d0077","observation_id":"8a1f5723-2969-4d0b-af72-950b586f1e0c","resolution":{"observed_at":"2026-05-10T07:01:49.475714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2411.03817","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning","venue":null,"work_id":"3083983b-0b59-42d1-ab02-3d8cf8ecb075","year":2024},"citing_paper":{"arxiv_id":"2605.09934","last_updated":"2026-05-11T03:32:55Z","snapshot_observed_at":"2026-08-03T16:23:18.233908Z","submitted_at":"2026-05-11T03:32:55Z","title":"TRACER: Verifiable Generative Provenance for Multimodal Tool-Using Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:06.869916Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2605.09934"},"observation_digest":"sha256:9554fb4c236e283c46c56f3231109ac2168931d4075114f3ddffe4166c22b76b","observation_id":"fc0d925f-36c6-4f3c-a6b6-d9b96aa4f688","resolution":{"observed_at":"2026-05-12T06:11:26.263643Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"From novice to expert: Llm agent policy optimization via step-wise reinforcement learning.arXiv preprint arXiv:2411.03817, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:0679843eac22c80c3a43cba22c926ad2abcb1559c751f8deaeee12d03d2023d5","observation_id":"0a4235b4-367b-4b80-bcde-edbb89703962","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-01T22:51:02.022603Z","title":"arXiv preprint arXiv:2411.03817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15610","last_updated":"2026-07-17T04:16:58Z","snapshot_observed_at":"2026-08-08T07:18:13.644172Z","submitted_at":"2026-07-17T04:16:58Z","title":"Process Reward Informed Tree Rollout for Effective Multi-Turn RL","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T22:51:02.022603Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2607.15610"},"observation_digest":"sha256:a6a0b3d0963d424a45ea19235d7d85924c0fb2893bc612ead10a17603a1f474a","observation_id":"bd08aaba-361d-4a92-8b93-176bc1499bb7","resolution":{"observed_at":"2026-08-01T22:51:02.022603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03817","snapshot_observed_at":"2026-08-01T02:44:29.873290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25369","last_updated":"2026-07-28T07:25:04Z","snapshot_observed_at":"2026-08-03T05:59:43.414856Z","submitted_at":"2026-07-28T07:25:04Z","title":"ODYSSE: Episode-wise Policy Optimization for Personalized Agentic Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:44:29.873290Z"},"links":{"cited_paper":"/paper/2411.03817","citing_paper":"/paper/2607.25369"},"observation_digest":"sha256:9804a445cb78abb3ecefb8820a1beda9013120c186f0e112e55064b50c59c3d2","observation_id":"c2808dcb-3851-44b4-bd24-dd3d3550767a","resolution":{"observed_at":"2026-08-01T02:44:29.873290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.03817/citation-record","integrity":"/paper/2411.03817/integrity","json":"/paper/2411.03817/citation-record.json","paper":"/paper/2411.03817"},"outbound":[],"paper":{"arxiv_id":"2411.03817","last_updated":"2024-12-09T09:20:11Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T03:30:04.857103Z","submitted_at":"2024-11-06T10:35:11Z","title":"From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2411.03817."}