{"as_of":"2026-07-25T01:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5ea650e6fcd8fa892e7b3419fbe6b506e723560555b24db66fc126f1a4ffd6d","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:42:37.065795Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-24T06:31:00.690269+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T16:03:26.866407Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-02T20:47:23.391702Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.07165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07165","snapshot_observed_at":"2026-07-02T20:47:23.391702Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","venue":"cs.AI","work_id":"d9f793f2-be60-4b85-a6a7-588caafe552f","year":2026},"citing_paper":{"arxiv_id":"2605.00751","last_updated":"2026-05-01T16:02:58Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T16:02:58Z","title":"NonZero: Interaction-Guided Exploration for Multi-Agent Monte Carlo Tree Search","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-09T19:08:50.518219Z"},"links":{"cited_paper":"/paper/2604.07165","citing_paper":"/paper/2605.00751"},"observation_digest":"sha256:e251375f457e5c2cb83c77ce8b85806385d5cb7549cd907dcf16ac2a78eb4752","observation_id":"11925afe-9ba5-4e32-83f5-4ea16ec3fd39","resolution":{"observed_at":"2026-05-11T15:51:43.080098Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.07165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07165","snapshot_observed_at":"2026-07-02T20:47:23.391702Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","venue":"cs.AI","work_id":"d9f793f2-be60-4b85-a6a7-588caafe552f","year":2026},"citing_paper":{"arxiv_id":"2605.21851","last_updated":"2026-05-22T00:42:32Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T00:55:13Z","title":"OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T08:10:55.720464Z"},"links":{"cited_paper":"/paper/2604.07165","citing_paper":"/paper/2605.21851"},"observation_digest":"sha256:15e51a7a2f33fec251842c9fc8fe9397ca34484916fcf94911c3cde716601c1f","observation_id":"1c8b7a9d-e82c-4743-9563-556c4959924d","resolution":{"observed_at":"2026-05-22T08:11:16.990640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.07165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07165","snapshot_observed_at":"2026-07-02T20:47:23.391702Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","venue":"cs.AI","work_id":"d9f793f2-be60-4b85-a6a7-588caafe552f","year":2026},"citing_paper":{"arxiv_id":"2605.21851","last_updated":"2026-05-22T00:42:32Z","snapshot_observed_at":"2026-07-06T23:32:15.891169Z","submitted_at":"2026-05-21T00:55:13Z","title":"OPPO: Bayesian Value Recursion for Token-Level Credit Assignment in LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T05:47:33.925413Z"},"links":{"cited_paper":"/paper/2604.07165","citing_paper":"/paper/2605.21851"},"observation_digest":"sha256:2c55a5e4e00fe35a3e12eb8ff85d8228d5dfd6d2a6a3391bfee502c1c3660ef4","observation_id":"2d916b6f-2bd0-4a88-b0fa-d45a06792c15","resolution":{"observed_at":"2026-05-25T05:50:24.355871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.07165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07165","snapshot_observed_at":"2026-07-02T20:47:23.391702Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","venue":"cs.AI","work_id":"d9f793f2-be60-4b85-a6a7-588caafe552f","year":2026},"citing_paper":{"arxiv_id":"2606.01720","last_updated":"2026-06-01T05:36:26Z","snapshot_observed_at":"2026-07-06T23:42:16.661228Z","submitted_at":"2026-06-01T05:36:26Z","title":"A Note on Stability for Orthogonalized Matrix Momentum with Client Sampling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T16:03:26.866407Z"},"links":{"cited_paper":"/paper/2604.07165","citing_paper":"/paper/2606.01720"},"observation_digest":"sha256:9dad2022e11ed9af8de25cf62d61d411e9c842d195304e046a1e81f068a046f3","observation_id":"d900fad7-4b4f-40a2-9b43-c2258b6e6922","resolution":{"observed_at":"2026-07-01T21:56:15.636973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.07165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07165","snapshot_observed_at":"2026-07-02T20:47:23.391702Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","venue":"cs.AI","work_id":"d9f793f2-be60-4b85-a6a7-588caafe552f","year":2026},"citing_paper":{"arxiv_id":"2606.01850","last_updated":"2026-06-01T08:00:17Z","snapshot_observed_at":"2026-07-06T23:42:21.252086Z","submitted_at":"2026-06-01T08:00:17Z","title":"Does Compression Preserve Uncertainty? A Unified Benchmark for Quantized and Sparse LLMs via Conformal Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:06:31.471481Z"},"links":{"cited_paper":"/paper/2604.07165","citing_paper":"/paper/2606.01850"},"observation_digest":"sha256:000e80a28029d338ab0bedbe8defedec2560d54f8c1803f2614e60e201905f30","observation_id":"6241198f-c8ad-4dd2-b082-203b58cf95ec","resolution":{"observed_at":"2026-07-01T22:46:18.774163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"cited_work":{"arxiv_id":"2604.07165","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.07165","snapshot_observed_at":"2026-07-02T20:47:23.391702Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","venue":"cs.AI","work_id":"d9f793f2-be60-4b85-a6a7-588caafe552f","year":2026},"citing_paper":{"arxiv_id":"2606.07995","last_updated":"2026-06-06T06:22:07Z","snapshot_observed_at":"2026-07-06T23:47:33.680573Z","submitted_at":"2026-06-06T06:22:07Z","title":"Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T20:05:34.326966Z"},"links":{"cited_paper":"/paper/2604.07165","citing_paper":"/paper/2606.07995"},"observation_digest":"sha256:ae8c5e41f9fa055f140243db881cbba3b3001650f4a58595f806273657072e24","observation_id":"3d7b86d3-f1ce-4a28-b794-d8dd0834cbe6","resolution":{"observed_at":"2026-07-02T20:47:23.393991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.07165/citation-record","integrity":"/paper/2604.07165/integrity","json":"/paper/2604.07165/citation-record.json","paper":"/paper/2604.07165"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:37.065795Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2604.07165"},"observation_digest":"sha256:bc88047b17adef12eddd7e5d3135f98176808bd311670950b6f469572e6396c8","observation_id":"a2136d82-fca9-4b9c-845f-e4684b6422a3","resolution":{"observed_at":"2026-05-11T09:15:09.492454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.09284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2509.09284 , year=","venue":null,"work_id":"61d68edf-db4a-4d85-bbbe-39ef088e7931","year":2026},"citing_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:37.065795Z"},"links":{"citing_paper":"/paper/2604.07165"},"observation_digest":"sha256:40c5274223436c629d07fa8ed761a57e7dec6bc674e4e4a04290bd7f3c983aa5","observation_id":"dce55c31-fb94-4643-8380-ddd97fda185c","resolution":{"observed_at":"2026-05-11T00:05:49.978273Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04944","last_updated":"2026-06-03T03:25:10Z","snapshot_observed_at":"2026-07-14T21:20:08.151341Z","submitted_at":"2026-03-15T13:13:55Z","title":"Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space","version":2},"cited_work":{"arxiv_id":"2604.04944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.04944","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inclusion-of-Thoughts: Mitigating Preference Instability via Purifying the Decision Space","venue":"cs.CL","work_id":"69c79a58-8121-4043-af30-67ee2160fa20","year":2026},"citing_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:37.065795Z"},"links":{"cited_paper":"/paper/2604.04944","citing_paper":"/paper/2604.07165"},"observation_digest":"sha256:1722e8a43d0bc8413664d62e8b1ba613c6ebee46beae46406eaa7706721f3bdc","observation_id":"cc0dfc80-e603-459e-aafc-9d4590d40378","resolution":{"observed_at":"2026-05-11T00:05:49.983836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:37.065795Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.07165"},"observation_digest":"sha256:8d803d61cf4fb4c6d1cdc2f1b67643c237f22feb6346e780b6aea1e559b07851","observation_id":"15473c44-3a79-4937-baf1-6dd658ce8f99","resolution":{"observed_at":"2026-05-11T00:05:49.989867Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"assembly required","venue":null,"work_id":"789f5711-b2ec-4f2f-8d16-1d7b3296976c","year":1946},"citing_paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:42:37.065795Z"},"links":{"citing_paper":"/paper/2604.07165"},"observation_digest":"sha256:ea420314be0ef0cfc684113e055a37b6e2d033afc0daa73661e43d59b759c3ee","observation_id":"7e08366f-f6c2-460f-bb88-9c68f0ec2935","resolution":{"observed_at":"2026-05-16T16:13:05.252413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-24T06:31:00.690269+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.07165","last_updated":"2026-04-15T15:01:41Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T22:55:28.855291Z","submitted_at":"2026-04-08T14:55:29Z","title":"Reason in Chains, Learn in Trees: Self-Rectification and Grafting for Multi-turn Agent Policy Optimization"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-24T06:31:00.690269+00:00","source":"crossref"},{"observed_at":"2026-07-24T06:30:55.483554+00:00","source":"retraction_watch"}],"thesis":"As of 25 July 2026, this Paper Citation Record lists 5 of 5 outbound references and 6 inbound Pith citation observations for arXiv:2604.07165."}