{"as_of":"2026-08-13T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8af1f88d9365c19f3ed22b3030f6c859d6ec83e8d4fccef73bedd658ee1106f1","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:25:05.437142Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:20:41.136332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08708","snapshot_observed_at":"2026-08-02T03:20:41.136332Z","title":"arXiv preprint arXiv:2606.08708 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13931","last_updated":"2026-07-15T15:13:02Z","snapshot_observed_at":"2026-08-07T19:04:33.731501Z","submitted_at":"2026-07-15T15:13:02Z","title":"SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T03:20:41.136332Z"},"links":{"cited_paper":"/paper/2606.08708","citing_paper":"/paper/2607.13931"},"observation_digest":"sha256:c22806a07b782ed42370c45e70dfbb535b95a83d17334068b0b0f79074284a15","observation_id":"4e9af9d2-bf31-4dcb-87b6-d3754817e9f1","resolution":{"observed_at":"2026-08-02T03:20:41.136332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.08708/citation-record","integrity":"/paper/2606.08708/integrity","json":"/paper/2606.08708/citation-record.json","paper":"/paper/2606.08708"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"The original policy distribution is P=π θ(·|I, c), and the perturbed distribution is P ′ =π θ(·| ˜I, c), where ˜I=P(I)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:40cc2894ccdbd0fee4b55c05241a0c6fdbff89a8db9172e2787389c60dae2363","observation_id":"0c59fd0c-4c60-4a4a-905a-157bd73d63ca","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"While St captures semantic dependency, it cannot distinguish whether a high KL value arises from robust visual grounding or brittle numerical over-sensitivity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:a634e27b5e2837b589f6092247649061e3727af5871a43d243f5440aba1d3cf7","observation_id":"3abfb000-4ab2-435d-b3fb-e975f3ce46de","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"-∠ADC= 26 ◦","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:1013d4209a5557464aeb3dd2fcee5a4824bb06655d5c1850c4d1be01440dc1ad","observation_id":"12474a78-fd79-4949-b646-1ee88d3ddc20","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"Therefore,∠ACD= 2×angle at the center= 2×∠AOD","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:f7361284670d1df8107127826d3f5dd317da292f59181e96dab55c2dd5bf6695","observation_id":"79a7781e-b404-49ff-b5d6-707eec5c1352","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"- Solving for∠CAB, we get∠CAB= 90 ◦ −52 ◦ = 38 ◦","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:0158c90a327ca3f2c8f5fa5888139071ed178228704ebe32be97b6f832c42bff","observation_id":"84f1b899-3603-454d-b645-9352b02b34fc","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:10f18d10f7e8b0d4ecf2face3bacb4cb5d2fc13fc06407836a38e3f2afec0ced","observation_id":"a80a4ed9-3939-4000-bc88-e53dd59e7b80","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"Therefore, ∠ABC=∠ADC= 26 ◦","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:0475c23edf847871a3b8d3852011b19cdc3f17e31a59a4e9d8490e48dc8922a3","observation_id":"0a955f9e-e5e8-4e82-b11b-0da16b4b8d60","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:8b59a3aa19556629dd63584404f52005be3b5eb1927ab6b386fad2d336840ff5","observation_id":"a31642fc-8351-49b8-8ec2-e9d16d10441f","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:f15b753207db84deae539a84b61c1ac74a39f56d7be2763ecbe4c1a03dbb5570","observation_id":"9b3f8e6a-3e6c-4ce4-9b1c-5a9b46fbcbfd","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:6b6be5f814b035de4f94ec01a7a7fdf5cf97eb5f6f9ceebceceff22d4c8d75a4","observation_id":"f08289dc-3c55-46fb-bef3-dc262ad11724","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:d269acf152e33422183b626cb869188136392315e7bf6fb5f42e9aaa6848e170","observation_id":"00d98220-b5bd-4ccb-bdaa-558d7ce28259","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"Let’s examine the rotations step by step: - The first shape rotates to form the second shape","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:6efa2dc8f9164a4c03fcd689bac74c939702c60c8a02563e8329619cf2bd09e6","observation_id":"36620014-1c30-4a78-b4b5-48aefdc8c169","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:21a88812a3db995175e328d207b74fdb71076eadd726ec42d97bf3d8b6f1bcb8","observation_id":"511f6055-4e56-4659-be39-09852d307960","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:95ac2744913c20779274eb76844d02163eb89e1461bf65bc8bf79c51f457bb1c","observation_id":"a13b746c-a546-4f68-8580-76ad8964b637","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:2280d0b53a9a4eb263c42d93b2b8b78ffd8a4bb1ed020063e9fa8a03c8f41c34","observation_id":"c3a7cf6a-a452-4694-ae70-25335b2d2635","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"Let’s rotate the third shape (the shape at the bottom of the given sequence) 90 de- grees clockwise: - The third shape is a L-shaped configuration of cubes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:0b3e0d13794f926c229b8e5cc8a6ecdd030efc5418d07ad67327f48d6f488d2c","observation_id":"216e310f-1ee7-4f66-962d-e8e0ee09e1ea","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"A color with high saturation is a pure hue, while a color with low saturation is a light, grayed-out version of that hue (like a pastel color)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:dc905bbb663d9ff7c9abffaed3072c9b0cc5c7968241164ad0c0860e227d24c6","observation_id":"de63150c-40ff-450f-afbd-5d3f2e4efa9c","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"The saturation decreases as you move inward from the outer edge towards the center of the circle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:8eb15cfc0ed91e981a3ddba5c362d76a7c9fee123f322f14f1bd6de731ab6175","observation_id":"88bf90f1-c38a-4c48-aed0-6ad953236d0d","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"- Color B is located in the middle of the circle, closer to the center","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:7eed4180ca3d7e7fef4b3512d7a2c6034185a0de2c055c433545e5abd1b498b4","observation_id":"ff209a59-7a26-464c-96d4-77e65db45a3b","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"Limitations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:9856828d3dd8d476b096ebb867aaddfe5cb1b2ca73fc6559a49b6bac1748af6b","observation_id":"0b779a91-4f80-43c4-983d-70d6edfc73a0","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T18:25:05.437142Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T18:25:05.437142Z"},"links":{"citing_paper":"/paper/2606.08708"},"observation_digest":"sha256:43143494777262a7b5094ff4bd6c705899247ff04ca14914bcdd318f27304772","observation_id":"8174ccb4-08ae-4280-9b07-cf35412d16b9","resolution":{"observed_at":"2026-06-27T18:25:05.437142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.08708","last_updated":"2026-06-07T16:06:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T21:56:20.663743Z","submitted_at":"2026-06-07T16:06:29Z","title":"PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2606.08708."}