{"as_of":"2026-08-17T19:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f3f587a1de89be18c020edbd99838569de97c15d48fa04c6fa2127933158512e","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:41:31.820379Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.02737/citation-record","integrity":"/paper/2509.02737/integrity","json":"/paper/2509.02737/citation-record.json","paper":"/paper/2509.02737"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:32.219986Z","title":"Contrastive policy gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion","venue":null,"work_id":"01e8c495-e572-456a-9a8d-3a4381254aaf","year":2024},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.753623Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:f1fd8047852b148750361c44c0f06b1b7f75d8b49de437ff4c626366bea3d3b4","observation_id":"7d35bf1a-e57d-4d8f-8a1b-5dc505c3d3a9","resolution":{"observed_at":"2026-08-15T16:41:32.224570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02073","last_updated":"2022-05-10T01:55:43Z","snapshot_observed_at":"2026-08-16T18:19:50.947238Z","submitted_at":"2021-06-03T18:31:41Z","title":"Neural Collapse Under MSE Loss: Proximity to and Dynamics on the Central Path","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.02073","snapshot_observed_at":"2026-08-15T16:41:31.766286Z","title":"Neural collapse under mse loss: Proximity to and dynamics on the central path","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.766286Z"},"links":{"cited_paper":"/paper/2106.02073","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:bd1de122c10608976f0fe0a1483fe856064f1f3d021e4c7e5982cc167c581ba4","observation_id":"f8e58389-6fe2-4ffb-9a72-4a59c7d60f94","resolution":{"observed_at":"2026-08-15T16:41:31.766286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:32.112692Z","title":"All experimental results are average over20 random seeds and we choose the best from three learning rates","venue":null,"work_id":"4f86f15e-1c4a-4f57-a956-1be339add558","year":2024},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.820379Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:f958ea094f629023989030518d67aaaaf0a42b46769dc0d34a8b577cea6a67c1","observation_id":"9d7b9e5a-49bb-47da-be6b-bf81ae7030e3","resolution":{"observed_at":"2026-08-15T16:41:32.117027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05689","last_updated":"2023-08-09T17:31:20Z","snapshot_observed_at":"2026-08-16T15:49:20.346497Z","submitted_at":"2023-03-10T03:44:01Z","title":"Inducing Neural Collapse to a Fixed Hierarchy-Aware Frame for Reducing Mistake Severity","version":2},"cited_work":{"arxiv_id":"2303.05689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05689","snapshot_observed_at":"2026-08-15T16:41:31.968860Z","title":"Inducing Neural Collapse to a Fixed Hierarchy-Aware Frame for Reducing Mistake Severity","venue":"cs.CV","work_id":"6eb97bac-c3c0-4261-81ec-dbfced91d790","year":2023},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.773745Z"},"links":{"cited_paper":"/paper/2303.05689","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:04d5f233ea8690adb25f2a1c577f0270ef8a4f2c2cb83f3f0b507e5f7a14d066","observation_id":"bedbb2b9-5aee-49cc-b0bc-574766382c09","resolution":{"observed_at":"2026-08-15T16:41:31.973875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-15T16:41:31.777647Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.777647Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:0589253ae08ce13daf538e1c44cbb97f02b863fb7280604023adc91b986c77a0","observation_id":"45e855d4-ff40-48cc-9e16-7eb3a5b7474d","resolution":{"observed_at":"2026-08-15T16:41:31.777647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08465","last_updated":"2021-01-18T23:53:04Z","snapshot_observed_at":"2026-08-16T18:58:18.550206Z","submitted_at":"2020-12-15T18:05:16Z","title":"Neural Collapse with Cross-Entropy Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08465","snapshot_observed_at":"2026-08-15T16:41:31.781429Z","title":"Neural collapse with cross-entropy loss","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.781429Z"},"links":{"cited_paper":"/paper/2012.08465","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:a1d68d55cba6379fe1a884962f338d755a00be150d549c7014e265fca648e4e1","observation_id":"9cb96999-d049-4458-a9c1-d8ad2bd83976","resolution":{"observed_at":"2026-08-15T16:41:31.781429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:31.789604Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.789604Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:8176aeacb51ccf66fc02fdba4dde734d77d007c224650958266b6a639472f1a8","observation_id":"7667d8f6-d6e8-4567-af9b-59a8740588ff","resolution":{"observed_at":"2026-08-15T16:41:31.789604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-15T16:41:31.792933Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.792933Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:58febfe1e95fd43d53228498937a2e7a6f70d89d72e131c83e3de3b8c5bce5d4","observation_id":"a05b1657-feca-4682-b4ec-62170104d518","resolution":{"observed_at":"2026-08-15T16:41:31.792933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17767","last_updated":"2024-11-26T03:54:09Z","snapshot_observed_at":"2026-08-16T13:48:49.016696Z","submitted_at":"2024-05-28T02:46:11Z","title":"Linguistic Collapse: Neural Collapse in (Large) Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17767","snapshot_observed_at":"2026-08-15T16:41:31.802573Z","title":"Liang Xie, Yibo Yang, Deng Cai, and Xiaofei He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.802573Z"},"links":{"cited_paper":"/paper/2405.17767","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:650266ff22ccea075e87566e9a9d1c0e079f6fb69d6dadec4a315e80aa226a07","observation_id":"53350eeb-dbf1-454d-a348-85532088681d","resolution":{"observed_at":"2026-08-15T16:41:31.802573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:31.807011Z","title":"Huaqing Xiong, Tengyu Xu, Lin Zhao, Yingbin Liang, and Wei Zhang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.807011Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:4fd5e7d5938850b44e437801b579a52dc53afd4edda9db21d3ff287531dae998","observation_id":"420bd0d2-310f-46e7-b139-d779ab608147","resolution":{"observed_at":"2026-08-15T16:41:31.807011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:32.162825Z","title":"Convergence and iteration complexity of policy gradient method for infinite-horizon reinforcement learning","venue":null,"work_id":"43c9c720-a608-4f97-a35f-b7d441b1ce6d","year":2019},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.811116Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:17748d9d69fb19eddb9b34a2ece21f85b7a4fae48be4612bfe04898915b916c3","observation_id":"aa3c2ad1-eed3-4b28-a8e7-0e04cf3f2c4d","resolution":{"observed_at":"2026-08-15T16:41:32.167884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:32.139247Z","title":null,"venue":null,"work_id":"9eb06b32-7cd7-4a9f-95ef-fb0d4feacdff","year":2020},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.815311Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:62211b36b522debc1e6b63b3fb237140fb126e1bf681e26ca11eea7aec23ad10","observation_id":"831869e0-15e0-4b83-a0d7-865c67f2d115","resolution":{"observed_at":"2026-08-15T16:41:32.143636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10486","last_updated":"2023-06-18T06:22:04Z","snapshot_observed_at":"2026-08-16T15:23:04.301463Z","submitted_at":"2023-06-18T06:22:04Z","title":"On the Global Convergence of Natural Actor-Critic with Two-layer Neural Network Parametrization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10486","snapshot_observed_at":"2026-08-15T16:41:31.761656Z","title":"On the global convergence of natural actor-critic with two-layer neural network parametrization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.761656Z"},"links":{"cited_paper":"/paper/2306.10486","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:57cc37564149ea929f3ac68d768d9ac1d68e6d38c5c9c3f013bc79613cd5bf6d","observation_id":"02e43c6a-ac4c-4afe-82f7-5a13f2499e98","resolution":{"observed_at":"2026-08-15T16:41:31.761656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:32.186828Z","title":"Learning classifiers on positive and unlabeled data with policy gradient","venue":null,"work_id":"77e31a76-a676-439e-a8e9-b3d8165f832e","year":2019},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.770274Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:15b3264e8f5ad3199edf5be3a16a10dcb92ff365de3874a46535b53e6e534d75","observation_id":"9966f96a-fc25-44d9-8b33-5bf80b3e4f46","resolution":{"observed_at":"2026-08-15T16:41:32.190806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01786","last_updated":"2022-06-20T01:01:28Z","snapshot_observed_at":"2026-08-14T16:20:46.784755Z","submitted_at":"2019-06-05T02:12:22Z","title":"Global Optimality Guarantees For Policy Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01786","snapshot_observed_at":"2026-08-15T16:41:31.745985Z","title":"doi: 10.1613/jair.3912","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.745985Z"},"links":{"cited_paper":"/paper/1906.01786","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:eba2b60fc17a5e29947a0d15ab0359a87fb1066b87cca4f78af7ae7150f67b36","observation_id":"05fc2478-8a1a-49cc-8652-54b738a9b238","resolution":{"observed_at":"2026-08-15T16:41:31.745985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T16:41:31.796790Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.796790Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:cf27c0f1a4eb3b0f8705d9ddd9034c95ee8af51de30fce7e732d489c3745572d","observation_id":"1e0d5b91-927e-4028-9c8c-657d004fab70","resolution":{"observed_at":"2026-08-15T16:41:31.796790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17750","last_updated":"2023-11-08T21:20:39Z","snapshot_observed_at":"2026-08-16T15:19:41.324801Z","submitted_at":"2023-06-30T16:01:04Z","title":"TD Convergence: An Optimization Perspective","version":2},"cited_work":{"arxiv_id":"2306.17750","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.17750","snapshot_observed_at":"2026-08-15T16:41:32.094738Z","title":"TD Convergence: An Optimization Perspective","venue":"cs.LG","work_id":"b09b6cc3-609f-4bb1-987d-9b5b705e4a2f","year":2023},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.738118Z"},"links":{"cited_paper":"/paper/2306.17750","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:ca4bf7af06fcf5cc9049de27e4f3664c2f62f1dbc8693babd48c000883a00b4c","observation_id":"cfc20b73-a249-4daf-a3be-f04b21089ac2","resolution":{"observed_at":"2026-08-15T16:41:32.102065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:32.235840Z","title":"Understanding of a convolutional neural network","venue":null,"work_id":"483b16d2-89e2-43a7-9a61-3fb3960b876c","year":2017},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.733739Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:fb21fa383574810a85a46d829a0a196a082cd46c165b05ef108568189316caf0","observation_id":"0c029449-dc7f-41c3-9c3b-709a55ba1910","resolution":{"observed_at":"2026-08-15T16:41:32.240361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.11619","last_updated":"2020-11-23T18:49:36Z","snapshot_observed_at":"2026-08-17T16:01:58.820686Z","submitted_at":"2020-11-23T18:49:36Z","title":"Neural collapse with unconstrained features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.11619","snapshot_observed_at":"2026-08-15T16:41:31.785414Z","title":"Neural collapse with unconstrained features","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.785414Z"},"links":{"cited_paper":"/paper/2011.11619","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:6271359bc20e064beb97e30db6d967f1aa1cf35db1cf38f0934ff37d9f5473b5","observation_id":"1f8e7448-b3dd-43dd-86ff-fb971f93b4d7","resolution":{"observed_at":"2026-08-15T16:41:31.785414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-15T16:41:31.749577Z","title":"Openai gym","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.749577Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:16bd019dc0e4b69f90739ace23844d714566f03fe1e737818d96dd638d2f5313","observation_id":"b845a436-ed3a-4a49-ba40-bab28aabbdeb","resolution":{"observed_at":"2026-08-15T16:41:31.749577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-15T16:41:31.742107Z","title":"A general language assistant as a laboratory for alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.742107Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:5e7b9bf1c0c4c422a86964ac5f07e061527af5a9855014c5c2381a195e56658a","observation_id":"cdeee453-98d9-47a6-a565-64e2b28942a6","resolution":{"observed_at":"2026-08-15T16:41:31.742107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.1190","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:41:31.865186Z","title":"doi: 10.18653/v1/2024.emnlp-main.1190","venue":null,"work_id":"2a67f056-fa13-4a78-9606-8183ca380315","year":2024},"citing_paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:41:31.757834Z"},"links":{"citing_paper":"/paper/2509.02737"},"observation_digest":"sha256:f7b2437e5d73e4b6a691dfeb7c6b9b7503e7cbb7c9a4758a262f6228cacbe583","observation_id":"aed67a22-9d53-41f1-95b1-e161316c5c3a","resolution":{"observed_at":"2026-08-15T16:41:31.876373Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.02737","last_updated":"2025-09-02T18:33:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T13:27:17.708556Z","submitted_at":"2025-09-02T18:33:11Z","title":"Imitate Optimal Policy: Prevail and Induce Action Collapse in Policy Gradient"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2509.02737."}