{"as_of":"2026-08-14T18:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8ce412d1f4d4b1ab92a49b01a599cfc5862ae025f98509fe91c55e0d8179270","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:12:40.476298Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:58.107559Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-07T09:11:20.723647Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:f3898174223fa91e52a2e514df7817487ed576826e5d09a88d0755f27633a0d6","observation_id":"ae86ddc8-8c94-4f20-907b-78862ec38bcf","resolution":{"observed_at":"2026-05-18T15:11:11.125644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-08-14T18:28:45.696263Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"reference_index":208,"source":"arxiv_source","source_observed_at":"2026-05-15T15:35:10.593969Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2211.15657"},"observation_digest":"sha256:25fa33a61bcccfd68f4743c6feddf6cae30e2da625220ebad7f9bed8bfa45ffd","observation_id":"b9a32467-594f-4c1b-ae53-362f28907590","resolution":{"observed_at":"2026-05-15T15:35:10.839866Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-11T15:12:40.476298Z","title":"B.; and Levine, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11253","last_updated":"2024-12-15T17:33:56Z","snapshot_observed_at":"2026-08-11T22:44:22.563682Z","submitted_at":"2024-12-15T17:33:56Z","title":"Are Expressive Models Truly Necessary for Offline RL?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:12:40.476298Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2412.11253"},"observation_digest":"sha256:00c926d5b3b924467dc685403e9d6aee78a1576a9d844a1c0b6bd79daf895722","observation_id":"d1f2439e-4514-4507-86fd-7b8d5b984794","resolution":{"observed_at":"2026-08-11T15:12:40.476298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T13:30:22.843583Z","title":"Kumar, X","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-11T12:09:13.722112Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.843583Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:4afc73d51205faf72b63ef9fc551e6fc564c145a89b21841552b06fc3ae51475","observation_id":"0124c1ed-df2a-44cc-8b23-59c16ca05f04","resolution":{"observed_at":"2026-08-07T13:30:22.843583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T12:56:28.274947Z","title":"Reward-conditioned policies.ArXiv, abs/1912.13465, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-11T00:35:03.632691Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:56:28.274947Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2505.23458"},"observation_digest":"sha256:51f516153699964e34efef6ce6e5a9d395a0617c83e44698151f85230bb69bf4","observation_id":"b68cdd13-872c-4b13-9aac-37ecd00af636","resolution":{"observed_at":"2026-08-07T12:56:28.274947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T05:19:06.527500Z","title":"Reward-conditioned policies.arXiv preprint arXiv:1912.13465, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-11T00:34:56.099072Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.527500Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:3bdba05f4fc1c6d8fda3f1a28b1ec0f7d6d75a2af778128d79af59e6d1800aef","observation_id":"6c5875f2-64b1-4600-ae59-09958a242422","resolution":{"observed_at":"2026-08-07T05:19:06.527500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-06T18:15:45.032209Z","title":"B., and Levine, S","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-09T05:31:23.348356Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:45.032209Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:0c9b4f7a587244b1d1fee7195a9a47fbb8dcdb0ca6b0cd487cbd0cdc0f619a1f","observation_id":"0e7ef5bb-d240-44de-ad57-dd99ce411702","resolution":{"observed_at":"2026-08-06T18:15:45.032209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-06T15:22:49.982393Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16186","last_updated":"2025-07-22T02:56:36Z","snapshot_observed_at":"2026-08-11T00:35:08.679608Z","submitted_at":"2025-07-22T02:56:36Z","title":"EBaReT: Expert-guided Bag Reward Transformer for Auto Bidding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:22:49.982393Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2507.16186"},"observation_digest":"sha256:d843f208acbff0e6fd0ee5a0195b65960ac9c360472375b1ed228ba2a3e917d0","observation_id":"62d58338-dc62-4d35-90de-29ccdc81b61c","resolution":{"observed_at":"2026-08-06T15:22:49.982393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-05T11:39:57.863900Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.02458","last_updated":"2025-09-02T16:09:02Z","snapshot_observed_at":"2026-08-13T17:44:38.246112Z","submitted_at":"2025-09-02T16:09:02Z","title":"Generative Sequential Notification Optimization via Multi-Objective Decision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:39:57.863900Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2509.02458"},"observation_digest":"sha256:8a2c05ab0cff698bfb184bf57cd5574677139957be55657c4de84899c307f919","observation_id":"a8c825fa-143b-4850-afc9-d45175fd01bb","resolution":{"observed_at":"2026-08-05T11:39:57.863900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T10:34:59.134604Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2511.14759"},"observation_digest":"sha256:ace54cbae63328ae4ee3e068d21e675744f9bc91fa08950f2d5253a10f91cdab","observation_id":"334c2d12-73fa-4d3b-9df4-d5254ff8fd4c","resolution":{"observed_at":"2026-05-12T10:34:59.416893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2602.11075","last_updated":"2026-04-28T08:51:16Z","snapshot_observed_at":"2026-08-03T04:09:34.408025Z","submitted_at":"2026-02-11T17:43:36Z","title":"RISE: Self-Improving Robot Policy with Compositional World Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T02:28:37.997148Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2602.11075"},"observation_digest":"sha256:699f49d7526baeb9ed7b4f453ce4f16e2dac0b59e723247722d3cf81d1aed6df","observation_id":"48ede48a-9dcb-4b78-b6c7-64d207282156","resolution":{"observed_at":"2026-05-16T02:30:31.951919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2605.01862","last_updated":"2026-05-08T03:23:44Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T13:11:28Z","title":"QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-11T01:17:48.643521Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2605.01862"},"observation_digest":"sha256:b9f79392b6e939bef699a2785adee9417541a13415494d3856b60b97b5318b42","observation_id":"7305dd02-e6d0-4416-8ef4-1330b44edccf","resolution":{"observed_at":"2026-05-11T04:30:58.404146Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2606.05414","last_updated":"2026-06-03T20:28:27Z","snapshot_observed_at":"2026-08-11T00:34:56.936058Z","submitted_at":"2026-06-03T20:28:27Z","title":"When Evidence is Sparse: Weakly Supervised Early Failure Alerting in Dialogs and LLM-Agent Trajectories","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T06:02:44.836106Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.05414"},"observation_digest":"sha256:fa1e6b8ba7181edcaba846e20c2a1bf70c1ad9daccf0f809705f4df4784f64c3","observation_id":"206569dd-0496-457f-a49c-c357571fcf4e","resolution":{"observed_at":"2026-07-02T08:26:48.331761Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2606.08312","last_updated":"2026-06-06T19:55:54Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T19:55:54Z","title":"Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:23:32.966503Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.08312"},"observation_digest":"sha256:aad0866ea050bbdcae9b2c3289e6243045035bf8c11effd168b4e1f7cdec47c1","observation_id":"cec724fc-b32a-4f56-ad42-1c676b21e041","resolution":{"observed_at":"2026-07-02T21:57:25.919416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:770310eddd99fba2061a48d1f26b1f3d30308b6755df5fa2c9d5fd5db66a73d8","observation_id":"907118e1-1e59-4f08-95b3-58b922d30a9c","resolution":{"observed_at":"2026-07-03T04:17:36.855518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2606.24231","last_updated":"2026-06-23T07:21:36Z","snapshot_observed_at":"2026-08-09T11:12:47.219255Z","submitted_at":"2026-06-23T07:21:36Z","title":"FlowR2A: Learning Reward-to-Action Distribution for Multimodal Driving Planning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T00:19:49.473294Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.24231"},"observation_digest":"sha256:d4f06750b6a5edf7ad112112c5f6bda053e2f1215a67fcee195e1415dcaed9c3","observation_id":"82d3c53f-7b78-4f99-b6e0-775de5af61fd","resolution":{"observed_at":"2026-07-04T16:39:58.109405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":"1912.13465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-04T16:39:58.107559Z","title":"Reward-conditioned policies","venue":null,"work_id":"0aac6f0f-ba1d-4790-b2df-aaeb733a3f80","year":1912},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-13T21:33:46.352583Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T04:58:28.971536Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:38a60fbbd960e38156fb0f3c76c021c1224e69e132fc90df3fcbc1eecc4f1708","observation_id":"811a19ca-7731-4ab8-ac6a-f0cc53ddadf3","resolution":{"observed_at":"2026-07-01T10:55:41.968818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-07-14T16:55:18.028851Z","title":"Kumar, X","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-13T21:33:46.352583Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T16:55:18.028851Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:53915e5a0f7b9b1db4a0105fc3102a686c5a01966b6a73d2608a3e52e9da2f62","observation_id":"1e258ca9-2236-406d-a98f-3f22e7ff378c","resolution":{"observed_at":"2026-07-14T16:55:18.028851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-04T02:32:20.187685Z","title":"Kumar, X","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2606.32027","last_updated":"2026-08-01T01:25:23Z","snapshot_observed_at":"2026-08-13T21:33:46.352583Z","submitted_at":"2026-06-30T17:54:02Z","title":"Freeform Preference Learning for Robotic Manipulation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T02:32:20.187685Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2606.32027"},"observation_digest":"sha256:c1cc69180a25515ef08891e95f91eb94e83e545330e6c7e7bf3ad61c5463b1fc","observation_id":"09de577c-114a-4c8a-97bf-3d2defe065d2","resolution":{"observed_at":"2026-08-04T02:32:20.187685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-04T16:29:24.589310Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:24.589310Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:6e9205070f2ba5b6fc4438da27d6a992729d5fb1a4662ab46bcbb6f9384bbebe","observation_id":"c4c07eb1-5087-43d5-bfda-0fb8f9e1680a","resolution":{"observed_at":"2026-08-04T16:29:24.589310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T00:14:45.648164Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:45.648164Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:121567d74caed7e1dd012f5e037245467f787ef4fe6f238e58aef241be35caa0","observation_id":"34254d69-a337-42cf-ae02-7b91a8c217d5","resolution":{"observed_at":"2026-08-07T00:14:45.648164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1912.13465/citation-record","integrity":"/paper/1912.13465/integrity","json":"/paper/1912.13465/citation-record.json","paper":"/paper/1912.13465"},"outbound":[],"paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T00:34:49.919649Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 21 inbound Pith citation observations for arXiv:1912.13465."}