{"as_of":"2026-08-07T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0bc060b07c27703de12d3f1877a017b25847756afbcf22b141760a430cf27ce3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:19:08.014844Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T21:57:25.915173Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-07T09:11:20.723647Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T15:11:11.056013Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2106.01345"},"observation_digest":"sha256:6c3775601767544526aca1da2fa2fdbe7f3d209e96c41cfc043bf6c444de0913","observation_id":"80bf680b-5b57-4d18-8841-ae1b5076cacc","resolution":{"observed_at":"2026-05-18T15:11:11.117837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-05-15T15:35:10.593969Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2211.15657"},"observation_digest":"sha256:59156edaab08dfa17193336bcad7c7069889d0fcf3e8e30be25e9cfd02601489","observation_id":"1baf92be-02ec-4bbb-be46-cfa2500d5d2e","resolution":{"observed_at":"2026-05-15T15:35:10.858704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2308.00352","last_updated":"2024-11-01T14:36:52Z","snapshot_observed_at":"2026-07-06T16:01:07.532053Z","submitted_at":"2023-08-01T07:49:10Z","title":"MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework","version":7},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-05-11T03:43:18.632292Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2308.00352"},"observation_digest":"sha256:25434bd6243af83ddbd13e7fc30a3a2aa7b20e6da45847d26f570a9bfb336c59","observation_id":"38f45699-690a-442d-9483-3fb582ba6590","resolution":{"observed_at":"2026-05-11T03:43:19.125664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T05:19:08.014844Z","title":"Training agents using upside-down reinforcement learning.arXiv preprint arXiv:1912.02877, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.014844Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:5688dbfe763b32a19081cdfab913d29634d5995d47226210e2ce9cd41970e450","observation_id":"1e69c1d7-7926-44ab-b3ac-bb44ef679d6c","resolution":{"observed_at":"2026-08-07T05:19:08.014844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T18:15:46.817188Z","title":"K., Shyam, P., Mutz, F., Ja´skowski, W., and Schmidhuber, J","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.09041","last_updated":"2025-07-11T21:36:19Z","snapshot_observed_at":"2026-08-06T18:03:23.070587Z","submitted_at":"2025-07-11T21:36:19Z","title":"Behavioral Exploration: Learning to Explore via In-Context Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:15:46.817188Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2507.09041"},"observation_digest":"sha256:d8cf3cdf84c79de059c6412a9f6f58e5973c883d6b4ce80cc2371c6ebe066a8d","observation_id":"325a3a7e-8201-4ff1-971f-797eabf7a0e8","resolution":{"observed_at":"2026-08-06T18:15:46.817188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T15:26:24.543536Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.16139","last_updated":"2025-07-22T01:13:45Z","snapshot_observed_at":"2026-08-06T18:14:52.248033Z","submitted_at":"2025-07-22T01:13:45Z","title":"Equivariant Goal Conditioned Contrastive Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.543536Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2507.16139"},"observation_digest":"sha256:33a342b83f8a18fd1d70d4a33982ac4b91263b506b97f206e7e16c9307ec5fba","observation_id":"715459ac-bfe6-476e-b793-aea24c7a4984","resolution":{"observed_at":"2026-08-06T15:26:24.543536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-06T10:27:14.448302Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.00152","last_updated":"2025-07-31T20:23:25Z","snapshot_observed_at":"2026-08-06T10:25:41.446241Z","submitted_at":"2025-07-31T20:23:25Z","title":"GeoExplorer: Active Geo-localization with Curiosity-Driven Exploration","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T10:27:14.448302Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2508.00152"},"observation_digest":"sha256:2620c46b5196f69b0622bfda32c535a3335dbb90607f4f377b69c07985a532e5","observation_id":"28fa6eef-fb21-4a98-897d-7278f3b6ea36","resolution":{"observed_at":"2026-08-06T10:27:14.448302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-03T08:14:02.544642Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.544642Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:3ed9b65b101a1c3244bccaed5354e3bfee4685d48c078306fdaf3a516176548a","observation_id":"310d9c01-bbdb-4460-8592-6e9a51c52323","resolution":{"observed_at":"2026-08-03T08:14:02.544642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2605.01862","last_updated":"2026-05-08T03:23:44Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T13:11:28Z","title":"QHyer: Q-conditioned Hybrid Attention-mamba Transformer for Offline Goal-conditioned RL","version":2},"reference_index":232,"source":"arxiv_source","source_observed_at":"2026-05-11T01:17:48.643521Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2605.01862"},"observation_digest":"sha256:a6ae058feae7452b8e86df140340fabad5744c72d5c61e44a4f5fc16c0f414df","observation_id":"07d1701b-aded-4818-9ad6-1aa0f6fc72eb","resolution":{"observed_at":"2026-05-11T04:30:58.178293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"1912.02877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-07-02T21:57:25.915173Z","title":"Training agents using upside-down reinforcement learning","venue":null,"work_id":"56a8b123-20b1-4269-a9b7-e11faaab37e7","year":1912},"citing_paper":{"arxiv_id":"2606.08312","last_updated":"2026-06-06T19:55:54Z","snapshot_observed_at":"2026-07-06T23:47:48.634024Z","submitted_at":"2026-06-06T19:55:54Z","title":"Neuro-Symbolic Injection of LTLf Constraints in Autoregressive Reinforcement Learning Policies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T19:23:32.966503Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2606.08312"},"observation_digest":"sha256:54f4d7d23a88a5f9a0263ce2f1c5032f9cfd81434b515eefd4de43f3681685b2","observation_id":"b33bb334-208a-4f7b-b6bd-9a6d9280bba5","resolution":{"observed_at":"2026-07-02T21:57:25.916771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-01T17:45:14.105428Z","title":"arXiv preprint arXiv:1912.02877 , year=","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.17560","last_updated":"2026-07-20T05:09:36Z","snapshot_observed_at":"2026-08-05T13:38:45.921055Z","submitted_at":"2026-07-20T05:09:36Z","title":"Reinforcement Learning: From Algorithms To Foundation Models","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:14.105428Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2607.17560"},"observation_digest":"sha256:28cfda145416363e4c9b61bf5e8fb9a1a8deb524999297e3b539664bcc100a43","observation_id":"fc21b51e-44c7-4011-86bc-1d869c0540fc","resolution":{"observed_at":"2026-08-01T17:45:14.105428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-03T04:39:32.197052Z","title":"Training","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.29559","last_updated":"2026-07-31T15:50:29Z","snapshot_observed_at":"2026-08-06T05:11:44.921639Z","submitted_at":"2026-07-31T15:50:29Z","title":"LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback","version":1},"reference_index":269,"source":"arxiv_source","source_observed_at":"2026-08-03T04:39:32.197052Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2607.29559"},"observation_digest":"sha256:f8502d670f65cca2072b47ccbc82238513f970285152ae3ea2705ef96252fd81","observation_id":"008ffa89-a4da-4946-90dd-a2c1f29c159c","resolution":{"observed_at":"2026-08-03T04:39:32.197052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1912.02877/citation-record","integrity":"/paper/1912.02877/integrity","json":"/paper/1912.02877/citation-record.json","paper":"/paper/1912.02877"},"outbound":[],"paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:1912.02877."}