{"as_of":"2026-08-07T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cfd48ad6ede5e1b74b0cfabf9f0ba8bb91e55401b68932194ea4fc8fcdf06d0","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:14:02.691163Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.18175/citation-record","integrity":"/paper/2601.18175/integrity","json":"/paper/2601.18175/citation-record.json","paper":"/paper/2601.18175"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T08:14:02.610152Z","title":"Touvron, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.610152Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:13a2f8f55835c09250c11d9b3471290a8d7028538bc30e5fde575b0f59afdde0","observation_id":"09029daa-0b2c-4c2e-86cb-a3943bd44ca3","resolution":{"observed_at":"2026-08-03T08:14:02.610152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:14:02.691163Z","title":"The first equality is a definition of Lπ0 (π+)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.691163Z"},"links":{"citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:f94fc0af97d88eeda0eef683678eee74b2625295b4b43e402f8636d0a89504c9","observation_id":"5c8376d4-1666-4d32-9355-6b519a11430a","resolution":{"observed_at":"2026-08-03T08:14:02.691163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:14:02.023064Z","title":"Bhandari and D","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.023064Z"},"links":{"citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:4723aefbd39973b14055b8ba346a34acf2455d4036691f527344f540c4b56e3c","observation_id":"62f79463-8cd1-407f-86c7-4435e5607a42","resolution":{"observed_at":"2026-08-03T08:14:02.023064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T08:14:02.464290Z","title":"Schulman, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.464290Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:55670e0ed68f71ee0089987abea0eb062e36202b1908c8ba59612a38f5930064","observation_id":"d529df4a-4268-4725-bf0c-dea6b014cf42","resolution":{"observed_at":"2026-08-03T08:14:02.464290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-03T08:14:02.544642Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.544642Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:3ed9b65b101a1c3244bccaed5354e3bfee4685d48c078306fdaf3a516176548a","observation_id":"310d9c01-bbdb-4460-8592-6e9a51c52323","resolution":{"observed_at":"2026-08-03T08:14:02.544642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:14:02.093983Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.093983Z"},"links":{"citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:8e115e6f59d35ea51c35a97380711e807d91d88863ca95713f44e12b5b4e3d8e","observation_id":"bcb313a7-679a-48e0-a15c-31d27690d890","resolution":{"observed_at":"2026-08-03T08:14:02.093983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-07-06T06:37:02.085757Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-03T08:14:02.253123Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.253123Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:ee692cab839521e9b22e87b99bf661d80af52f6b916f09d316a45639b442916c","observation_id":"b281e5ca-9f1b-4672-afe5-f200cffd2c3f","resolution":{"observed_at":"2026-08-03T08:14:02.253123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-06T05:45:23.347318Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-03T08:14:02.352724Z","title":"Schmidhuber","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.352724Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:0d03a3c4dabe4c459c305b8513d2f5e716b3d03911e6082b769a4f3acae0d739","observation_id":"221a88ec-2bdf-4443-ac4e-ba250853f5da","resolution":{"observed_at":"2026-08-03T08:14:02.352724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T08:14:02.173867Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.173867Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:b8b3e070512af4c30ce8c27b3d01ab64b9c682575a46be98687703fb6bf1741f","observation_id":"58bcb1bc-0d35-4f65-8783-f27f9934e8e3","resolution":{"observed_at":"2026-08-03T08:14:02.173867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T16:03:06.015102Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 0 inbound Pith citation observations for arXiv:2601.18175."}