{"as_of":"2026-08-14T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b300d2bc2badf7d59dd5a1e8f5926b97612e5bfabb88acc930a3177c8b0bf372","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T13:18:33.153895Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:57:57.027963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T17:40:00.313058Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"cited_work":{"arxiv_id":"2601.00898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.00898","snapshot_observed_at":"2026-07-20T03:19:14.643152Z","title":"Liang, Y","venue":null,"work_id":"2f183574-8209-48fa-8405-671a787fab88","year":2026},"citing_paper":{"arxiv_id":"2605.04470","last_updated":"2026-05-06T03:49:01Z","snapshot_observed_at":"2026-08-10T23:06:53.693096Z","submitted_at":"2026-05-06T03:49:01Z","title":"CRAFT: Counterfactual-to-Interactive Reinforcement Fine-Tuning for Driving Policies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T17:20:55.364175Z"},"links":{"cited_paper":"/paper/2601.00898","citing_paper":"/paper/2605.04470"},"observation_digest":"sha256:e18fee088a4c8c6b67ab69cfe081b299cf16e7cd9665240d9a0d5af90ca25c19","observation_id":"2494b19a-086f-42ac-9622-946ba18891ee","resolution":{"observed_at":"2026-07-20T03:19:14.643152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"cited_work":{"arxiv_id":"2601.00898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.00898","snapshot_observed_at":"2026-07-20T03:19:14.643152Z","title":"Liang, Y","venue":null,"work_id":"2f183574-8209-48fa-8405-671a787fab88","year":2026},"citing_paper":{"arxiv_id":"2606.24742","last_updated":"2026-06-23T16:07:48Z","snapshot_observed_at":"2026-08-13T10:06:32.930920Z","submitted_at":"2026-06-23T16:07:48Z","title":"World Value Models for Robotic Manipulation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-25T23:33:50.854261Z"},"links":{"cited_paper":"/paper/2601.00898","citing_paper":"/paper/2606.24742"},"observation_digest":"sha256:f450866d2d24b4eb5d5aaf5c9af4b9535c1b279edf8fcec8badc0b10e88ea1b1","observation_id":"2103e74d-c4ca-4cb9-8434-139796fbb3f8","resolution":{"observed_at":"2026-07-20T03:19:14.643152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.00898","snapshot_observed_at":"2026-08-03T10:57:57.027963Z","title":"Dichotomous diffusion policy optimization.arXiv preprint arXiv:2601.00898, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29246","last_updated":"2026-07-31T10:19:41Z","snapshot_observed_at":"2026-08-08T13:08:03.472254Z","submitted_at":"2026-07-31T10:19:41Z","title":"Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:57:57.027963Z"},"links":{"cited_paper":"/paper/2601.00898","citing_paper":"/paper/2607.29246"},"observation_digest":"sha256:3a8f9a721be900e7b98921d9d16186858ba82ff6d43607ba4f9078eea19eb9b5","observation_id":"c44bc475-1f86-4cf5-814a-33156b0f5d9a","resolution":{"observed_at":"2026-08-03T10:57:57.027963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.00898/citation-record","integrity":"/paper/2601.00898/integrity","json":"/paper/2601.00898/citation-record.json","paper":"/paper/2601.00898"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T13:18:29.293564Z","title":"URLhttps://arxiv.org/ abs/2410.24164","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.293564Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:0a531907b60f24f4dededb3f9452431899860b8b247d0afc6423c841418ee380","observation_id":"170112b5-b494-410c-9f79-6a1c48ea97a6","resolution":{"observed_at":"2026-08-03T13:18:29.293564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.703700Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.703700Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:aaacb1c1112b8a0088741bfcf4ae645dc34155b0ff3089db5ab83c3692bcb336","observation_id":"8c00f752-55d0-40ec-806e-661c329f41de","resolution":{"observed_at":"2026-08-03T13:18:32.703700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:30.048860Z","title":"URLB: unsupervised reinforcement learning benchmark","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.048860Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:3adb9c4a932bf291265f85e664d92e830d55b6933feaf8a0c80192ead9b4425f","observation_id":"2031654f-4d5a-43fa-96c6-8b59febce21d","resolution":{"observed_at":"2026-08-03T13:18:30.048860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-07-06T14:55:12.100148Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12192","snapshot_observed_at":"2026-08-03T13:18:30.168819Z","title":"Aligning text-to-image models using human feedback.arXiv preprint arXiv:2302.12192,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.168819Z"},"links":{"cited_paper":"/paper/2302.12192","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:d5c26383586f541d98bb0603f4b4e913add1509d8ad55366a19042188ddab850","observation_id":"908817a2-4a1b-4c0b-bb1d-1704207c72b4","resolution":{"observed_at":"2026-08-03T13:18:30.168819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06978","last_updated":"2024-08-30T03:37:36Z","snapshot_observed_at":"2026-07-06T18:28:42.314877Z","submitted_at":"2024-06-11T06:18:26Z","title":"Hydra-MDP: End-to-end Multimodal Planning with Multi-target Hydra-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06978","snapshot_observed_at":"2026-08-03T13:18:30.372744Z","title":"Hydra-mdp: End-to-end multimodal planning with multi-target hydra- distillation.arXiv preprint arXiv:2406.06978,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.372744Z"},"links":{"cited_paper":"/paper/2406.06978","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:4c9edec716d9df159d85ed636bc8b0e2f36e362f064b3c26c3b091febf2bcc82","observation_id":"f2aef2ba-53fd-42ec-947a-885899c4e013","resolution":{"observed_at":"2026-08-03T13:18:30.372744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:30.517734Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in Neural Information Processing Systems, 35:5775–5787,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.517734Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:db24fb2e6a6793573103630fdeb5464b48fa45e862ffd3e9f5f20acb915b8752","observation_id":"2cc52555-cdb8-42f2-b81b-bdbf991d49c7","resolution":{"observed_at":"2026-08-03T13:18:30.517734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-07-06T20:22:04.328179Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09732","snapshot_observed_at":"2026-08-03T13:18:30.632270Z","title":"Efficient online reinforcement learning for diffusion policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.632270Z"},"links":{"cited_paper":"/paper/2501.09732","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:d6ad035390d007abdd92ad1fc88a3eddb9c723127d91b8d37014d12e29a82d0f","observation_id":"80952e50-9b4a-4819-ae7c-7c9e2cb459d6","resolution":{"observed_at":"2026-08-03T13:18:30.632270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-03T13:18:30.860519Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.860519Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:6ca662d3692a713467545e25095908a6ec23536e9f6e343ed46b1f21eee31d35","observation_id":"b87e6b12-99d4-48dc-a898-d84e4b66d094","resolution":{"observed_at":"2026-08-03T13:18:30.860519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01052","last_updated":"2022-11-21T06:03:52Z","snapshot_observed_at":"2026-08-13T21:47:56.154765Z","submitted_at":"2022-11-02T11:36:06Z","title":"Offline RL With Realistic Datasets: Heteroskedasticity and Support Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01052","snapshot_observed_at":"2026-08-03T13:18:31.372455Z","title":"Offline rl with realistic datasets: Heteroskedasticity and support constraints.arXiv preprint arXiv:2211.01052,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.372455Z"},"links":{"cited_paper":"/paper/2211.01052","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:ca457242581ef49667cb9f23da809aa068e838b4522d504895a58582bd4dadea","observation_id":"e9441e47-57b0-4326-8325-3213ee3b2f43","resolution":{"observed_at":"2026-08-03T13:18:31.372455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:31.491372Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.491372Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:2f7846362d73429f00df12c0bcf618cd3704720a769a24dfd432613f9b75f375","observation_id":"31c56648-6bc6-4cd0-b248-0da035a596a4","resolution":{"observed_at":"2026-08-03T13:18:31.491372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-03T13:18:31.635163Z","title":"Andrew Wagenmaker, Mitsuhiko Nakamoto, Yunchu Zhang, Seohong Park, Waleed Yagoub, Anusha Nagabandi, Abhishek Gupta, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.635163Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:9e77d2f2573d3ce2a8b54b55019b5f34d2a875d64c866b9ee081ee71ba8d2c7c","observation_id":"6606e6f5-aa24-4179-825c-6d5a9a526179","resolution":{"observed_at":"2026-08-03T13:18:31.635163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-03T13:18:31.749822Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.749822Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:3a054c68293b07447d1f495484ed10d33079d3f3c37b41c57f28ece4c7bf2a32","observation_id":"f66d2dca-4c80-467d-9ed9-11657ba88217","resolution":{"observed_at":"2026-08-03T13:18:31.749822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13368","last_updated":"2025-04-17T22:21:35Z","snapshot_observed_at":"2026-08-07T16:01:17.621322Z","submitted_at":"2025-04-17T22:21:35Z","title":"An Optimal Discriminator Weighted Imitation Perspective for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13368","snapshot_observed_at":"2026-08-03T13:18:31.831475Z","title":"Offline rl with no ood actions: In-sample learning via implicit value regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.831475Z"},"links":{"cited_paper":"/paper/2504.13368","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:82fb7bf6d43c71980b93b9a053771520d4812489ffeba86b7ecd276ae9dc40e7","observation_id":"c6a1765c-5ccd-42f4-9528-f69f63c67c47","resolution":{"observed_at":"2026-08-03T13:18:31.831475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13425","last_updated":"2022-04-05T19:24:13Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T18:39:27Z","title":"Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13425","snapshot_observed_at":"2026-08-03T13:18:31.944989Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.944989Z"},"links":{"cited_paper":"/paper/2201.13425","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:7de55296e77c6f3233d1f571817d47ccc09f3037cd91d7c7fd38b76648d4ad2c","observation_id":"df66ff61-e2f3-4b79-8359-27727a485f0f","resolution":{"observed_at":"2026-08-03T13:18:31.944989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10274","last_updated":"2025-10-11T16:20:17Z","snapshot_observed_at":"2026-08-11T15:30:01.335662Z","submitted_at":"2025-10-11T16:20:17Z","title":"X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10274","snapshot_observed_at":"2026-08-03T13:18:32.062486Z","title":"X-vla: Soft-prompted transformer as scalable cross- embodiment vision-language-action model.arXiv preprint arXiv:2510.10274, 2025a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.062486Z"},"links":{"cited_paper":"/paper/2510.10274","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:62d0d84634bedb4f50a8d7b2f954143dfc32cb6b9a2c8f749473b6675ff85ecb","observation_id":"f840cb6c-c722-457d-a8f1-40ddd6899cd2","resolution":{"observed_at":"2026-08-03T13:18:32.062486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.162485Z","title":"net/forum?id=j5JvZCaDM0","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.162485Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:2e8d9fbe603690587f879a5ea3ec9273fcf18fe636cc0c24f6cfb9ba29f4cd25","observation_id":"4b589c11-a8b7-4284-bb5b-69da1d431f68","resolution":{"observed_at":"2026-08-03T13:18:32.162485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.456115Z","title":"We utilize datasets collected by unsuper- vised RL algorithmsRND(Burda et al.,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.456115Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:267876ec13ac48db01f6a7750ca7675d610a4bf43f4aec4fb6d354a5634e1f31","observation_id":"d949d42e-0683-4cd2-b345-907bdb1cd473","resolution":{"observed_at":"2026-08-03T13:18:32.456115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.587921Z","title":"For each environment, we use the full dataset with all transitions from each dataset","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.587921Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:b0845927bd793de0aa857ea5584601a3f86325666864615ca5ce919d71102787","observation_id":"b1225208-3e2a-4087-aeec-39b4545c57b7","resolution":{"observed_at":"2026-08-03T13:18:32.587921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.863599Z","title":"Comparing with other offline RL methods,DIPOLEachieves better performance after the full finetuning process","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.863599Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:4ea478136c87e367c841c365cb2a0df967c0a5057b4a6b8bcfc4ba9715c6a4d4","observation_id":"79130141-d2ae-411a-8d08-052f5edf3486","resolution":{"observed_at":"2026-08-03T13:18:32.863599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.982972Z","title":"The visual input comprises images from Front, Front-Left, and Front-Right perspectives, while the language input consists of driving commands provided by the dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.982972Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:7fb53620c9485ae69d1207a13fce93a5cd382c81d98766e4751a9b801c43beeb","observation_id":"2138d679-b785-46a5-b753-f573f20bde8a","resolution":{"observed_at":"2026-08-03T13:18:32.982972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:33.153895Z","title":"F LIMITATION& DISCUSSION& FUTUREWORK Here, we discuss the limitations, potential solutions, and promising future directions of our work","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:33.153895Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:5f6315ed7073479b349fb5f1d04a86b3beb7c35ce258e3488d2b12b5a844bb08","observation_id":"217aa1d5-bf67-4493-88bd-130c6f8b7428","resolution":{"observed_at":"2026-08-03T13:18:33.153895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:32.303397Z","title":"In this setting, a policy is a probability distribution of actions conditioned on a state","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:32.303397Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:1370577b21de65df7029876eed0ed6e46964c888e1755fc7b6ce9bfc21606e32","observation_id":"ea263ba4-10b8-4dcb-befa-5b9ba01f6c48","resolution":{"observed_at":"2026-08-03T13:18:32.303397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T13:18:31.128457Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.128457Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:7752ab1bfbbbf867a27cacf024852a0214fba44eecb7d3b0b728c9cb849275dd","observation_id":"fcf1c14a-838f-44d9-8772-5a807c1a88ee","resolution":{"observed_at":"2026-08-03T13:18:31.128457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T13:18:31.278572Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:31.278572Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:06b2c7a7e6bc14f7b51714c6585cbb57545de66c745ea06b291a93199fd74a3b","observation_id":"efb88e57-6e14-4553-a5b8-ecb693f63400","resolution":{"observed_at":"2026-08-03T13:18:31.278572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10573","last_updated":"2023-05-19T18:31:04Z","snapshot_observed_at":"2026-08-14T17:40:51.391072Z","submitted_at":"2023-04-20T18:04:09Z","title":"IDQL: Implicit Q-Learning as an Actor-Critic Method with Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10573","snapshot_observed_at":"2026-08-03T13:18:29.599405Z","title":"Idql: Implicit q-learning as an actor-critic method with diffusion policies.arXiv preprint arXiv:2304.10573,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.599405Z"},"links":{"cited_paper":"/paper/2304.10573","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:29ae130525db2ab9467b450929d5e5f499a6dc1e37596e6ebda4ecc5b447b7a3","observation_id":"7f145fc9-693c-408e-a139-8cd5c5c9dbed","resolution":{"observed_at":"2026-08-03T13:18:29.599405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03739","last_updated":"2024-11-07T03:54:22Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:18Z","title":"Aligning Text-to-Image Diffusion Models with Reward Backpropagation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03739","snapshot_observed_at":"2026-08-03T13:18:30.948259Z","title":"Aligning text-to- image diffusion models with reward backpropagation.arXiv preprint arXiv:2310.03739,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.948259Z"},"links":{"cited_paper":"/paper/2310.03739","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:006681f780591db68f03199cb4d98d8796f67fceb43cb95c262de4e26a67d954","observation_id":"a52b2a05-751a-4ddf-9a94-ef46be016991","resolution":{"observed_at":"2026-08-03T13:18:30.948259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-03T13:18:30.763809Z","title":"Awac: Accelerating online rein- forcement learning with offline datasets.arXiv preprint arXiv:2006.09359,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.763809Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:c9ac272481587eec4bcfc2c64b8ce1022db658031c0c956f96aa7a5a8286aa20","observation_id":"7dcf3c5b-1ab8-40e9-a991-1fc2ccf06cb0","resolution":{"observed_at":"2026-08-03T13:18:30.763809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-11T00:35:03.632691Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T13:18:29.364170Z","title":"Diffusion guidance is a controllable policy improvement operator.arXiv preprint arXiv:2505.23458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.364170Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:9b3ed12053ebb9c7dea623160f3c70e954bf9e753ef6b9a9cad39533ec8ccf46","observation_id":"cba2875a-4da8-40c8-be8f-2d6167778d44","resolution":{"observed_at":"2026-08-03T13:18:29.364170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-03T13:18:29.776718Z","title":"org/abs/2207.12598","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.776718Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:7bf22171062cc78a29635587ceb50724e0cafcd75e5dcea6c423552d1d07ff8e","observation_id":"ffb3f69d-20ef-4e86-aa12-e5221f77c9c2","resolution":{"observed_at":"2026-08-03T13:18:29.776718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:30.248074Z","title":"Discrete diffusion for reflective vision-language-action models in autonomous driving.arXiv preprint arXiv:2509.20109,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:30.248074Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:910466937a281e01cf850d498b61eed06f22c569528653e87f4bd75008062c36","observation_id":"f2b836f5-ff26-4d78-98fc-22e0dca0a632","resolution":{"observed_at":"2026-08-03T13:18:30.248074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:29.914723Z","title":"Rl with kl penalties is better viewed as bayesian inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.914723Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:5b7130942d6879ea532eaf5ee2e77bfdbeaa90ba0417c16b047c651e1a734840","observation_id":"514c0580-bd6f-44c0-b9bc-9e550952c025","resolution":{"observed_at":"2026-08-03T13:18:29.914723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T13:18:29.439176Z","title":"Extreme q-learning: Maxent rl without entropy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T13:18:29.439176Z"},"links":{"citing_paper":"/paper/2601.00898"},"observation_digest":"sha256:e268119041e190928cda85646fa52962876a7a4ab956ee69270462918b93c34d","observation_id":"d48eeea0-34f4-450f-9e87-ec6985f949f4","resolution":{"observed_at":"2026-08-03T13:18:29.439176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.00898","last_updated":"2026-07-17T14:56:12Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T18:44:43.995814Z","submitted_at":"2025-12-31T16:56:56Z","title":"Dichotomous Diffusion Policy Optimization"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:2601.00898."}