{"as_of":"2026-08-06T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28b887f7e26850f6a7bf95956c716bfd9e8d049d3425e05425633b5b22969d36","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:34:07.067380Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29613/citation-record","integrity":"/paper/2607.29613/integrity","json":"/paper/2607.29613/citation-record.json","paper":"/paper/2607.29613"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-03T03:34:03.242685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.242685Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:3356d8a33bccf797d7c153358891cf9dd8fda2dfb28461e5580cd2e125efac97","observation_id":"7fa90ab6-857f-4b8d-a7d3-59b97102d7d5","resolution":{"observed_at":"2026-08-03T03:34:03.242685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.288984Z","title":"𝜋0.5: Avision-language-actionmodelwithopen-worldgeneralization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.288984Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:443a7545ac7246b0aff096e81de50d1c7502214d90a4b148cbd26ab78efbfc15","observation_id":"f0f35e92-5023-4295-bcfa-3bf76c62f8a2","resolution":{"observed_at":"2026-08-03T03:34:03.288984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-08-05T18:18:04.172934Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-08-03T03:34:03.301615Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.301615Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:4522a79a5439abff7ff83b7eb20ae2e91d352164df2240b0052d678841d6c872","observation_id":"83ab3ffb-07f9-4034-bfe5-34ba90136c3c","resolution":{"observed_at":"2026-08-03T03:34:03.301615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-03T03:34:03.333897Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.333897Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:a0b11ffd197e8666169e57f995de18b470be1494646ab2aff97421f06aa7520f","observation_id":"bd1eba51-00ff-4a53-aff5-652d4dd5198c","resolution":{"observed_at":"2026-08-03T03:34:03.333897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T03:34:03.377367Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.377367Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:c8808ecf2808870826bb963240ce84170092933df6409435165b77c97c67feec","observation_id":"343dbda9-a696-4e7f-93d9-645eeaf20350","resolution":{"observed_at":"2026-08-03T03:34:03.377367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.430509Z","title":"What can rl bring to vla generalization? an empirical study.arXiv preprint arXiv:2505.19789, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.430509Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:d96678734b526e4dcd2c0d6d7d8ad746d67789b4266383943aca354af26a437e","observation_id":"1a4001d8-33fd-4efa-985f-ccd29084a647","resolution":{"observed_at":"2026-08-03T03:34:03.430509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.462501Z","title":"Srpo: Self-referential policy optimization for vision-language-action models.arXiv preprint arXiv:2511.15605, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.462501Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:313f69e2a22c940d98569094051ec8180725422f9e5bfff9be37b3006da116b8","observation_id":"d08c0812-ab4b-4173-aef3-12c0d56b7712","resolution":{"observed_at":"2026-08-03T03:34:03.462501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09674","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-11T17:59:17Z","title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09674","snapshot_observed_at":"2026-08-03T03:34:03.478972Z","title":"Simplevla-rl: Scaling vla training via reinforcement learning.arXiv preprint arXiv:2509.09674, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.478972Z"},"links":{"cited_paper":"/paper/2509.09674","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:b1a883668940add4ed79db254847fc5218a77e4928720400e5d09f3de9706e36","observation_id":"6eca5fab-20cf-4c76-a10f-91fa5b50df44","resolution":{"observed_at":"2026-08-03T03:34:03.478972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.506647Z","title":"Rlinf-vla: A unified and efficient framework for vla+ rl training.arXiv preprint arXiv:2510.06710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.506647Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:074a3fdaee9bbefaa86f24c9a4f63766294786c7daf5da88325c096196da56b9","observation_id":"73cdb8fc-c7af-487f-8777-ccc53fcbe341","resolution":{"observed_at":"2026-08-03T03:34:03.506647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-03T03:34:03.544151Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.544151Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:d6f09a25fc4d42122f44aef3a09ab814dee4de2b510940a57aba2e1f60d2ddc1","observation_id":"b647665a-7334-4173-b611-d5ef02bce27f","resolution":{"observed_at":"2026-08-03T03:34:03.544151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.573555Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.573555Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:a5cf9b720f80071669209ef7513be5021a9ff2c83a07124c98c22fb1a73701c6","observation_id":"242eec4c-a43e-4b75-a5b1-bfd812172088","resolution":{"observed_at":"2026-08-03T03:34:03.573555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.622824Z","title":"Rlinf-user: A unified and extensible system for real-world online policy learning in embodied ai","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.622824Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:692c64bacfbd3e4ae4adb6f1a69934a1757762d57fefe322413aec76e60f7007","observation_id":"b83d68a0-1171-4bd1-86d9-1894af254b05","resolution":{"observed_at":"2026-08-03T03:34:03.622824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.653698Z","title":"Predictive representations of state.Advances in neural information processing systems, 14, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.653698Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:706e8678f650f54d5aa0fbd13d6ce7c88305868286f8ce01e03ad6a52895cac5","observation_id":"df350158-23c2-4575-b6b6-4ea84dd51391","resolution":{"observed_at":"2026-08-03T03:34:03.653698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.671286Z","title":"Learning predictive state representations","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.671286Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:f3759e3d56a0ab81c5dd3e7257e0d56dfa646a4bb0a50eb9d93e1b0561583a4a","observation_id":"53cfd8ac-add9-43aa-8fa0-aa4a4fe6a9e1","resolution":{"observed_at":"2026-08-03T03:34:03.671286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1207.4167","last_updated":"2012-07-11T15:05:10Z","snapshot_observed_at":"2026-07-06T02:52:04.497210Z","submitted_at":"2012-07-11T15:05:10Z","title":"Predictive State Representations: A New Theory for Modeling Dynamical Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.4167","snapshot_observed_at":"2026-08-03T03:34:03.701039Z","title":"Predictive state representations: A new theory for modeling dynamical systems.arXiv preprint arXiv:1207.4167, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.701039Z"},"links":{"cited_paper":"/paper/1207.4167","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:c27e78d79293544be9e02e5286bbbde7d11f6c1044dff38ff05290e773f8c974","observation_id":"bdb30716-95e7-4ae3-b169-de0b687edc1d","resolution":{"observed_at":"2026-08-03T03:34:03.701039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.774921Z","title":"When is partially observable reinforcement learning not scary? InConference on Learning Theory, pages 5175–5220","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.774921Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:83515a2717df2d6c743d29e357f70626eba015878d758c0b4b83cef1f32bfbd0","observation_id":"1ebfbe89-9d2b-40b7-acaa-08e4cdbe4917","resolution":{"observed_at":"2026-08-03T03:34:03.774921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.790811Z","title":"Approximate information state for approximateplanningandreinforcementlearninginpartiallyobservedsystems.JournalofMachineLearningResearch, 23(12):1–83, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.790811Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:181cc36b2d07f0ff45258d6f1e07eb21062d19014141500493924da9c59ce715","observation_id":"6106fe5c-1350-4222-b9dd-df70d277639f","resolution":{"observed_at":"2026-08-03T03:34:03.790811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18719","last_updated":"2025-05-24T14:42:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-24T14:42:51Z","title":"VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18719","snapshot_observed_at":"2026-08-03T03:34:03.842090Z","title":"Vla-rl: Towards masterful and general robotic manipulation with scalable reinforcement learning.arXiv preprint arXiv:2505.18719, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.842090Z"},"links":{"cited_paper":"/paper/2505.18719","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:7e2f8e134f0a6c9d0cbb49914c404904769aa4ff32ca4051c6f1a5dddea01693","observation_id":"123f041f-05e5-42a0-9235-954ec290d52b","resolution":{"observed_at":"2026-08-03T03:34:03.842090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.872169Z","title":"Reinforcement learning with latent flow.Advances in Neural Information Processing Systems, 34:22171–22183, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.872169Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:986345915cbb2539054277d395d800efcbdc3cadc77d60e62d4d3b4acab87ba1","observation_id":"8a9ee29c-22c2-413d-90fd-6ce154bb1a8b","resolution":{"observed_at":"2026-08-03T03:34:03.872169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.885055Z","title":"Provable reinforcement learning with a short-term memory","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.885055Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:d6cf5e57f1f5feba28cd25850911781880a31c89acbdca6384886612ce56e0a2","observation_id":"8c54494c-aa1f-4e5f-bf04-52f172b5b90d","resolution":{"observed_at":"2026-08-03T03:34:03.885055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.919296Z","title":"Improving sample efficiencyinmodel-freereinforcementlearningfromimages","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.919296Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:832444d40d888dbbd3609f5c8fd0136559f1910730829aa16d9afadc77ad91de","observation_id":"19972567-022c-4080-8240-65516e2fcbbc","resolution":{"observed_at":"2026-08-03T03:34:03.919296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:03.948783Z","title":"Weakly supervised representation learning with sparse perturbations.Advances in Neural Information Processing Systems, 35:15516–15528, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.948783Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:c1d9e92f86ad4b0f30a28ee9dbfc4b4274f4b6daf24c03e98034555911f73b49","observation_id":"4e14a391-0959-47d7-9eab-7f60f8093f18","resolution":{"observed_at":"2026-08-03T03:34:03.948783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T03:34:03.975909Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:03.975909Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:9d0b641e4081df36a910cec846a0daba9eec65b74990d1048fbba67a897df67c","observation_id":"f2ecac8e-9a05-4392-a829-95c0f40aa3da","resolution":{"observed_at":"2026-08-03T03:34:03.975909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T03:34:04.050849Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.050849Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:47f80152b63bd1c6296df719de22d99630052aec34de24603cf25a70e5df898d","observation_id":"02b0f225-4330-464f-90c6-73748e5f0158","resolution":{"observed_at":"2026-08-03T03:34:04.050849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:04.075614Z","title":"Data-efficient reinforcement learning with self-predictive representations.International Conference on Learning Representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.075614Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:09654673214b8b5ec4a74816b3f972d6ceabb3c4b272e804c7eeb3d054d8ec76","observation_id":"87d8efb6-e8b5-418f-9a6b-46290389fc05","resolution":{"observed_at":"2026-08-03T03:34:04.075614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-03T03:34:04.107819Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.107819Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:d376e99e60163b0902d85f4e2441dffbac202e7a7efe81b12866e4849645dc62","observation_id":"7003de70-2833-4330-8149-940cfaadb01c","resolution":{"observed_at":"2026-08-03T03:34:04.107819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:04.139042Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.139042Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:5a7b32f76a245bbf09186531a966bdadc8800cfda3e59b1cb6b83ee77926cfd7","observation_id":"88171681-e18f-4375-9572-f08ab7c8fa8d","resolution":{"observed_at":"2026-08-03T03:34:04.139042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T03:34:04.174749Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.174749Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:8abc49ae228d6fd598d1fdcc9803725fceebcb920c9a83fcf38649c8e6727b65","observation_id":"708ea319-aba6-410d-8201-79efc96041d7","resolution":{"observed_at":"2026-08-03T03:34:04.174749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12628","last_updated":"2026-06-04T11:43:40Z","snapshot_observed_at":"2026-08-02T23:48:53.948791Z","submitted_at":"2026-02-13T05:15:50Z","title":"Beyond Imitation: Reinforcement Learning-Based Sim-Real Co-Training for VLA Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12628","snapshot_observed_at":"2026-08-03T03:34:04.267745Z","title":"Beyond imitation: Reinforcement learning-based sim-real co-training for vla models.arXiv preprint arXiv:2602.12628, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.267745Z"},"links":{"cited_paper":"/paper/2602.12628","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:9be1495dd40964282d9935abe6b243fcab38ee93ab61f99e614bfd00f6e1630b","observation_id":"592d2881-d740-4607-8194-2e85d338ba83","resolution":{"observed_at":"2026-08-03T03:34:04.267745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17016","last_updated":"2025-05-22T17:59:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:59:45Z","title":"Interactive Post-Training for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17016","snapshot_observed_at":"2026-08-03T03:34:04.350940Z","title":"Interactive post-training for vision-language-action models.arXiv preprint arXiv:2505.17016, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.350940Z"},"links":{"cited_paper":"/paper/2505.17016","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:2427eef2973e79995fb586dcd575e6d952dfec3f58160c732d0be42dade35a36","observation_id":"822de1b3-429a-4177-ad8f-3c28a816cdcb","resolution":{"observed_at":"2026-08-03T03:34:04.350940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T03:34:04.400722Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.400722Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:b8836efd14cf8c95c724297cef25726d79238e1d1a511dc70de132735aafecaf","observation_id":"853ca24b-1724-4fcd-b5b7-e97e81336a3a","resolution":{"observed_at":"2026-08-03T03:34:04.400722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-03T03:34:04.436544Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.436544Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:08f4ce201142b5868a52df2be4723794d5c8db251bb53be0e289c747eb3f709b","observation_id":"1b2310d6-92ae-40b1-b520-4c407fb0f638","resolution":{"observed_at":"2026-08-03T03:34:04.436544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-03T03:34:04.492471Z","title":"Soft actor-critic algorithms and applications.arXiv preprint arXiv:1812.05905, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.492471Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:3ca301a132c0c1d1e29cd6619e6ebcf16d4cbce770601e9bc366debc6ef2f397","observation_id":"44dfb27f-1f49-4687-b600-a0f442de68c8","resolution":{"observed_at":"2026-08-03T03:34:04.492471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-03T03:34:04.603280Z","title":"Offline reinforcement learning with implicit q-learning.arXiv preprint arXiv:2110.06169, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.603280Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:4e84e655e25db57c5acdaceac575364aba1fc941aff35f631e1c60f4a4bd791a","observation_id":"57438874-8622-461f-8331-e7470c642835","resolution":{"observed_at":"2026-08-03T03:34:04.603280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-03T03:34:04.663606Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.663606Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:241bf98a24dc3373b002273ff9f9efe131deb0505a46d5815374fc290f53f02f","observation_id":"8aab59ed-a513-42f3-bd7a-1a6b6c3595f0","resolution":{"observed_at":"2026-08-03T03:34:04.663606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:04.698327Z","title":"Reinflow: Fine-tuning flow matching policy with online reinforcement learning.arXiv preprint arXiv:2505.22094, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.698327Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:2013d3689891004021744103727fc889578c39401fff0adcce2418130cdf0b6a","observation_id":"a11aba10-313d-4f63-905d-e8f4b6034c33","resolution":{"observed_at":"2026-08-03T03:34:04.698327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05470","last_updated":"2025-10-27T09:57:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-08T17:58:45Z","title":"Flow-GRPO: Training Flow Matching Models via Online RL","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05470","snapshot_observed_at":"2026-08-03T03:34:04.727487Z","title":"Flow-grpo: Training flow matching models via online rl.arXiv preprint arXiv:2505.05470, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.727487Z"},"links":{"cited_paper":"/paper/2505.05470","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:50709d068e8d92ce8826e1c8bcb14872b0e47375f38ad24893cb87a9efca3f7f","observation_id":"68c8c9e2-c66e-4544-ac17-6f0fce99ed93","resolution":{"observed_at":"2026-08-03T03:34:04.727487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00588","last_updated":"2024-12-09T21:30:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-01T02:47:50Z","title":"Diffusion Policy Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00588","snapshot_observed_at":"2026-08-03T03:34:04.794445Z","title":"Diffusion policy policy optimization.arXiv preprint arXiv:2409.00588, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.794445Z"},"links":{"cited_paper":"/paper/2409.00588","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:fd0198a0394fe497451364c2f9b71cc0fe9f996ba7016e6b418474e43eadbcb1","observation_id":"9f13788d-107f-4628-ba61-208e54ae897a","resolution":{"observed_at":"2026-08-03T03:34:04.794445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15799","snapshot_observed_at":"2026-08-03T03:34:04.852016Z","title":"Steering your diffusion policy with latent space reinforcement learning.arXiv preprint arXiv:2506.15799, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.852016Z"},"links":{"cited_paper":"/paper/2506.15799","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:c5a713d54ab00eb926ca2927404066dd1b7ed9e00fc901da64de4072df0dd675","observation_id":"f698fb0e-85e1-4c77-9a51-3c1495ac8224","resolution":{"observed_at":"2026-08-03T03:34:04.852016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:04.926298Z","title":"Precise and dexterous robotic manipulation via human-in- the-loop reinforcement learning.Science Robotics, 10(105):eads5033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.926298Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:b02b7e45c0b6a0e74b689f3556ca09f7ecbcb7da713e1bfb5076067ef3d1f70d","observation_id":"73ca62b2-2d62-4f7c-a049-4a8f05474fff","resolution":{"observed_at":"2026-08-03T03:34:04.926298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:04.975813Z","title":"Gigabrain-0.5 m*: a vla that learns from world model-based reinforcement learning.arXiv preprint arXiv:2602.12099, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.975813Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:445d0a12b396692d7af7b5a251baa96580e7f0047536f8330b68fce66e1f318e","observation_id":"cfaad6db-cb59-4d64-aaf1-de56b7e983b3","resolution":{"observed_at":"2026-08-03T03:34:04.975813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:04.998876Z","title":"Optimal control of markov decision processes with incomplete state estimation.J","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:04.998876Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:4dc86e1f658691227ab8ba8dad660e7cded3766d8ce758089594fb0fcaf846c4","observation_id":"e929bafd-2a44-4e76-a65b-9c98b9284e70","resolution":{"observed_at":"2026-08-03T03:34:04.998876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.048458Z","title":"The optimal control of partially observable markov processes over a finite horizon.Operations research, 21(5):1071–1088, 1973","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.048458Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:9f4b3497d3723dd39c3e60fe3b94bbca483f76bef771e80dd1670df26985d03c","observation_id":"84aed31f-fe45-4273-9cab-e6d23b77c2b1","resolution":{"observed_at":"2026-08-03T03:34:05.048458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.103198Z","title":"Reinforcement learning with augmented data.Advances in neural information processing systems, 33:19884–19895, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.103198Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:27d835374b5bb0988a2c7d7205404fb34b7f131b62ce41c6ce43d14f43c26cc4","observation_id":"98d935dc-c828-43c3-aff9-317e556c7864","resolution":{"observed_at":"2026-08-03T03:34:05.103198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.185713Z","title":"Contextual decision processes with low bellman rank are pac-learnable","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.185713Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:0d52d6b9c633e43deae45e95e1ac015f61fbf2bf797adaa448d811f3cc739204","observation_id":"78cd7873-4be1-4ea0-82f1-b37fe1bcb0c7","resolution":{"observed_at":"2026-08-03T03:34:05.185713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.242212Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.242212Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:a3cafc8559c256f73aedc5ff434dc1898077abab003ad65d59901d4910ba3600","observation_id":"4e701487-ded9-4a2a-8fde-615fa793c6e4","resolution":{"observed_at":"2026-08-03T03:34:05.242212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.288843Z","title":"Deep recurrent q-learning for partially observable mdps","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.288843Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:30187c255eb5d7e66b3f0d539999b2e8b1a7319d7bb1e50181ff413694f0d705","observation_id":"0dadea8c-6c53-4ffa-a2f7-8b220aa2ae01","resolution":{"observed_at":"2026-08-03T03:34:05.288843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.05795","last_updated":"2019-02-15T12:47:50Z","snapshot_observed_at":"2026-07-06T07:33:20.047944Z","submitted_at":"2019-02-15T12:47:50Z","title":"Robust Reinforcement Learning in POMDPs with Incomplete and Noisy Observations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.05795","snapshot_observed_at":"2026-08-03T03:34:05.347655Z","title":"Robust reinforcement learning in pomdps with incomplete and noisy observations.arXiv preprint arXiv:1902.05795, 2019","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.347655Z"},"links":{"cited_paper":"/paper/1902.05795","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:ca3c20d5f676e29aee0d2398e82ca000d07a2f9137f7b57b27d7aad4cf3dff44","observation_id":"3dca8b78-4ee0-49d2-a690-58ae25b7be3c","resolution":{"observed_at":"2026-08-03T03:34:05.347655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09518","last_updated":"2025-08-20T02:45:49Z","snapshot_observed_at":"2026-07-06T21:23:51.965886Z","submitted_at":"2025-05-14T16:15:58Z","title":"Robust Finite-Memory Policy Gradients for Hidden-Model POMDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09518","snapshot_observed_at":"2026-08-03T03:34:05.377359Z","title":"Robust finite-memory policy gradients for hidden-model pomdps.arXiv preprint arXiv:2505.09518, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.377359Z"},"links":{"cited_paper":"/paper/2505.09518","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:32527c70e2cc0b96248e586bcd48b1ba1b90776af7e98df0b38a7bd0aadfc955","observation_id":"79d01f92-8e09-4a1d-a044-a73562782aeb","resolution":{"observed_at":"2026-08-03T03:34:05.377359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-03T03:34:05.408344Z","title":"Memoryvla: Perceptual-cognitive memory in vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.408344Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:c828146ded8566c482aa358c665468062bf52f49ca1a43f5ebaeb2afd5721d82","observation_id":"5a65ab53-f0d4-4fc7-8650-380116ace64a","resolution":{"observed_at":"2026-08-03T03:34:05.408344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.00695","last_updated":"2026-04-15T17:01:03Z","snapshot_observed_at":"2026-08-02T05:56:54.763312Z","submitted_at":"2025-10-01T09:15:52Z","title":"HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.00695","snapshot_observed_at":"2026-08-03T03:34:05.444734Z","title":"Hamlet: Switch your vision-language-action model into a history-aware policy.arXiv preprint arXiv:2510.00695, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.444734Z"},"links":{"cited_paper":"/paper/2510.00695","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:036d57b4797aa990dcf68c2d07084a257c22e868c8b87bb8f78c207a522486ae","observation_id":"6b3b49e7-5eb6-40f0-80b9-2abc4f9ac89e","resolution":{"observed_at":"2026-08-03T03:34:05.444734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.487924Z","title":"Cronusvla: Transferring latent motion across time for multi-frame prediction in manipulation.arXiv e-prints, pages arXiv–2506, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.487924Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:7190808aa458af429a56225a2396cf366ea18b2f0b89ff11b4bf5bf41256370b","observation_id":"5a1ba548-5787-4be7-8c7e-704f6aa7dac7","resolution":{"observed_at":"2026-08-03T03:34:05.487924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:05.503119Z","title":"Decision transformer: Reinforcement learning via sequence modeling.Advances in neural information processing systems, 34:15084–15097, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.503119Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:8072cdf6308745434077e31e23ba9fa195eadb4b8fd083412b1ac5c03e05bcdb","observation_id":"6a9c4f3a-696b-4556-816b-9316f18d4e5b","resolution":{"observed_at":"2026-08-03T03:34:05.503119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-03T03:34:05.569104Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.569104Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:edb81ccd993bf6ad6258a25cb1cdea3dfcb3bfcea5e3013f7731f2fa7b4ec2bc","observation_id":"6ad8aa0f-39e6-4432-abc4-c809ee450e54","resolution":{"observed_at":"2026-08-03T03:34:05.569104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-03T03:34:05.699196Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning.arXiv preprint arXiv:2601.16163, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.699196Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:53644aca5c730f3d7ac6dda24298ab1691645e23f8f7198132492e6f20badfb6","observation_id":"e4186373-6e16-4fe1-8f3b-b2c0d989aa43","resolution":{"observed_at":"2026-08-03T03:34:05.699196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-03T03:34:05.960639Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:05.960639Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:5128a5ad9eab070c135b49dc7b7a32cb1bf0212c157350098e607d63a0f68b12","observation_id":"252b9028-a7b9-48d0-a9bb-9921dc501027","resolution":{"observed_at":"2026-08-03T03:34:05.960639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-03T03:34:06.048945Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.048945Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:6db9500277dad482fa95c72bbce4322fd5cf9f1fd4ab5e1626fe729136def05b","observation_id":"6ab9c4a7-d9ce-4ee2-9fab-67980c921be9","resolution":{"observed_at":"2026-08-03T03:34:06.048945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-03T03:34:06.116648Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.116648Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:ce652f72e4465be916f02f4dbc9d9d93d671cab02feade3449be15e25618ec36","observation_id":"7024ebcd-9741-4e84-95a0-7e1585df37cb","resolution":{"observed_at":"2026-08-03T03:34:06.116648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.08544","last_updated":"2025-11-14T08:38:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T18:21:55Z","title":"LeJEPA: Provable and Scalable Self-Supervised Learning Without the Heuristics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.08544","snapshot_observed_at":"2026-08-03T03:34:06.268673Z","title":"Lejepa: Provable and scalable self-supervised learning without the heuristics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.268673Z"},"links":{"cited_paper":"/paper/2511.08544","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:2aa87f1b6b2f378e15832923c509c497868e23836536729ef402a310ede4b05b","observation_id":"439b7114-9c0f-4163-9f03-e08b3947a626","resolution":{"observed_at":"2026-08-03T03:34:06.268673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19312","last_updated":"2026-06-03T18:50:40Z","snapshot_observed_at":"2026-07-14T21:44:46.992364Z","submitted_at":"2026-03-13T19:48:14Z","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19312","snapshot_observed_at":"2026-08-03T03:34:06.397273Z","title":"Leworldmodel: Stable end-to-end joint-embedding predictive architecture from pixels.arXiv preprint arXiv:2603.19312, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.397273Z"},"links":{"cited_paper":"/paper/2603.19312","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:1457a09f106a89e62a5421440ef39447f191735592ff9617e7fd86ed666ba59b","observation_id":"a3693436-16f0-403b-b9e0-2b1fc073cd44","resolution":{"observed_at":"2026-08-03T03:34:06.397273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:06.517745Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.517745Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:3a22c1ad70a0e50330e5ed62fe19edfe10564b9bc1eb8d9bbf68f2e697d1c154","observation_id":"1e559c64-4cae-4de1-9a9a-0406d32435bc","resolution":{"observed_at":"2026-08-03T03:34:06.517745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:06.583766Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.583766Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:5bdd9bfec633774c1ce3e03a2409fd131ccfa519d5e5c1629c11a1efc7d0fbd8","observation_id":"484980e3-2d16-41dc-96b1-c0e3964ba11c","resolution":{"observed_at":"2026-08-03T03:34:06.583766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-07-06T11:34:01.629249Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-03T03:34:06.739901Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations.arXiv preprint arXiv:2107.14483, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.739901Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:a30fd30d195c514e4473386b3c9a4cbbf9f0ff375eab892077e714bba84f5244","observation_id":"99773263-4905-41ea-a982-3fde8f212d8e","resolution":{"observed_at":"2026-08-03T03:34:06.739901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:06.865518Z","title":"Meta- world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:06.865518Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:d42d9c0532c6fdf6887eed3f12f29e4d65cee66adcdd1e559f32941ae8702eff","observation_id":"59d15a0a-12a6-4016-81f4-17d904b8a8dc","resolution":{"observed_at":"2026-08-03T03:34:06.865518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:34:07.005364Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:07.005364Z"},"links":{"citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:1e77b4e7246689de66dbd3138356f524819a3c047e3b5cb3b2c7ca90fadcd231","observation_id":"079bb149-e56d-498b-a474-c4f90377d6ef","resolution":{"observed_at":"2026-08-03T03:34:07.005364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-07-06T22:32:42.381894Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-03T03:34:07.067380Z","title":"Libero-plus: In-depth robustness analysis of vision-language-action models.arXiv preprint arXiv:2510.13626, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T03:34:07.067380Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2607.29613"},"observation_digest":"sha256:ff03f2db7e544251590b44bd79470e940685b49a1c6fb140d27c9082f4e108a8","observation_id":"d3d21f88-ce07-42eb-963b-2567fafcbccf","resolution":{"observed_at":"2026-08-03T03:34:07.067380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29613","last_updated":"2026-07-31T16:48:45Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-05T23:16:03.039639Z","submitted_at":"2026-07-31T16:48:45Z","title":"WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.29613."}