{"as_of":"2026-08-17T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:207df2d89ad9df5a0c3dc3f5b38f4d4633eb7512a15e4010f246bcadd4f1b387","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:52:55.674025Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09730/citation-record","integrity":"/paper/2608.09730/integrity","json":"/paper/2608.09730/citation-record.json","paper":"/paper/2608.09730"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T11:52:55.636885Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.636885Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:f45ee3b1af21cafe9907f5be952c12f8925c84dff8fb739909d3951c591c9124","observation_id":"f6db37f8-df69-4a5b-a9bc-1bec9f8e7372","resolution":{"observed_at":"2026-08-11T11:52:55.636885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.642353Z","title":"VLA-JEPA: Enhancing vision-language-action model with latent world model.arXiv preprint arXiv:2602.10098,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.642353Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:7adb023cb6007a9ccb8bf1e2da84920667191f63b0dd697e2b45c78db34a24b7","observation_id":"0dc1c50f-f5d6-4f63-afd5-926905ff0386","resolution":{"observed_at":"2026-08-11T11:52:55.642353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07931","last_updated":"2026-05-13T19:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T16:04:43Z","title":"One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07931","snapshot_observed_at":"2026-08-11T11:52:55.646630Z","title":"One token per frame: Reconsidering visual bandwidth in world models for VLA policy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.646630Z"},"links":{"cited_paper":"/paper/2605.07931","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:d5c89185529d698dbc5ba0486c15c97f018f236aad8ed621dea67e5ba39ee8fb","observation_id":"a21cfbb2-8175-4df4-9e22-40192f6ccc35","resolution":{"observed_at":"2026-08-11T11:52:55.646630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.10422","last_updated":"2026-05-29T05:31:44Z","snapshot_observed_at":"2026-08-12T06:19:25.323667Z","submitted_at":"2026-03-11T05:11:44Z","title":"World2Act: Latent Action Post-Training from World Model Dynamics","version":2},"cited_work":{"arxiv_id":"2603.10422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.10422","snapshot_observed_at":"2026-08-11T11:52:55.829055Z","title":"World2Act: Latent Action Post-Training from World Model Dynamics","venue":"cs.CV","work_id":"82ea247d-800e-4b7a-8b48-b4349dc26a24","year":2026},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.651035Z"},"links":{"cited_paper":"/paper/2603.10422","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:469dc157394370f9f9b98bc092a7246ca1beca100faca602ecc9c5f02695077f","observation_id":"b75afe70-f9f2-464d-80c5-046d6dc53446","resolution":{"observed_at":"2026-08-11T11:52:55.836408Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-16T15:06:00.366316Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-11T11:52:55.655345Z","title":"BridgeData V2: A dataset for robot learning at scale.arXiv preprint arXiv:2308.12952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.655345Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:6d0fcb15cdbbcdc623286ef89046eff58acebe6ab057562f59921bfbf3f6756e","observation_id":"f6c4bcfb-0b1a-4d54-9a97-a942ecadba9a","resolution":{"observed_at":"2026-08-11T11:52:55.655345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.11757","last_updated":"2026-04-13T17:30:01Z","snapshot_observed_at":"2026-07-06T23:00:03.762376Z","submitted_at":"2026-04-13T17:30:01Z","title":"StarVLA-$\\alpha$: Reducing Complexity in Vision-Language-Action Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.11757","snapshot_observed_at":"2026-08-11T11:52:55.659762Z","title":"StarVLA-𝛼: Reducing complexity in vision-language-action systems.arXiv preprint arXiv:2604.11757, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.659762Z"},"links":{"cited_paper":"/paper/2604.11757","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:7d4930c40647c324c7463a55ed297e8377a3fcde09a9a1998e05e7421f54aeb4","observation_id":"95c30bd7-31d3-4bf8-b858-34080c05bac9","resolution":{"observed_at":"2026-08-11T11:52:55.659762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.664989Z","title":"𝛿VLA:Prior-guidedvision-language-actionmodelsviaworldknowledgevariation.arXiv preprint arXiv:2603.08361,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.664989Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:612a128675d3cd78d17f10cc73c260ea12d3ece2d4553e5852413aa763951b6c","observation_id":"75e865f1-f1c4-4b87-837a-817bd924df4e","resolution":{"observed_at":"2026-08-11T11:52:55.664989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:56.153013Z","title":"We use AdamW with𝛽= (0.9,0.95) ,𝜖=10 −8, and weight decay10−8, under a cosine schedule with linear warmup","venue":null,"work_id":"6d6c02e6-1238-4d6f-87a5-0652f6c85472","year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.669408Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:7e37efa9155717eaeeea3ce92325eef55ef0d5263b2497ae145c16b60e6dabd2","observation_id":"dabfba20-dc68-409a-b791-160f285c5780","resolution":{"observed_at":"2026-08-11T11:52:56.158365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:56.137743Z","title":null,"venue":null,"work_id":"dc5448a6-2893-47e4-8a74-802f7f75e065","year":2026},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.674025Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:5c252ccd806c2c3e70d508593c203276b8731dfa2855101a6ff7f0becaf112f8","observation_id":"101c7be5-a322-4587-99dc-11055849eb3c","resolution":{"observed_at":"2026-08-11T11:52:56.142199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-11T11:52:55.613388Z","title":"WorldVLA: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.613388Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:ef1ec168226b4ef1cbf7a476cb815543748bc58df3e4b4a6daa287d366133c60","observation_id":"e2b5cf19-cc19-471b-90f2-8f11b8fcc6a7","resolution":{"observed_at":"2026-08-11T11:52:55.613388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.618677Z","title":"Robotic VLA benefits from joint learning with motion image diffusion.arXiv preprint arXiv:2512.18007,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.618677Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:ddfe663eaca8b38be0d442ec1d23bfc4f535a019f44efe9c8a9a79fded5a7a8f","observation_id":"99eccc8d-ad0a-41e6-8d94-65296ad4ed31","resolution":{"observed_at":"2026-08-11T11:52:55.618677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-11T11:52:55.623005Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.623005Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:88dfff8d927f13565f1a273c8f86a746f26593444ff3919858a2a4def7649e7b","observation_id":"3cfe59c5-a037-4b0e-95d7-ee56f79def5b","resolution":{"observed_at":"2026-08-11T11:52:55.623005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:52:55.628035Z","title":"DiT4DiT: Jointly modeling video dynamics and actions for generalizable robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.628035Z"},"links":{"citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:114af473bcf049f678bb4fe1581298454ad15f44dd03db537de6653617e2a8f5","observation_id":"70551851-8387-412a-b9da-29d0052a4284","resolution":{"observed_at":"2026-08-11T11:52:55.628035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-11T11:52:55.632302Z","title":"GR00T N1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T11:52:55.632302Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.09730"},"observation_digest":"sha256:069137125ce4549e1f67ae806adb9f9fdd5dac11d1a180377d8820971c783dd7","observation_id":"bd1375fc-bb65-4083-8e81-a160f95fffbd","resolution":{"observed_at":"2026-08-11T11:52:55.632302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09730","last_updated":"2026-08-10T15:30:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T19:43:05.794373Z","submitted_at":"2026-08-10T15:30:38Z","title":"World Tokens: Enhancing Embodied Policies with Training-Time World Modeling"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.09730."}