{"as_of":"2026-08-01T19:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e24aa58613178bdf8bef27497fbe9e4dedf6f621676f24733d5fbe856bd0003f","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:20:01.348315Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18042/citation-record","integrity":"/paper/2607.18042/integrity","json":"/paper/2607.18042/citation-record.json","paper":"/paper/2607.18042"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-01T16:20:01.307867Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.307867Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:c3ef6e0752b6e8a7a760af2f434ce5ce9432348693ab38702a1e0ceb637f9097","observation_id":"46a89c5d-9a5f-4304-9e46-70de0eaded3d","resolution":{"observed_at":"2026-08-01T16:20:01.307867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:20:01.317356Z","title":"Learning to navigate unseen environments: Back translation with environmental dropout","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.317356Z"},"links":{"citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:65060591d68dd33f91b00fcb613a078b4ecae34ed3aa77ae1c18d9e5a4886f90","observation_id":"95e7f83a-46e8-4776-bb40-06a4b86c4ea7","resolution":{"observed_at":"2026-08-01T16:20:01.317356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-01T16:20:01.331240Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.331240Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:c03dbb6209363b69a285b69e2b24d4814d8350fdf26647fe371bf08ef5e81398","observation_id":"c0dd9534-363b-4078-9059-170c74b41c75","resolution":{"observed_at":"2026-08-01T16:20:01.331240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-01T16:20:01.335491Z","title":"World action models are zero-shot policies.arXiv preprint arXiv:2602.15922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.335491Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:3aab5117b9224ecdeca79c6f846c345fa75638d90fb5a4a51e46b15604eb654c","observation_id":"491951fd-441c-463e-b8c9-398c23d3eb1e","resolution":{"observed_at":"2026-08-01T16:20:01.335491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-01T16:20:01.340061Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.340061Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:06841508e62439325a8e8415002cecf4ab705bec2d5fac22d4cb6a1318c08548","observation_id":"68eb0e31-169d-4e9a-ae7d-2d5bf02e9f9d","resolution":{"observed_at":"2026-08-01T16:20:01.340061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:20:01.344132Z","title":"Janusvln: Decoupling semantics and spatiality with dual implicit memory for vision-language navigation.arXiv preprint arXiv:2509.22548,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.344132Z"},"links":{"citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:ef64b04a334057c9415428767021c36f1e4057a4953897e41acda3f9fb1b6e39","observation_id":"7334c0b8-eb33-40f3-9dc7-a4f6ab232883","resolution":{"observed_at":"2026-08-01T16:20:01.344132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-07-06T20:03:42.903210Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-01T16:20:01.348315Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks.arXiv preprint arXiv:2412.06224, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.348315Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:7b38a6b3ee48db0e2d8b0e005b45412bcca8a4165ad5c887346855b9772d049e","observation_id":"02591466-bd32-4c80-9ab7-19d1a91993ee","resolution":{"observed_at":"2026-08-01T16:20:01.348315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-01T16:20:01.293615Z","title":"Navila: Legged robot vision-language-action model for navigation.arXiv preprint arXiv:2412.04453,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.293615Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:c8d510e6bf2d13a0ed5560ea73d349b9a2e147ba563339b41c67f00f536f93b7","observation_id":"f4729f4d-613e-4a48-bbbf-f24dfdff1b23","resolution":{"observed_at":"2026-08-01T16:20:01.293615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:20:01.303494Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.303494Z"},"links":{"citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:7edebc1e4e4c1d9f891fa6160a3f5a33e812b432619802e7886d24eb3dc9356f","observation_id":"325173d6-7035-4413-9c56-222095333a93","resolution":{"observed_at":"2026-08-01T16:20:01.303494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-07-31T04:11:07.384159Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-08-01T16:20:01.321694Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling.arXiv preprint arXiv:2507.05240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.321694Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:83c73bbfadd76b28b2e0b4f1317f01f95493fc6dd4eb39b3fe74fdab9e40ca86","observation_id":"5d51fa7c-e599-4faf-b223-5cb276df9a49","resolution":{"observed_at":"2026-08-01T16:20:01.321694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:20:01.299039Z","title":"H-wm: Robotic task and motion planning guided by hierarchical world model.arXiv preprint arXiv:2602.11291,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.299039Z"},"links":{"citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:e0c4c7322347f8c7a4bffbd81d356f3b7e2f350ab572fed387c5f30a473a3d2a","observation_id":"04cf4a09-7ba6-42bf-979f-fa1b44d2c751","resolution":{"observed_at":"2026-08-01T16:20:01.299039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06403","last_updated":"2026-07-07T15:33:12Z","snapshot_observed_at":"2026-07-10T23:18:25.805834Z","submitted_at":"2026-07-07T15:33:12Z","title":"From Foundation to Application: Improving VLA Models in Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06403","snapshot_observed_at":"2026-08-01T16:20:01.326319Z","title":"From foundation to application: Improving vla models in practice.arXiv preprint arXiv:2607.06403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.326319Z"},"links":{"cited_paper":"/paper/2607.06403","citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:28dbe1eb435a526e9ff803cea7b2d9f31a504f5364616a8132d46de751b89da0","observation_id":"98631932-0bc3-4b2c-b9cf-0519035d1d01","resolution":{"observed_at":"2026-08-01T16:20:01.326319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T16:20:01.312489Z","title":"Vla-jepa: Enhancing vision-language-action model with latent world model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T16:20:01.312489Z"},"links":{"citing_paper":"/paper/2607.18042"},"observation_digest":"sha256:a9291cea46e5783f9434302d2a4e6efd31a2b02bfb14165236ca221ea6d22801","observation_id":"75ff7206-e1b2-427c-8fa5-781f15a9860c","resolution":{"observed_at":"2026-08-01T16:20:01.312489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18042","last_updated":"2026-07-23T15:59:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T16:20:00.938072Z","submitted_at":"2026-07-20T15:11:46Z","title":"Anticipate Before Acting: Future-State-Conditioned Vision-Language Navigation"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2607.18042."}