{"as_of":"2026-08-20T03:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a8f8db2c0a9ffb1d7de0441603720ceb27077b76626767238361830803f4fc3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:06:07.655484Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T22:18:59.687280Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-20T01:13:21.886919Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-11T19:45:35.964434Z","title":"History aware multimodal transformer for vision-and-language navigation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06413","last_updated":"2025-06-25T10:03:04Z","snapshot_observed_at":"2026-08-18T09:09:52.309621Z","submitted_at":"2024-12-09T11:40:54Z","title":"World-Consistent Data Generation for Vision-and-Language Navigation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T19:45:35.964434Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2412.06413"},"observation_digest":"sha256:6f36ae42c8288bb503819da60fc604ea26d78c9f8e86dd352df3fa50c0856762","observation_id":"8789d29c-01a5-4042-9aca-4ce324fb144b","resolution":{"observed_at":"2026-08-11T19:45:35.964434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-20T01:13:21.886919Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-16T11:06:07.655484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16516","last_updated":"2025-04-24T19:36:09Z","snapshot_observed_at":"2026-08-18T14:44:46.063293Z","submitted_at":"2025-04-23T08:41:27Z","title":"Think Hierarchically, Act Dynamically: Hierarchical Multi-modal Fusion and Reasoning for Vision-and-Language Navigation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:06:07.655484Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2504.16516"},"observation_digest":"sha256:c37214f01b75c0bc33fedcf411362acd7138a5f1c61ce81386a5b06a8c88c348","observation_id":"b4b2cf3f-f1bd-4a7c-883d-2e17e46ea3b5","resolution":{"observed_at":"2026-08-16T11:06:07.655484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-20T01:13:21.886919Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-08-07T13:52:05.004076Z","title":"History aware multimodal trans- former for vision-and-language navigation.ArXiv, abs/2110.13309, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20897","last_updated":"2025-06-22T13:53:33Z","snapshot_observed_at":"2026-08-17T05:28:55.208146Z","submitted_at":"2025-05-27T08:40:20Z","title":"Cross from Left to Right Brain: Adaptive Text Dreamer for Vision-and-Language Navigation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:05.004076Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2505.20897"},"observation_digest":"sha256:1f397a24fcd1a097bc2cb648d4536c158cba75ca44f053823dd9ff701b40ce81","observation_id":"0847f6cc-088e-44bf-9095-b2189aa3c309","resolution":{"observed_at":"2026-08-07T13:52:05.004076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-20T01:13:21.886919Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2110.13309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-07-03T22:18:59.687280Z","title":"History aware mul- timodal transformer for vision-and-language navigation,","venue":null,"work_id":"30b029a4-e2e5-441b-a916-c53a5cc18bcb","year":2021},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:32.213470Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:4bdc2e1158226d1b973f351d690a7f7cfdb3a95ecd89f8c5f47088a9fdd9939d","observation_id":"de01dbeb-fe75-44da-bdc9-fbfed964309c","resolution":{"observed_at":"2026-07-01T10:25:41.234051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","snapshot_observed_at":"2026-08-20T01:13:21.886919Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2110.13309","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.13309","snapshot_observed_at":"2026-07-03T22:18:59.687280Z","title":"History aware mul- timodal transformer for vision-and-language navigation,","venue":null,"work_id":"30b029a4-e2e5-441b-a916-c53a5cc18bcb","year":2021},"citing_paper":{"arxiv_id":"2606.31654","last_updated":"2026-07-02T11:38:15Z","snapshot_observed_at":"2026-07-07T00:05:22.503928Z","submitted_at":"2026-06-30T13:33:48Z","title":"DynFly: Dynamic-Aware Continuous Trajectory Generation for UAV Vision-Language Navigation in Urban Environments","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-03T22:11:44.933463Z"},"links":{"cited_paper":"/paper/2110.13309","citing_paper":"/paper/2606.31654"},"observation_digest":"sha256:efacbdff9bbb1bfdd4aed6510c127d57608e59b2ad7237e6ac14d383408326e8","observation_id":"828bcc94-75df-46bc-b2f0-6852eb9f1eed","resolution":{"observed_at":"2026-07-03T22:18:59.689024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2110.13309/citation-record","integrity":"/paper/2110.13309/integrity","json":"/paper/2110.13309/citation-record.json","paper":"/paper/2110.13309"},"outbound":[],"paper":{"arxiv_id":"2110.13309","last_updated":"2023-08-17T22:42:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T01:13:21.886919Z","submitted_at":"2021-10-25T22:54:41Z","title":"History Aware Multimodal Transformer for Vision-and-Language Navigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2110.13309."}