{"as_of":"2026-08-04T07:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f991a042df5d22d82fdf8cf5ac0b5b7924280fd6dd501cd8e20bc5f13a41c161","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T04:45:08.445621Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:45:48.295758Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18223","snapshot_observed_at":"2026-08-03T16:45:48.295758Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28947","last_updated":"2026-07-31T02:05:45Z","snapshot_observed_at":"2026-08-04T07:19:40.167416Z","submitted_at":"2026-07-31T02:05:45Z","title":"Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T16:45:48.295758Z"},"links":{"cited_paper":"/paper/2604.18223","citing_paper":"/paper/2607.28947"},"observation_digest":"sha256:6731bca3f6488a9cbd8664f42049e479bc3c1dd49625c0a2fd8a73e83c6ca596","observation_id":"0acfc8cb-04be-4d4c-b2db-f951b52c8f79","resolution":{"observed_at":"2026-08-03T16:45:48.295758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.18223/citation-record","integrity":"/paper/2604.18223/integrity","json":"/paper/2604.18223/citation-record.json","paper":"/paper/2604.18223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00521-023-09217-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-language navi- gation: A survey and taxonomy","venue":null,"work_id":"e4e44afe-6f8d-4597-b0a3-8ba0fa145bfa","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:b8d1d569ee059a02bb4d1e7506122b6d1792cebd3546dd0ada4cbaf4d97955fd","observation_id":"fb57e8a5-cf3c-474f-b5c5-99e5ab87df44","resolution":{"observed_at":"2026-05-10T04:45:20.448013Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2729.2023","doi":"10.1109/cvpr52729.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"b9701eca-d05e-4d2e-9045-6761df4ba175","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:092dfec312421b772fd4287c8fd3ab7e76580ffeeaf6a30de73f47cb143e375d","observation_id":"1a65ce60-df72-4105-8501-120b4c21b187","resolution":{"observed_at":"2026-05-10T04:45:20.456774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T01:51:17.845486+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T01:51:17.845486+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-and-Language Navi- gation: Interpreting Visually-Grounded Navigation Instructions in Real Environments","venue":null,"work_id":"74e916d1-5acc-4a85-a3ca-c62d08be1aaa","year":2018},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:70d382a866d0338b58bd1e43419c4b82da2143deaa25b2896fd61aa8165fd88d","observation_id":"5bd0f2c7-a5c8-4c0a-a81a-f11343ccb9a9","resolution":{"observed_at":"2026-05-22T02:30:57.222484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Episodic Transformer for Vision- and-Language Navigation","venue":null,"work_id":"7dc68506-3058-420a-bf25-87d517a7d311","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:6984235d9b0be143a580ece904ba1a078e44336cbd97f379e5bbe48a484980a6","observation_id":"0091ef69-58be-48c1-a42b-3660279af37f","resolution":{"observed_at":"2026-05-22T02:30:57.229672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Everyday Object Meets Vision-and-Language Navigation Agent via Backdoor","venue":null,"work_id":"eb826bb3-15f0-4d32-bdb2-c5935231f1e1","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:bb921de6134b4827a9f3ca56c0b618b36652c813f8abede333b5a68a16e04a8d","observation_id":"0ae0ed5f-916f-4fa7-b4f0-4c24430b14b0","resolution":{"observed_at":"2026-05-22T02:30:57.150261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i17.29858","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VELMA: Verbalization Embodiment of LLM Agents for Vision and 25 Language Navigation in Street View","venue":null,"work_id":"bda009f1-cac1-4f75-9a6d-3d04a1a25c8d","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:78e442cd850348f8cbab864e04c47a2b7ce6b1976f7257ae4e680ab24d58e2fa","observation_id":"d69fafd1-57c0-4a69-9166-52801f820dd3","resolution":{"observed_at":"2026-05-10T04:45:20.449675Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-Monitoring Navigation Agent via Auxiliary Progress Estimation","venue":null,"work_id":"b8bd2b14-a7a9-4411-9479-60e1233ca2c9","year":2019},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:f9519545b060b1758d3325bd791b4b553af42489ce5032edd782b26b18ae0458","observation_id":"325e08b2-cb10-40e4-83a6-3e439bfa9f35","resolution":{"observed_at":"2026-05-22T02:30:57.260051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object-and- action aware model for visual language navigation","venue":null,"work_id":"4d11d679-8bf0-479d-abc2-1e1d6a83b632","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:61ac4f8af173922b357b30ea7845660d82e28a7f9ec2eb1abf6b7d8ff97ea12f","observation_id":"e424b8c8-b1c0-44a5-90b7-08040f1701ad","resolution":{"observed_at":"2026-05-22T02:30:57.197287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speaker- follower models for vision-and-language navigation","venue":null,"work_id":"c8d64ab1-da77-4093-acf6-f1be7f5db270","year":2018},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:cb97079c535cc8f147d6a08d685b9f500093f40f3ce58e1c6df20f222c30e735","observation_id":"0bdc5d2e-000a-48d4-a2b4-2fc4ba0babe6","resolution":{"observed_at":"2026-05-22T02:30:57.226226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sub-instruction aware vision-and-language navigation","venue":null,"work_id":"25cca6e9-969e-4b41-861f-a2f729509ede","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:e7f92bca41a8511d8db8fe4cdc1543692368848777eb3dc636d6dcf14b625bb9","observation_id":"efb1cb08-61ec-4478-bd3d-7add859a574a","resolution":{"observed_at":"2026-05-22T02:30:57.203417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sub-instruction and local map relationship enhanced model for vision and language navigation","venue":null,"work_id":"79f89a20-d6b3-4b8b-bb0b-459c238a4068","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:7b3c424dd7963d30b632874a7af491b7aeff2f0c0548e8e500ce5629cffc1f1b","observation_id":"5a080f06-c4fd-4b12-a209-c04e8c867457","resolution":{"observed_at":"2026-05-22T02:30:57.153481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Structured Scene Memory for Vision-Language Navigation","venue":null,"work_id":"78b10cf4-200c-4f3d-a506-b4752d5025e7","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:0df417441bd199a8424b75bd0a91aaa5d53e2c402c764a4b1ee1edd2d6366085","observation_id":"d0443116-549e-4fa3-b952-ed6a00fff714","resolution":{"observed_at":"2026-05-22T02:30:57.274729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Explicit Object Relation Alignment for Vision and Language Navigation","venue":null,"work_id":"2d3e2192-effa-42cf-89f0-53b35e0c0e40","year":2022},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:38ba7a975f9246c2631ade0d5ff2af0b37755c22ea79e2c901314b657a89f2bb","observation_id":"eeb16ba0-4a57-4ec9-95a3-a78233854ab8","resolution":{"observed_at":"2026-05-22T02:30:57.162062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think Deeply, Act Locally: Memory-Driven Transformers for Vision-and-Language Navigation","venue":null,"work_id":"baa49fd5-0191-4796-8cdf-01c4cc60b5ff","year":2022},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:c8ba9ef2fd5b0d284bc93a6efcba4816db0ec29f0524e9fe67a2317f992e8188","observation_id":"9ba4ad95-a8f8-44bc-ba7f-4975dce2930e","resolution":{"observed_at":"2026-05-22T02:30:57.212303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Causal learning with uncertainty-aware transformer for vision-and- language navigation","venue":null,"work_id":"af8542b3-dbe6-4904-a479-344f09a820d6","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:719c838cbfb83afdd4669b854559ef0b85c430e7ff25b00d9e582e48fb1a0ef0","observation_id":"b5e4c3b3-6812-4c63-88e7-ef47a04421b4","resolution":{"observed_at":"2026-05-22T02:30:57.278261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction- guided path planning with 3D semantic maps for vision-language navi- gation","venue":null,"work_id":"2e959844-a4a7-47c1-bac3-8d6e3f5c075a","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:32c8a4f4ab4a5000f3e6b7f094a08b81ed1bddbe9e5139ba705e5427495d8e60","observation_id":"78ba1b1b-3fd9-4fe4-9643-04e0aa6b0b82","resolution":{"observed_at":"2026-05-22T02:30:57.240893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i7.28597","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T16:51:05.466953Z","title":"NavGPT: Explicit Reasoning in Vision- and-Language Navigation with Large Language Models","venue":null,"work_id":"af920d18-2526-47d5-b6c5-7c2e5ff9fb3d","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:7863f0019da74c3e74986c6664ef93f6d1508aa2f4d40e4ec8ee8df3d62f3ac3","observation_id":"db1a5575-fba2-429c-995a-b654e2d37aa1","resolution":{"observed_at":"2026-05-10T04:45:20.453786Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:16.694755+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:16.694755+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","venue":null,"work_id":"93563bcf-08c6-447a-bf39-a721fe90adb1","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:97afe2cdd6c7aa3e39c74ec77f1138c72cc9fa9152e6a8ec25697cfd4453c74b","observation_id":"eb856356-4fff-48af-ad1a-7c7cbc613469","resolution":{"observed_at":"2026-05-22T02:30:57.281894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-72667-5_15","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NavGPT-2: Un- leashing Navigational Reasoning Capability for Large Vision-Language Models","venue":null,"work_id":"a50f5a23-7b30-4290-b4df-c2249c9605d9","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:9c623e38e7cb0e3cf66c95e0392aff6df19913a796fa195919a63ff1e65c76a8","observation_id":"366109c5-4aa4-4993-9834-235765fe7955","resolution":{"observed_at":"2026-05-10T04:45:20.451297Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07035","last_updated":"2024-12-29T23:16:37Z","snapshot_observed_at":"2026-07-06T18:43:47.559289Z","submitted_at":"2024-07-09T16:53:36Z","title":"Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models","version":2},"cited_work":{"arxiv_id":"2407.07035","doi":"10.48550/arxiv.2407.07035","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.07035","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Vision-and-language navigation today and tomorrow: A survey in the era of foundation models","venue":null,"work_id":"7543774d-9741-4892-b882-61376d9cf153","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/2407.07035","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:d065dfde5be3710ee0724571829e506207a9fa5fadbf6c466437f8ad1abe2a74","observation_id":"4657455a-9160-4c7e-8ecb-72b00396339b","resolution":{"observed_at":"2026-05-10T04:45:20.459362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language and visual entity relationship graph for agent navigation","venue":null,"work_id":"80aa45aa-b205-4854-80dc-dfd12c0cfce4","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:27a98c02b96120f6224b198bba96f40826b7ca489bca896a44231ead55f4fe0f","observation_id":"ebcdaaf4-b3b6-4b8e-8b1b-51dc4fd21698","resolution":{"observed_at":"2026-05-22T02:30:57.159135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evolving graphical plan- ner: Contextual global planning for vision-and-language navigation","venue":null,"work_id":"0478eb09-2a77-4f23-8138-4eb8f0338440","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:9369c4710f9669d562fc8fe834cbb532186b1ab6ac80164b17c6709cb907019a","observation_id":"29aec7c8-8501-4281-88df-d94f48a04af2","resolution":{"observed_at":"2026-05-22T02:30:57.172256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topo- logical planning with transformers for vision-and-language navigation","venue":null,"work_id":"0871e375-530f-40e3-acfb-cced3f5aa9dc","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:2e348840a8acbcd805139b58d20fd6d524b25861570f4c723838a32b8c838a71","observation_id":"31254e22-25dd-459d-9a45-d740c534e10f","resolution":{"observed_at":"2026-05-22T02:30:57.292556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VLN-PETL: Parameter-efficient trans- fer learning for vision-and-language navigation","venue":null,"work_id":"a0596247-11d7-401f-917c-961e19bd93f3","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:6bdd564cf5fdfa33d6bfeb1f17f9ba2243684f7bd4076ec82096f371a874e662","observation_id":"ea3ec2a3-b80c-4965-8c6f-791ae2772d21","resolution":{"observed_at":"2026-05-22T02:30:57.271307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Be- yond the nav-graph: Vision-and-language navigation in continuous en- vironments","venue":null,"work_id":"9344ce35-559c-4a53-982c-79a690cedeb5","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:3ce100ebf61ab9efd1b975128083fa8d6bf8adaf07a87d24cfeae354ad725f99","observation_id":"b9d32b80-ce0c-4b35-993c-d2eff7db6ca8","resolution":{"observed_at":"2026-05-22T02:30:57.200419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards Learning a Generic Agent for Vision-and-Language Navigation via Pre-Training","venue":null,"work_id":"a558881c-7301-4242-a61d-8d9bf0e2092c","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:171545a12bbc479f71be073c2eeb06d93a71cb97a656e37f48720d69c86c3086","observation_id":"08c702c7-fb40-4974-88ba-815047db8251","resolution":{"observed_at":"2026-05-22T02:30:57.251893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Air- bert: In-Domain Pretraining for Vision-and-Language Navigation","venue":null,"work_id":"b1c79bb9-0754-427e-8443-dbe7caffca4a","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:88eb04a309906b4f05b42f343e1a8b5dbb1a0d1ab5b20b1f7c6f9bc4f8a39845","observation_id":"13061a12-964c-4407-98bc-48f7b6f1f7ed","resolution":{"observed_at":"2026-05-22T02:30:57.183176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think Global, Act Local: Dual-Scale Graph Transformer for Vision-and-Language Navigation","venue":null,"work_id":"5e83e027-2181-4c79-b00d-2091232c6d5a","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:02c8582c11ec64d4df46a6c0f6f800310ca3750194fbc5439a1b3cad1be2f78e","observation_id":"0a661146-490a-4f98-be89-0310cd42c98d","resolution":{"observed_at":"2026-05-22T02:30:57.179905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for VLM-Based Vision-and-Language Navigation","venue":null,"work_id":"9bbf2f2d-214b-413a-9dff-c9a286a731a5","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:797557c742fe059d76f2ebb10ecd46ae38060d17ea8953343dcab6263fbe7bb4","observation_id":"03005576-c5c5-4fd6-80c8-78a0a6d39a47","resolution":{"observed_at":"2026-05-22T02:30:57.215623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07306","last_updated":"2025-06-09T21:25:31Z","snapshot_observed_at":"2026-07-06T20:34:34.959285Z","submitted_at":"2025-02-11T07:09:37Z","title":"TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2502.07306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07306","snapshot_observed_at":"2026-07-02T11:26:54.073523Z","title":"TRAVEL: Training-Free Retrieval and Alignment for Vision-and-Language Navigation","venue":null,"work_id":"83b10eea-5116-42a7-9dac-5fbec4493e92","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/2502.07306","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:05a1e03ea6bb171c8e974763eb4acc5859190860790fe9c85cbb9be60a753afc","observation_id":"b913473d-7c50-44eb-a7b5-b2f83ab7dc77","resolution":{"observed_at":"2026-05-10T11:40:20.146283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recursive bidirectional cross-modal reasoning network for vision-and-language navigation","venue":null,"work_id":"147f6534-e0f2-4115-88f7-746b1e529b68","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:547c1c6809820757f9653eb19625c8e77d311d768e5eb32dc826157e2c946442","observation_id":"e35695f2-4e98-45f8-9471-29c709957d44","resolution":{"observed_at":"2026-05-22T02:30:57.209293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06413","last_updated":"2025-06-25T10:03:04Z","snapshot_observed_at":"2026-08-03T12:30:04.229278Z","submitted_at":"2024-12-09T11:40:54Z","title":"World-Consistent Data Generation for Vision-and-Language Navigation","version":2},"cited_work":{"arxiv_id":"2412.06413","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06413","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World-Consistent Data Generation for Vision-and-Language Nav- igation","venue":null,"work_id":"d74b57e0-9569-4fa6-bc7f-04ea3abce89e","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/2412.06413","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:ea4ccfc9cff59418eaa97bb2510729b2271f86c613dd664f9b73bc58215022e3","observation_id":"7008655b-2f1b-4a6e-b034-6c73a66794a2","resolution":{"observed_at":"2026-05-10T11:40:20.149816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments","venue":null,"work_id":"876c5204-c1dc-45e3-946c-bb35c852a2e5","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:92000024d7f64a3c05965e7a575f7091d279e0c3b32a6a18bacce8726787aa68","observation_id":"e98acac7-26ba-4a46-a6d8-306a3b05035d","resolution":{"observed_at":"2026-05-22T02:30:57.237079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural language processing","venue":null,"work_id":"018118ba-9391-44f9-a25a-10c1c8a6490d","year":2020},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:355843e5126cf99544a71408fe954bb1f60fd5c9fca9db6b10801204c5081a15","observation_id":"10d22e83-a3c5-43c3-8e1a-b8adf118168d","resolution":{"observed_at":"2026-05-22T02:30:57.190007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SOAT: A Scene- and Object-Aware Transformer for Vision-and-Language Navigation","venue":null,"work_id":"60f2ac4d-a609-42e1-b69a-d3f714012270","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:fc5149e8fd2a15d10d35b966ce4b09269461672b086e9e351d8655023d3dd719","observation_id":"ce53deb1-2547-487c-80ee-f09edef49e91","resolution":{"observed_at":"2026-05-22T02:30:57.255677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VLnBERT: A recurrent vision-and-language BERT for navigation","venue":null,"work_id":"050bbec6-f004-4fbd-b566-3d4f210ae438","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:94e96d7b53d65737fe2dc4bc1f36e9e4eeb49792d4dd028bf23b7473d60a3fed","observation_id":"e98e8e62-c4a9-45f0-ab99-186712b4d854","resolution":{"observed_at":"2026-05-22T02:30:57.156153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"History aware multi- modal transformer for vision-and-language navigation","venue":null,"work_id":"3971d551-a1ee-4ad8-a56b-95be8e291c2f","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:5c040cc9984cf6928543c1c680da7dd347d3a323977cc0ab284dc9517bf662ad","observation_id":"17177f21-9550-43c6-abb3-e807c293290a","resolution":{"observed_at":"2026-05-22T02:30:57.232993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SOON: Sce- nario oriented object navigation with graph-based exploration","venue":null,"work_id":"1ff08792-d96d-41e6-bf0f-c471a34e4b7c","year":2021},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:4f7357760fed32194b8d65b6eccb5546afd011a3e8263f49d36cc782bba6a1f8","observation_id":"945f3f71-996b-4f47-86ec-8f0005d91de7","resolution":{"observed_at":"2026-05-22T02:30:57.244388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"E2BA: Environment Exploration and Backtracking Agent for Visual Language Object Navigation","venue":null,"work_id":"74a51c74-9213-47af-a25b-a4bbf913b197","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:ced53063754907a9c2f9f6482a3a6bf9c3eec8502915d29098a3e0bec8d0172a","observation_id":"90d5d101-bd7e-4178-b71a-a87c8c255462","resolution":{"observed_at":"2026-05-22T02:30:57.193506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual Language Maps for Robot Navigation","venue":null,"work_id":"adc469cd-881f-4389-89ab-6cf765313a42","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:7e2fa7fd780081dbd800d0764a78bea60adb362944c86c73d34bb40fa963fbaa","observation_id":"16f934b8-7c86-4aeb-b5dc-a5301221ab91","resolution":{"observed_at":"2026-05-22T02:30:57.268032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction- guided Path Planning with 3D Semantic Maps for Vision-Language Nav- igation","venue":null,"work_id":"33abda6d-689b-4f4f-a422-4d86d2f42e64","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:c6049d0c370da70bb49e2553757905b55b2fee8dfead0c3bf76c03849d3ee0ec","observation_id":"377482ad-bf9e-43bf-a0e7-d757a3227bbd","resolution":{"observed_at":"2026-05-22T02:30:57.168471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot Visual Grounding via Coarse-to-Fine Representation Learning","venue":null,"work_id":"097a03bd-e2ea-40f3-8435-8392b68e30d4","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:0b94c81d4c4921c4ccae5dba1bf2494d4cae0df6a146185a296b6dd27117f7ac","observation_id":"669c1e40-d16a-4b31-a803-96eb03956971","resolution":{"observed_at":"2026-05-22T02:30:57.264093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision- and-Language Navigation via Causal Learning","venue":null,"work_id":"4aff4627-65e5-4a1d-a7ee-05db3c48856e","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:f900f6d21c887abb18146104fdc26437cbb365214033e29250bcf38677b09e3b","observation_id":"1f77c52a-3435-43a3-b006-45a4880c4ea9","resolution":{"observed_at":"2026-05-22T02:30:57.288997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CR-former: Single-image cloud removal with focused Taylor attention","venue":null,"work_id":"812997af-142a-4711-8b17-2bd0ece64aa9","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:4979e67be28379ba4cca2ddc9fe5de0520296913c9798ad2d05783d4d0c2f6b0","observation_id":"dc053597-dc32-43ed-9d59-df981c75018c","resolution":{"observed_at":"2026-05-22T02:30:57.165132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Event-Equalized Dense Video Captioning","venue":null,"work_id":"50908a91-5929-429c-9164-f13bb1ff09f7","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:5c4124c2d6c652deb7280bbffc52e7a670dcd5fa0bb2b6508ae8290ce0ce2f4d","observation_id":"e749a07f-4f10-4b28-89c4-744fc6e16f38","resolution":{"observed_at":"2026-05-22T02:30:57.206674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic-aware representation learning for homography estimation","venue":null,"work_id":"5ed51407-e135-41e3-b914-d57af8a38374","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:26ea8d65fc16ffb1a584f372173ffe00b53f495803b4abaf7c9d717962aa4862","observation_id":"bb9d7019-f73f-4aeb-8b6a-28764b80ff45","resolution":{"observed_at":"2026-05-22T02:30:57.247824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the gap: Aligning vision foundation models to image feature matching","venue":null,"work_id":"522181ec-5d98-48ae-9323-b997a2834808","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:3dfaed21b0b5a06edb4f6c837ea4c5bafa630551c42f693310242b80cde9ada7","observation_id":"d6c2e97c-55c8-4397-8679-03a98547e89a","resolution":{"observed_at":"2026-05-22T02:30:57.186940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:49:36.645259Z","title":"PatchCue: Enhancing Vision-Language Model Reasoning with Patch- Based Visual Cues","venue":null,"work_id":"0229e0f2-9f54-46b9-b2a2-0ca71532a174","year":2026},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:7ecb00715464755a57f5a39999547fc1bead7dad35bade61b54e1ac54a7b104a","observation_id":"d1813051-8c48-4b9b-8cc9-539f43e0ec20","resolution":{"observed_at":"2026-05-10T11:40:20.142810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Closing the gap between the upper bound and lower bound of Adam’s iteration com- plexity","venue":null,"work_id":"02654b33-5ed5-428f-b51c-4b3511d68afa","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:6be4b3dd57d900c149ba57af13666ac612d4c68e0e7280c6fd43a7435b0f5ca2","observation_id":"c6a23dd8-390b-423c-9c20-0b9f09765bfa","resolution":{"observed_at":"2026-05-22T02:30:57.176118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.03258","last_updated":"2019-09-17T13:17:24Z","snapshot_observed_at":"2026-07-06T08:19:51.929437Z","submitted_at":"2019-09-07T12:19:10Z","title":"Recognition Of Surface Defects On Steel Sheet Using Transfer Learning","version":2},"cited_work":{"arxiv_id":"1909.03258","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.03258","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recognition of surface defects on steel sheet using transfer learning","venue":null,"work_id":"b2d4d884-c435-40ee-8991-f83c118d6682","year":1909},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/1909.03258","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:7da3cfc22b54c331d271adf81f86a34a9d78f4387a29da32b19c969ccb429140","observation_id":"daf50753-3207-4fe0-9d4e-2a07d69bbcc6","resolution":{"observed_at":"2026-05-10T11:40:20.131239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09000","last_updated":"2023-06-15T09:54:21Z","snapshot_observed_at":"2026-07-06T15:42:52.549767Z","submitted_at":"2023-06-15T09:54:21Z","title":"When and Why Momentum Accelerates SGD:An Empirical Study","version":1},"cited_work":{"arxiv_id":"2306.09000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.09000","snapshot_observed_at":"2026-07-03T23:59:07.498348Z","title":"When and why momentum accelerates sgd: An empirical study","venue":null,"work_id":"2dd0fa29-9a2b-4029-92f0-57de64c1a612","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/2306.09000","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:5f37143363f5b232e9e44beffdc7e8cda442571647c1d73bab0ecba6c2a8aa4b","observation_id":"7e0f4f55-9409-408c-9564-0360d1d08334","resolution":{"observed_at":"2026-05-10T11:40:20.127744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding mobile GUI: From pixel-words to screen-sentences","venue":null,"work_id":"5d29a88b-e4f5-479d-aaa9-aaa010eba92a","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:ccab92599135446d761801b22a30d973ddb9bbc6ae8d6967fe269de7b00bbd79","observation_id":"4d6a158b-1b4a-42fe-8d44-4997be416613","resolution":{"observed_at":"2026-05-22T02:30:57.285398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06054","last_updated":"2024-06-06T15:09:52Z","snapshot_observed_at":"2026-07-06T16:17:19.255200Z","submitted_at":"2023-09-12T08:45:25Z","title":"Breaking through the learning plateaus of in-context learning in Transformer","version":3},"cited_work":{"arxiv_id":"2309.06054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.06054","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Breaking through the learning plateaus of in-context learning in transformer","venue":null,"work_id":"0afaec7e-f5ba-4fd0-9801-690dfb0947bf","year":2023},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/2309.06054","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:6c8bd98bfe61383a936b5fd8b3639062891ebb47bab4596637bd15245dd34ab0","observation_id":"bade8ebb-be86-47b7-830a-1cb20417daeb","resolution":{"observed_at":"2026-05-10T11:40:20.136072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regnav: Room expert guided image- goal navigation","venue":null,"work_id":"bf42dfde-0837-4805-a7cb-8e8f87f0bfc3","year":2025},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:99664a7dc921fafcc111f0002736b23acb388bec05faa9ac757c6dff106486d6","observation_id":"4df66268-8579-4539-9e3f-54cd4cf27843","resolution":{"observed_at":"2026-05-22T02:30:57.218800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16450","last_updated":"2025-04-13T09:56:55Z","snapshot_observed_at":"2026-07-06T17:49:56.713455Z","submitted_at":"2024-03-25T06:22:27Z","title":"Camera-aware Label Refinement for Unsupervised Person Re-identification","version":3},"cited_work":{"arxiv_id":"2403.16450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16450","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Camera-aware la- bel refinement for unsupervised person re-identification","venue":null,"work_id":"83040760-7a49-400b-8fd7-40d7133f3bbf","year":2024},"citing_paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T04:45:08.445621Z"},"links":{"cited_paper":"/paper/2403.16450","citing_paper":"/paper/2604.18223"},"observation_digest":"sha256:f508b045fc2001ab1ff7bdf8c532998c3363c67530445ac8c2acb5409a3520d0","observation_id":"6d5f4751-a593-4a65-88f5-4261f0d5fa9f","resolution":{"observed_at":"2026-05-10T11:40:20.139557Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18223","last_updated":"2026-04-20T13:09:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:09:13Z","title":"Instruction-as-State: Environment-Guided and State-Conditioned Semantic Understanding for Embodied Navigation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":42},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2604.18223."}