{"as_of":"2026-08-13T13:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2df845e213aecb3d93cf13df2024b3ef7796cfd028729ae2256620f8a9c7acba","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:55:51.498041Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:48:08.135538Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:10:29.845664Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"cited_work":{"arxiv_id":"2411.14811","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14811","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Song et al","venue":null,"work_id":"d1abf7e2-7bda-41bd-90f4-198a5576dec8","year":2024},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2411.14811","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:a8eaf210985bbb912dbddd461b07696037c10db38f8ee74b2e0ebdd8944566a4","observation_id":"6ad07af4-8c96-48c2-bb3b-45d3a73e0d88","resolution":{"observed_at":"2026-05-10T14:10:29.847625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14811/citation-record","integrity":"/paper/2411.14811/integrity","json":"/paper/2411.14811/citation-record.json","paper":"/paper/2411.14811"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.842896Z","title":"Attention is all you need,","venue":null,"work_id":"ac34def1-7643-498a-923c-4d45c76612f4","year":2017},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.374733Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:dbb4383a2e574e4a96738f8513c0ebf4d418b2d67082023c0ad3b919d92a7402","observation_id":"adac38d7-5791-49ed-bcfe-8f8b6ed9743b","resolution":{"observed_at":"2026-08-12T14:55:51.845416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.835847Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":"8091226c-64fe-4971-88bc-01aa6356e525","year":2018},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.378431Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:17bdd26ba641c4a7a2b77b41c015292c0bec31d595b6db3721dd57942b48a5fd","observation_id":"c14d0bd1-d04f-42a7-9139-9032596568f8","resolution":{"observed_at":"2026-08-12T14:55:51.838703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.828504Z","title":"A survey on the application trends of home service robotics,","venue":null,"work_id":"e408a949-5fbb-4877-9e66-1f19184261b0","year":2018},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.381100Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:9be8323a8057ea93ad46aba2448626d7c36b5f3eb2a186769fc7b55efe9533f4","observation_id":"65d544b8-e537-4188-94b0-1561c013159b","resolution":{"observed_at":"2026-08-12T14:55:51.831228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.821014Z","title":"Sim-to-real transfer for vision-and-language navigation,","venue":null,"work_id":"71ed98d8-7781-4747-9ed0-4ba89d8787ec","year":null},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.384730Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:19c978e282249854478d34479395c54d8c7479f367cd2c205e375987784b2ee2","observation_id":"75af325d-da7c-473a-9302-7fa1e241168a","resolution":{"observed_at":"2026-08-12T14:55:51.824503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.813884Z","title":"Vision-and-language navigation in the real-world,","venue":null,"work_id":"190e082d-6f59-48fc-a978-fa6189510c06","year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.387724Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:91d06596b4da5bda43373ff9a71e0c4d816a20a98b3ec88702713662b0c65659","observation_id":"26c1dc4a-b4e4-45ae-b1a6-ab74d5c053ae","resolution":{"observed_at":"2026-08-12T14:55:51.816429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.806615Z","title":"Improving vision-and-language navigation with image-text pairs from the web,","venue":null,"work_id":"507107ba-707e-4293-a232-8e7b9f5a729f","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.390209Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:c2cff1f482769efddc196826deeae07e9f58dbcd8fd20709ba3e465850f7fe9c","observation_id":"0d5dc933-3108-4dbc-bcd6-a9c266a633ca","resolution":{"observed_at":"2026-08-12T14:55:51.809218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.799681Z","title":"Airbert: In-domain pretraining for vision-and-language navigation,","venue":null,"work_id":"2cc78d99-ca00-4dd7-b4cf-5cc1e213a6ed","year":2021},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.392738Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:cc7904617db2b91383f61cfbb44abcde6256d6a0f49177f03b7cb8b0ee2ae5fc","observation_id":"0b414498-4f94-443a-8b06-972ffef0ee1b","resolution":{"observed_at":"2026-08-12T14:55:51.802388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.793409Z","title":"Learning vision-and-language navigation from youtube videos,","venue":null,"work_id":"42bb8c23-0d46-4c23-a1ed-d7da271400db","year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.395904Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:a39bc3fa5db3773b1f8742769657f1aea1d1cde57094352e54116a18dba17d76","observation_id":"4674d996-2013-4061-a1ff-a172bff2d435","resolution":{"observed_at":"2026-08-12T14:55:51.795687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-07T09:28:19.837584Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-12T14:55:51.398844Z","title":"Contrastive learning with hard negative samples,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.398844Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:22333627e2e5f84d19d75558280cb3aadf1a4a35a38779871304f8edac732ad1","observation_id":"e1a148a0-4962-4665-83a6-281f95b07c41","resolution":{"observed_at":"2026-08-12T14:55:51.398844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.787045Z","title":"Ultimate negative sampling for contrastive learning,","venue":null,"work_id":"51dd4e6b-fb25-4f2b-b6f8-5a38ed254753","year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.401504Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:58d189560872320588f263cd3315d2613c0b5607bc07a1d4b2eddb9c41e184af","observation_id":"79dd38aa-d713-4724-88a0-7b11c5acb0aa","resolution":{"observed_at":"2026-08-12T14:55:51.789518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01262","last_updated":"2023-09-03T20:00:37Z","snapshot_observed_at":"2026-08-13T12:33:59.447489Z","submitted_at":"2023-09-03T20:00:37Z","title":"Multimodal Contrastive Learning with Hard Negative Sampling for Human Activity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01262","snapshot_observed_at":"2026-08-12T14:55:51.404301Z","title":"Multimodal contrastive learn- ing with hard negative sampling for human activity recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.404301Z"},"links":{"cited_paper":"/paper/2309.01262","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:3654990f3f0ec41a48889083fee41ce5935f5ab7bdab06cc4d02f9792c0ab135","observation_id":"38ecbc29-84b1-4fbe-9b5b-f294506eef91","resolution":{"observed_at":"2026-08-12T14:55:51.404301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.778658Z","title":"Contrastive learning for weakly supervised phrase grounding,","venue":null,"work_id":"93523796-be18-45d4-b303-07c37cc005d6","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.407198Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:01d9362e613ab0ab5946ea178c8273205be8241cf8cb4e954014eb7fa283c688","observation_id":"b8cb1bd1-f522-4d8a-b84a-f86613224131","resolution":{"observed_at":"2026-08-12T14:55:51.781698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.04195","last_updated":"2019-04-08T17:14:52Z","snapshot_observed_at":"2026-08-08T12:04:37.389540Z","submitted_at":"2019-04-08T17:14:52Z","title":"Learning to Navigate Unseen Environments: Back Translation with Environmental Dropout","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.04195","snapshot_observed_at":"2026-08-12T14:55:51.409569Z","title":"Learning to navigate un- seen environments: Back translation with environmental dropout,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.409569Z"},"links":{"cited_paper":"/paper/1904.04195","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:d4202f8728d8d4722fc5cdf43786841598df9cc735c025a7659669d70ed3062b","observation_id":"56e334f3-15a2-451f-ac84-5746a5f0a7d5","resolution":{"observed_at":"2026-08-12T14:55:51.409569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05468","last_updated":"2021-11-10T00:37:35Z","snapshot_observed_at":"2026-07-06T12:07:05.919117Z","submitted_at":"2021-11-10T00:37:35Z","title":"Sparse Adversarial Video Attacks with Spatial Transformations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05468","snapshot_observed_at":"2026-08-12T14:55:51.412526Z","title":"Sparse adversarial video attacks with spatial transformations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.412526Z"},"links":{"cited_paper":"/paper/2111.05468","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:e59157bc476dafabbcb18f070d1a323d43bad0716bc035f0c0dd8f7872285bd1","observation_id":"5deee416-ed53-435f-987e-934ce6167343","resolution":{"observed_at":"2026-08-12T14:55:51.412526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.770768Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments,","venue":null,"work_id":"9c42c34c-3e83-4a5c-982f-88f3081c0a3d","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.415195Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:54207848b81412d6c8e8955197fcdecab620b3245a2607fce471f32680bbb044","observation_id":"e7b689e2-a99a-4787-a0cf-ee87dfcca76a","resolution":{"observed_at":"2026-08-12T14:55:51.773421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.06757","last_updated":"2018-07-18T03:28:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-18T03:28:02Z","title":"On Evaluation of Embodied Navigation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.06757","snapshot_observed_at":"2026-08-12T14:55:51.417218Z","title":"On evaluation of embodied navigation agents,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.417218Z"},"links":{"cited_paper":"/paper/1807.06757","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:e086cf9ac323371c62c1f132b998c16f74f03561965aef53f1bafdf19545a95a","observation_id":"2186abee-4c44-478d-b844-4b06d0da3b15","resolution":{"observed_at":"2026-08-12T14:55:51.417218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.764056Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments,","venue":null,"work_id":"d02037d8-53ab-479c-816a-60f3582e53cc","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.419795Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:2a33f6d7662270c7f79936890b18621b3a1968ae853f960007eb01be2c60310b","observation_id":"d883ea36-346c-4f6c-8246-03a43a0ee360","resolution":{"observed_at":"2026-08-12T14:55:51.766730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.755916Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environ- ments,","venue":null,"work_id":"93573439-a81c-4d09-94f7-b54d56c9e282","year":null},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.422843Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:2de61048e76d0f5d81ed0eee4e7a8bf8314a8281cc25ed7c89efad1fe5928655","observation_id":"13abe136-65da-4b90-85a6-9518833983ee","resolution":{"observed_at":"2026-08-12T14:55:51.759125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.749676Z","title":"Help, anna! visual navigation with natural multimodal assistance via retrospective curiosity-encouraging imitation learning,","venue":null,"work_id":"ca524d1c-8d38-45a6-8b62-679132949710","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.426400Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:ab955450eefa233b000b055bd8e1ab81fb9a1bcc56350be3010ee8d4ece583d3","observation_id":"ff251be3-e8c8-447c-b598-013ac954f3cc","resolution":{"observed_at":"2026-08-12T14:55:51.752161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.743109Z","title":"Vision-based nav- igation with language-based assistance via imitation learning with indirect intervention,","venue":null,"work_id":"a957cc6d-6b13-4fd0-8f68-44b62ab79780","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.428639Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:f0f9a7e02596452052bca5fd682642dec963476021381a2b85efc9856d4271be","observation_id":"fb6109e8-eba3-4da9-aa91-d90d14aa28f3","resolution":{"observed_at":"2026-08-12T14:55:51.745675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.736381Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks,","venue":null,"work_id":"98d1177d-7df1-4445-b329-63b58989251e","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.431058Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:fff853eccc18834ce8f5950ba7184a137711d7d01be5199eb5a1c447c13bc598","observation_id":"cd54ab03-f3f3-4be5-8ac5-0411da469057","resolution":{"observed_at":"2026-08-12T14:55:51.738986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.728344Z","title":"Vision- and-dialog navigation,","venue":null,"work_id":"fa909260-35e1-487f-888e-19316afb8b23","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.434561Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:da34cbfd3ed478284b6c4ce8d6687006f7de082c8e66dcd8ab318eafdea01183","observation_id":"c2fc7761-b1d0-411c-bc61-b0fb11408a5c","resolution":{"observed_at":"2026-08-12T14:55:51.730902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.721468Z","title":"Embodied concept learner: Self-supervised learning of concepts and mapping through instruction following,","venue":null,"work_id":"387bb06f-b432-432d-87e4-d12936120182","year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.437405Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:bcaae397d2737b1e38351b2b2e92469d53f54b7a664039e5b9247365d8bf1fe8","observation_id":"6e149aeb-968c-47e4-a5ec-2caf311b803c","resolution":{"observed_at":"2026-08-12T14:55:51.724333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.714959Z","title":"One step at a time: Long-horizon vision-and- language navigation with milestones,","venue":null,"work_id":"1bbcf0a8-5d45-4c0a-b1fc-ee4a7d4247f9","year":2022},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.439899Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:1e0e6d728c06ae0bacfe8d1ebaaf64a88e996a2c6f4714d33f4125c3ccb195ff","observation_id":"8b9faa46-1933-4e1c-8588-c14e71aa2758","resolution":{"observed_at":"2026-08-12T14:55:51.717637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.707463Z","title":"Chasing ghosts: Instruction following as bayesian state tracking,","venue":null,"work_id":"acbdd7c4-a443-4bcf-b998-1a5d29969417","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.442681Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:5f02e18fff44730d723a6b2f971d53fd29602fa6e482517b056e245d633dcee2","observation_id":"3c8602b1-58c8-4e64-abde-3529316b02b2","resolution":{"observed_at":"2026-08-12T14:55:51.710498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.700698Z","title":"Speaker-follower models for vision-and-language nav- igation,","venue":null,"work_id":"8e81c505-88e0-4398-8632-2aa6a6dcaffe","year":null},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.445430Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:fbba2e966e6f396d38879bce5f347c8f7dce08e0fcb3d4c288802b5de01c9099","observation_id":"fe9d44bc-f1d2-4dc1-a79c-60401638564c","resolution":{"observed_at":"2026-08-12T14:55:51.703370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.694215Z","title":"Tactical rewind: Self-correction via backtracking in vision-and-language navigation,","venue":null,"work_id":"d0152f77-624e-48b1-8273-1e0d105cd45e","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.448061Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:a80236dfa5bdbf29aa413d643f7fc552d618a765df472f46452c56c5fe5309e1","observation_id":"c719d61f-e81f-4e3a-a219-3412d4c67601","resolution":{"observed_at":"2026-08-12T14:55:51.696838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.03035","last_updated":"2019-01-10T06:46:50Z","snapshot_observed_at":"2026-08-12T17:58:09.925220Z","submitted_at":"2019-01-10T06:46:50Z","title":"Self-Monitoring Navigation Agent via Auxiliary Progress Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.03035","snapshot_observed_at":"2026-08-12T14:55:51.451084Z","title":"Self-monitoring navigation agent via auxiliary progress estimation,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.451084Z"},"links":{"cited_paper":"/paper/1901.03035","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:7ec96ca30bfc112e983e1e0f3cf7a434d9018123640b9cb48cb248b198895796","observation_id":"dd0b6f61-2c4d-4da3-ab9c-01d69174df8c","resolution":{"observed_at":"2026-08-12T14:55:51.451084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.687623Z","title":"The regretful agent: Heuristic-aided navigation through progress estimation,","venue":null,"work_id":"8c1b5864-f700-4745-bfff-31736dbb1a72","year":null},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.454511Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:2f5f34cb1910f5c4f7386e723cf71495f43114a33226abf8c848163b8c4e2530","observation_id":"7b9327d1-3fb9-4ca0-a416-1e368c2cd58c","resolution":{"observed_at":"2026-08-12T14:55:51.690384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.679458Z","title":"Reinforced cross-modal matching and self-supervised imitation learning for vision-language navigation,","venue":null,"work_id":"a970d4c5-a5d1-4b20-a7c3-062dac9a68fe","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.456994Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:8f30969868e890d48fc6c15b9a1cf79e28505f8429037caafa3e298e5e133e7d","observation_id":"2fd8f98c-88f8-4e28-b277-7dea862a51be","resolution":{"observed_at":"2026-08-12T14:55:51.682141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.671855Z","title":"Look before you leap: Bridging model-free and model-based reinforcement learning for planned-ahead vision-and-language navigation,","venue":null,"work_id":"c9d516e5-f68b-45fb-be3b-d9848b5cbe05","year":2018},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.459487Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:1dcfcccc87b1037dfd3547f42cacd94b4be0b43e1bd8155d3497509784376d3c","observation_id":"b3555acf-e7b7-45a3-90e0-99609646c7cd","resolution":{"observed_at":"2026-08-12T14:55:51.674823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04006","last_updated":"2022-03-08T11:01:24Z","snapshot_observed_at":"2026-08-01T23:47:14.524442Z","submitted_at":"2022-03-08T11:01:24Z","title":"Visual-Language Navigation Pretraining via Prompt-based Environmental Self-exploration","version":1},"cited_work":{"arxiv_id":"2203.04006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.04006","snapshot_observed_at":"2026-08-12T14:55:51.544025Z","title":"Visual-Language Navigation Pretraining via Prompt-based Environmental Self-exploration","venue":"cs.CV","work_id":"a131df96-0f8c-4f21-8bff-030d1c67c2a2","year":2022},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.461963Z"},"links":{"cited_paper":"/paper/2203.04006","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:901734ea13b44681fa7198170a8407f51de38c3bbf7f8ea8a1524f6a1794d6ce","observation_id":"78b54cb8-84e6-4876-b810-8369dbf2407d","resolution":{"observed_at":"2026-08-12T14:55:51.549021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.665155Z","title":"Vilbert: Pretraining task- agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":"87f7a05b-d4a0-4517-a329-69d03bc6298b","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.464470Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:2acccdef3a7713f190b1cf06f2d34b3a92c5f55a9221fc50f9952a081e6a9446","observation_id":"0b83547b-f8fb-4d62-ba7f-79df1cb30869","resolution":{"observed_at":"2026-08-12T14:55:51.667972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.657710Z","title":"Object-and- action aware model for visual language navigation,","venue":null,"work_id":"fdb90e57-3358-4f81-8559-f3b6f349479a","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.466754Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:e1f06d72db63bcbb7471a5bbc5de1b6bd2645cf70025a2cccb936467e9d8d96f","observation_id":"6cb11d5d-143e-4503-93d2-10570ec2941c","resolution":{"observed_at":"2026-08-12T14:55:51.660310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.651072Z","title":"Vision-language navigation with self-supervised auxiliary reasoning tasks,","venue":null,"work_id":"c8dd134c-2482-4fcf-88b9-4a31d0671399","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.469083Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:894f2415616e3f6ee6826ca695158df90fdc342fccde6ed9459e32dfce2e6d76","observation_id":"fd5d3ac9-ea73-4ad4-b176-ff6e7c291ed5","resolution":{"observed_at":"2026-08-12T14:55:51.653604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.643852Z","title":"Hop: History- and-order aware pre-training for vision-and-language navigation,","venue":null,"work_id":"33bb6862-119c-4d4b-851a-8bb36fee6d08","year":null},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.471572Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:f3700c153969863f8984bdd37f815a973c4bb5a7d756a10dcb1692234c3794fc","observation_id":"c3b6eba4-22c8-428f-abec-f157caa88ede","resolution":{"observed_at":"2026-08-12T14:55:51.646613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.636038Z","title":"History aware multimodal transformer for vision-and-language navigation,","venue":null,"work_id":"3dc93989-b12f-4373-a7d9-9f3f901f2322","year":2021},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.474765Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:cb06147a692e0bb68fdc5e4a4254d42c6d071011e949d739ab4e4f57511694d5","observation_id":"97316fe8-0ddf-482a-8c50-f4d9ae5f5795","resolution":{"observed_at":"2026-08-12T14:55:51.639426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.628154Z","title":"Soat: A scene-and object-aware transformer for vision-and-language navi- gation,","venue":null,"work_id":"772a6b2f-05e1-4cdb-9ff4-8d3ad457af5a","year":null},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.477976Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:9de7321e7d21f4d66b76d795b875a4d088c27c14ffecefb61c42f28669b4bedc","observation_id":"8855fa8b-2249-45c6-aad8-59d9bde425b5","resolution":{"observed_at":"2026-08-12T14:55:51.631089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.619572Z","title":"Structure-encoding auxiliary tasks for improved visual representation in vision-and- language navigation,","venue":null,"work_id":"faa67ca6-0c4e-4668-ab7c-f29ef8e19d09","year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.480493Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:5446e934faef89592b779468cf8fea5f95edd98b37b0079d023a76724fc0ebfb","observation_id":"abc9d53f-56f7-45fb-b4cf-569aa448e44f","resolution":{"observed_at":"2026-08-12T14:55:51.622685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T14:55:51.483524Z","title":"Bert: Pre- training of deep bidirectional transformers for language understand- ing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.483524Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:9883468888b816b6392dd7bb57d32e8de575766cd7f6e5e2cac77eabce3540fc","observation_id":"d61e2e49-cd33-416c-ab9f-bcae384330b1","resolution":{"observed_at":"2026-08-12T14:55:51.483524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.612355Z","title":"Vln-bert: A recurrent vision-and-language bert for navigation,","venue":null,"work_id":"647acb49-494c-4e6a-ac91-769c40fae28a","year":2021},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.486142Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:c5dac911f5fa3a32f1e7a1217359a4a6a30f67f55729b0f2afcf057614d3a221","observation_id":"5cb8d57a-02e1-4afb-804d-9fb5bdbda192","resolution":{"observed_at":"2026-08-12T14:55:51.615087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11127","last_updated":"2026-05-31T18:23:52Z","snapshot_observed_at":"2026-08-13T11:57:57.181602Z","submitted_at":"2023-04-21T17:02:38Z","title":"Tree-Structured Parzen Estimator: Understanding Its Algorithm Components and Their Roles for Better Empirical Performance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11127","snapshot_observed_at":"2026-08-12T14:55:51.488361Z","title":"Tree-structured parzen estimator: Understanding its al- gorithm components and their roles for better empirical performance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.488361Z"},"links":{"cited_paper":"/paper/2304.11127","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:162e763d1d385fcfd9adb544d77916eafb861bdbdd2c3abe01e2800d0dbe1257","observation_id":"02617a88-8936-4eab-a75a-f8c4700bcf55","resolution":{"observed_at":"2026-08-12T14:55:51.488361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-02T16:47:23.623541Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-12T14:55:51.490710Z","title":"Matterport3d: Learning from rgb-d data in indoor environments,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.490710Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:216c8fb2948bb6bac45c96de0fd6fd8e1858a4eb807b158f700f65ab9c72cab9","observation_id":"8bc38e5b-2331-48ec-a66f-eda9dc0903b9","resolution":{"observed_at":"2026-08-12T14:55:51.490710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.604578Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":"84a9ea3b-28b4-4880-b0d2-8225876f1260","year":2016},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.493263Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:86810a97cb69e76ede8807f53340e440a0b02ac31635402e800af020f7fa9750","observation_id":"5e4a2e0f-48eb-4304-bfe3-948e576ff408","resolution":{"observed_at":"2026-08-12T14:55:51.607638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.597066Z","title":"Robust navigation with language pretraining and stochastic sampling,","venue":null,"work_id":"db7a38ef-c859-4359-bfed-a17a73cb8182","year":2019},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.495601Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:b126dbfc99e0f95fffad05be0e09a1e8f02cdbb9bb353a7db447b70c1cc68c00","observation_id":"3917aab9-5f66-4f03-971e-4833c351b935","resolution":{"observed_at":"2026-08-12T14:55:51.599814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:55:51.588816Z","title":"Towards learning a generic agent for vision-and-language navigation via pre-training,","venue":null,"work_id":"a98e8bc7-afec-4b85-ab5e-5425db557203","year":2020},"citing_paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:55:51.498041Z"},"links":{"citing_paper":"/paper/2411.14811"},"observation_digest":"sha256:312d3c644970271e3ed4e3b72a227c8a7173547a621f82257b90d34b5910e1d8","observation_id":"7eb668d2-16f6-47fa-8d39-fdf697c59959","resolution":{"observed_at":"2026-08-12T14:55:51.592025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14811","last_updated":"2024-11-30T08:47:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:49:28.699702Z","submitted_at":"2024-11-22T09:12:02Z","title":"Fine-Grained Alignment in Vision-and-Language Navigation through Bayesian Optimization"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2411.14811."}