{"as_of":"2026-08-07T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c75397ccf9bc93b6baaf64695009c5444198feafada4b443b475a5f8fad17ba6","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:26:43.437116Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10894/citation-record","integrity":"/paper/2507.10894/integrity","json":"/paper/2507.10894/citation-record.json","paper":"/paper/2507.10894"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.490571Z","title":"A survey of embodied ai: From simulators to research tasks,","venue":null,"work_id":"3d2ceada-6318-447b-907a-8dc9eccc44b5","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.385842Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:cced827acda33a78048cad76605aee272612fa15188584c1deca4a44b3f57324","observation_id":"067f3fef-cfd5-4b9b-914a-1a43d89c144b","resolution":{"observed_at":"2026-08-06T17:26:44.494005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.481709Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation,","venue":null,"work_id":"39189dd4-67ac-4044-998f-62ffbfbb6063","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.447109Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:6e959d5049494984fefb6ac41cf0e948554f534ae775a7b5a73528171ed4c4cf","observation_id":"a740e2b8-e30e-4bd1-8417-2c33ac260644","resolution":{"observed_at":"2026-08-06T17:26:44.485004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06886","last_updated":"2025-08-25T02:20:09Z","snapshot_observed_at":"2026-08-06T16:04:56.349386Z","submitted_at":"2024-07-09T14:14:47Z","title":"Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06886","snapshot_observed_at":"2026-08-06T17:26:37.507750Z","title":"Aligning cyber space with physical world: A comprehen- sive survey on embodied ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.507750Z"},"links":{"cited_paper":"/paper/2407.06886","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:293a216ee1b3667428cac977cc6ca20a429e3eb18c4f0c7672f9a1bb56baa815","observation_id":"c84f1d60-1240-4862-8b95-285523181373","resolution":{"observed_at":"2026-08-06T17:26:37.507750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.472809Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":"b410f80d-5fc2-4f95-a9f5-5299423c90e4","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.597645Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:32f204191883ae15e6d62d684448474758b0bb3fbd0954acfcd98350314d947b","observation_id":"d95ca566-acea-41bd-a67c-56d81f7d35c0","resolution":{"observed_at":"2026-08-06T17:26:44.476143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.462616Z","title":"Room-across-room: Multilingual vision-and-language navigation with dense spatiotemporal grounding,","venue":null,"work_id":"25fd02c0-b8c6-48c6-bab7-8abacccc94e4","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.642304Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:2be780e5b9577b45d2e236b808500ee33b4b7c9de1e2208275d4e76512ef6298","observation_id":"08615390-332c-426b-a2cc-25b031ee047f","resolution":{"observed_at":"2026-08-06T17:26:44.466733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.453002Z","title":"Talk2nav: Long-range vision-and-language navigation with dual attention and spatial memory,","venue":null,"work_id":"7a39c35d-dccc-4122-add0-fd4a446e6d37","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.732340Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:945853cbf2e649352adb0dc973e2c254a510f484853655f0acd9c59b4e15d406","observation_id":"320f098a-a661-45fd-9ce5-b5d5716e3908","resolution":{"observed_at":"2026-08-06T17:26:44.457258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.444106Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments,","venue":null,"work_id":"7d00b8d9-d491-4b46-be47-b8ac2c4428e1","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.821615Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e7cc80b6b8509973a5a2875524de360db361b61a7cd33571ac10bb48441df244","observation_id":"3fd76607-44a9-47e8-b314-11137f882b18","resolution":{"observed_at":"2026-08-06T17:26:44.447485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.434825Z","title":"Speaker-follower models for vision-and-language nav- igation,","venue":null,"work_id":"096044d6-4dc9-464e-ae11-8985e1134fd5","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:37.926692Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:9d8fabf3b2df365a39a2892dfb65b7a9674b1375890d68f1803a1e86fb1707e9","observation_id":"79b91aaf-2067-483d-9252-0e4951e56f13","resolution":{"observed_at":"2026-08-06T17:26:44.438579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.425652Z","title":"Learning to navigate unseen environments: Back trans- lation with environmental dropout,","venue":null,"work_id":"2c10bb04-1ee9-4d10-9336-a1cd734025e4","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.019873Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8ce36d6e7a8325df37915b2cb9c2712617be3c0fc15cf3ab28ea46e8d7298af3","observation_id":"e7b3cd13-b28a-4c39-ac02-363b48101623","resolution":{"observed_at":"2026-08-06T17:26:44.428820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.416195Z","title":"Visual landmark selection for generating grounded and interpretable navigation instructions,","venue":null,"work_id":"8caef496-e40f-49c4-9db4-0f115d410dec","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.083529Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:65c62f2272119df5236e4bad7f19539255be98157b4714041fc03d25a13e0ee9","observation_id":"2f3b20a6-0499-4de2-ae3e-cef0c369a98f","resolution":{"observed_at":"2026-08-06T17:26:44.420060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.407058Z","title":"Crossmap transformer: A crossmodal masked path transformer using double back-translation for vision-and-language navigation,","venue":null,"work_id":"8d0ae607-1cd0-40c6-8998-a8b64fa55611","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.155998Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:c7885d2cb5d39cacb77aaff98bda9e4afb2469354e9a7cd311383c390229e142","observation_id":"86a5f0cd-6322-460f-b3e6-7fc111e24d61","resolution":{"observed_at":"2026-08-06T17:26:44.410397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.398157Z","title":"Improved speaker and navigator for vision-and-language navigation,","venue":null,"work_id":"966f4d72-2d1e-42b2-87bb-4be902ad80ee","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.239153Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:aaa2704749bb1ae556d4f590e28430b50d04cba45dd12716179748c47479f7d0","observation_id":"f84da2ac-b995-4950-8876-1ebac4b38a3f","resolution":{"observed_at":"2026-08-06T17:26:44.401744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.389431Z","title":"Res-sts: Referring expression speaker via self-training with scorer for goal-oriented vision-language navigation,","venue":null,"work_id":"df5e0e65-d69d-4181-a595-4794e323f7ec","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.295300Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e8a69f7c94e4451e5e6964db77bde7d60095e15b1cd1ee389d59f4027a800afa","observation_id":"0c5fa32d-cc31-4fe4-a8e0-f6298bde3b1b","resolution":{"observed_at":"2026-08-06T17:26:44.392673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.378203Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments,","venue":null,"work_id":"88f4478a-08c4-4467-8c20-7761bfabd745","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.367875Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:372670b9ec47a881078c169a608cd5b39425c84388ec2ca7fdefbababf948429","observation_id":"a0c9bbcc-6905-443c-a24a-1dcc90d9ed0e","resolution":{"observed_at":"2026-08-06T17:26:44.381772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.369434Z","title":"Vision-language navigation with self-supervised auxil- iary reasoning tasks,","venue":null,"work_id":"bfa67fb0-dae8-4d55-97a0-198f2094ebf5","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.452079Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:33750842cd0369740d476b2c61a04810d34717599068959d36997c10531315fb","observation_id":"6a7ef5d2-e715-423b-8567-3ba1fa884db6","resolution":{"observed_at":"2026-08-06T17:26:44.372815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.360189Z","title":"Towards navigation by reasoning over spatial config- urations,","venue":null,"work_id":"b0e6817d-69f7-4b6e-9050-150823078cd4","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.554838Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8fed2afdd26ed9cacc4b00975f718b5c27d7baf1eb6dfb24837f2698aec366ad","observation_id":"1eb139da-2ee3-49ec-85ea-c8e94ab8b33b","resolution":{"observed_at":"2026-08-06T17:26:44.363650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.351182Z","title":"Language-guided navigation via cross-modal ground- ing and alternate adversarial learning,","venue":null,"work_id":"7a77e6fa-07e6-4cd6-874b-79491d5f78a8","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.609153Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:161e0dc7f85d64770ede7dca397c04312e16d56595eed0c2b510a8dcd8e18df1","observation_id":"34f7b84e-9f1c-4bf3-ac1d-e560385cd547","resolution":{"observed_at":"2026-08-06T17:26:44.354831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.341152Z","title":"A dual semantic-aware recurrent global-adaptive net- work for vision-and-language navigation,","venue":null,"work_id":"cbd995ca-4405-4e53-a4c5-f042c94ca803","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.716252Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:a6530a29cb102e4f6a17b96204bf9ec2cd612a95a636d7850dc533b9bf32733d","observation_id":"21b5f186-52d0-4f3a-990a-1bcc4428e6e2","resolution":{"observed_at":"2026-08-06T17:26:44.345561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.332686Z","title":"Vision-and-language navigation via causal learning,","venue":null,"work_id":"82d5a81b-3add-45d0-9472-68f080fc6e0d","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.796758Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:cc87cd8cedcf5c24c9592af74be4809c6b44469a285292489128824018a28ee1","observation_id":"007a28bd-c66b-4057-9f25-ab84b9db3c2a","resolution":{"observed_at":"2026-08-06T17:26:44.335692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.323262Z","title":"Waypoint models for instruction-guided navigation in continuous environments,","venue":null,"work_id":"d672a237-27e5-423d-b258-99b28f3ea1bc","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.871862Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ba1b360f9418f44f354bff62e4d06dc96faf6d0bf7d9c449e8a6f09851d06cc4","observation_id":"bcacd41b-15ed-4c7e-8901-c55c2688cf0f","resolution":{"observed_at":"2026-08-06T17:26:44.327313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.314360Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation,","venue":null,"work_id":"f7a2caf4-f0f2-4711-87bf-c212d9dbed21","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:38.964356Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:eb6c1b965b8af425a6ee5ace63760357a4c94b1ff128db731d90ec105758e462","observation_id":"eec50d35-4578-4d91-bbad-ed303647c806","resolution":{"observed_at":"2026-08-06T17:26:44.317948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.305376Z","title":"Instruction-aligned hierarchical waypoint planner for vision-and-language navigation in continuous environments,","venue":null,"work_id":"744385e3-415b-4d31-b7c3-adb3e1d094b2","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.031354Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:a054cac1a14a9e0ad1cecbbd63b0b0347c69f43bbcacdb829d49f832e9c992af","observation_id":"fcf4d2f5-53ea-4e97-923c-2184a576ffa8","resolution":{"observed_at":"2026-08-06T17:26:44.308510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.296280Z","title":"Improving vision-and-language navigation with image-text pairs from the web,","venue":null,"work_id":"1a3c3b79-662d-4bbe-9664-4bdcfd967744","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.088275Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:f0b344f7a2de0baa454c3b4edfe76d39813575eba11fca8b01adf43ec1c1d66c","observation_id":"8ddd9a38-05e6-472b-add2-8ea5728405b9","resolution":{"observed_at":"2026-08-06T17:26:44.299440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.287313Z","title":"Vln bert: A recurrent vision-and-language bert for navigation,","venue":null,"work_id":"29128941-7f56-4e8a-89ee-0fd026cde8b5","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.181868Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:47df58d1601337a8f3f095bfbe9db726e8c351965a37e3323ded1d36134851d8","observation_id":"b6dd2d05-fc7a-4002-85c8-3741ea750657","resolution":{"observed_at":"2026-08-06T17:26:44.290467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.278676Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation,","venue":null,"work_id":"bb6c4da6-a227-4534-8c0e-d72400668c81","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.255109Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:b3cfdad51bf2b1329f92014f2f5c2eb9457083b61f88b2baced9cb215cda728e","observation_id":"8f05ce81-8683-43c7-bc49-de2b6baf70ba","resolution":{"observed_at":"2026-08-06T17:26:44.281913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.269729Z","title":"Multimodal evolutionary encoder for continuous vision- language navigation,","venue":null,"work_id":"3011f94b-1759-4ec7-ab99-fdb68bd9347e","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.371677Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:35218f0557a98e58c1c1fdcd0cf74f6116bae47daaea38e1adb48f1a52bbfa0b","observation_id":"fcbc33e1-5ace-47b3-81b0-fc401782c2ed","resolution":{"observed_at":"2026-08-06T17:26:44.273145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.261366Z","title":"Lana: A language-capable navigator for instruction following and generation,","venue":null,"work_id":"a8f55735-f938-4f14-8514-091ce99ae0d0","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.423682Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:6c166d5dbd1753173048d477d613c49aff14cbc88d5e7c89a3ce1cd3e7de2b14","observation_id":"7884320a-c9f4-469a-9b2e-152643a064d4","resolution":{"observed_at":"2026-08-06T17:26:44.264496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.252147Z","title":"Pasts: Progress-aware spatio-temporal transformer speaker for vision-and-language navigation,","venue":null,"work_id":"535a3af9-f867-4ac6-97f7-98a8407012b4","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.509361Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:31d1e387a36146207517c153bf6b5714cf6227eaeef8387587540f9715e10ef9","observation_id":"630df405-98ab-4d04-88f1-866f562a9a4d","resolution":{"observed_at":"2026-08-06T17:26:44.255999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.242032Z","title":"Envedit: Environment editing for vision-and-language navigation,","venue":null,"work_id":"ee55d167-3598-4bf9-b4aa-e4a5afc54b2c","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.600011Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:24323cc8b47cdf03b4eda644369fe1f98a93fa1ff730ecd1cff9f5604e9ce404","observation_id":"8a48d74d-8bc1-4388-ad64-42f79fd1f07b","resolution":{"observed_at":"2026-08-06T17:26:44.245998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.233264Z","title":"Less is more: Generating grounded navigation instruc- tions from landmarks,","venue":null,"work_id":"6a4fcb2d-114f-4b41-8da8-f5d029572c2d","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.657739Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8910543b2dcf74ce07d16ce70bae7d3c2ade95d55a575e77952943bd51116d14","observation_id":"eb44402d-c6aa-4704-8cc9-b4d15dea0189","resolution":{"observed_at":"2026-08-06T17:26:44.236709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.223318Z","title":"Learning vision-and-language navigation from youtube videos,","venue":null,"work_id":"dd9be11c-99b9-4ecb-ab5d-a7c2f1516f30","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.749105Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:3d1bb236710b554d1ac5be330865a69258dbed2c5b2012824ce4ce1a5d6283b5","observation_id":"81ba1bbc-87b9-4838-a7af-147d1a0540c9","resolution":{"observed_at":"2026-08-06T17:26:44.226926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.214741Z","title":"Video captioning: A comparative review of where we are and which could be the route,","venue":null,"work_id":"d9213d31-13a2-4726-a9b5-7b199a78ac85","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.825425Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ab5536271019d0061827b21ec45d9deb25ef82535cbd353de3fad3c137336fe3","observation_id":"61f4f532-c790-4ee5-9f6a-486991bddce8","resolution":{"observed_at":"2026-08-06T17:26:44.217843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.206347Z","title":"A review of deep learning for video captioning,","venue":null,"work_id":"cb9a464a-3269-438d-866e-ca7f03004ff0","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:39.922378Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:059bd7e1da45acf5d59c426c2a0ff0a1a27d5712cad0c792947a8ae9b0aa93cd","observation_id":"22ef3e08-ccdf-4734-8ce8-8e62679309e9","resolution":{"observed_at":"2026-08-06T17:26:44.209487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.196855Z","title":"A survey of video datasets for grounded event understanding,","venue":null,"work_id":"8d3157ff-c3f7-4045-89e1-bd3202d7f9aa","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.001084Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:548ee10029d44c8eadbdfda7ab6d4f911203ccc019ea58e3f0049d655ca67e91","observation_id":"d2458f56-b1f6-4903-8b55-56e5a6224c4d","resolution":{"observed_at":"2026-08-06T17:26:44.201062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.188484Z","title":"Dual-stream recurrent neural network for video caption- ing,","venue":null,"work_id":"2efada35-8ea7-4bf8-a1cf-a3855373f304","year":2019},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.140493Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:15e5c8a253e49e68589f33da61bb4e678cb077e4b3b5011be1db79740c1105e6","observation_id":"77cd7376-8182-465e-9944-167429902d73","resolution":{"observed_at":"2026-08-06T17:26:44.191684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.179487Z","title":"Video captioning using global-local representation,","venue":null,"work_id":"d74265ef-cda1-441c-bcd9-160b54e87ddd","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.207516Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1adcade24bf114c301a448a4bc3ff66a56f995811fcaff52b10ce2a4f4668524","observation_id":"8d03ee06-26ed-4750-b4cc-300ca7c23b15","resolution":{"observed_at":"2026-08-06T17:26:44.182805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.169877Z","title":"Evcap: Element-aware video captioning,","venue":null,"work_id":"2c8ecab1-45b8-44fe-ae6a-fb4c7c6b472e","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.274303Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:96e3bba3eaf8e72f03b8aa18726aac1424faeec7efb6e6306714b828781951e9","observation_id":"0458ea46-934a-4639-8938-dc4f54258e01","resolution":{"observed_at":"2026-08-06T17:26:44.173422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T17:26:40.342191Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.342191Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ae414961e2dcd1051b8f57abed0f33ba829a70bc2bab476392ce3574d3c0b13e","observation_id":"b26fa6d3-8e11-4c3e-9537-a920ae3bceae","resolution":{"observed_at":"2026-08-06T17:26:40.342191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:26:40.424787Z","title":"Qwen2-vl: Enhancing vision-language model’s percep- tion of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.424787Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ce724ef15697b0e412506bf4f1d13692db1f0697878b7d3a71cc867f9a12fc18","observation_id":"6aae20aa-65e1-4b81-8d3c-1412558d63f6","resolution":{"observed_at":"2026-08-06T17:26:40.424787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.160084Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"af74c483-748b-4676-8e7a-68a78eec21d4","year":2016},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.514568Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:139c83c23c62b99d935379858ed594aa082fd19f9e197112bfe87089cedb989e","observation_id":"5a0f4ef5-bca5-4426-8e87-71b62743ce9c","resolution":{"observed_at":"2026-08-06T17:26:44.164482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.149957Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":"ea43b3a0-b30d-4c9b-972a-17ff2ebcadca","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.611316Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:271914b647640a8d265f16b91e450c955eba74768d20f7fa5afbefe6be6c0dce","observation_id":"0098bd94-98bd-4d4f-b0c4-c85abfd7fd19","resolution":{"observed_at":"2026-08-06T17:26:44.154235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.141218Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments,","venue":null,"work_id":"d6b6128d-776a-4174-959c-01ea91953ac3","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.722428Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:766317eb6c77f825212abed8a9090743d4ea8f6fdc4f77ba5957b0f3f0b735fc","observation_id":"91305db8-ed73-4a43-ae18-476114721c4e","resolution":{"observed_at":"2026-08-06T17:26:44.144410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.132783Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"d63d55f7-2bcf-4873-8707-0b37b804cb5f","year":2016},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.776309Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8e09074e9a732264c8cb532bc95e33003f5fb6f2528893982be512ab68957a3c","observation_id":"990bc053-7431-47a2-ba82-b380648b8fa7","resolution":{"observed_at":"2026-08-06T17:26:44.136022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.122667Z","title":"Object recognition from local scale-invariant features,","venue":null,"work_id":"acc4ebbb-21e6-4a1e-af96-5ff6cac1099e","year":1999},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.864850Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:5f1f3058815697856940c23477815acf438a61fe8cc710beb334e67e14f3a3e3","observation_id":"1fffbdb2-5fb0-4ea9-802f-e52533dc242c","resolution":{"observed_at":"2026-08-06T17:26:44.127067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.112175Z","title":"Fast approximate nearest neighbors with au- tomatic algorithm configuration,","venue":null,"work_id":"f3f6fa6c-441e-4a87-bc0b-803c2b909df2","year":2009},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:40.960158Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e43a907647b19b0deaa64ec2904b072acedb60bbb8275baf93e2033764fdc96e","observation_id":"2debacc8-7b06-45ae-b108-0611d651b798","resolution":{"observed_at":"2026-08-06T17:26:44.115716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.102420Z","title":"Revisiting weakly supervised pre-training of visual perception models,","venue":null,"work_id":"baa76caa-90fa-406f-90e9-ff2acf932d99","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.044904Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:d1f47ca8eef0b7fed9340e75d84f1a32ee6681eae3d718c502ada0fb52badff9","observation_id":"d8d7c4b6-bd4f-43ac-a3c4-e7d6a716bff1","resolution":{"observed_at":"2026-08-06T17:26:44.105728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.091812Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"da4d22f9-91e5-427f-a199-0511e25d922b","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.136000Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e60e22af653a60f922b8a6e3fa8031812cacda9c5be92d5a97703806bb02a69e","observation_id":"23f5e418-644f-47af-af40-1efbbb7e09b8","resolution":{"observed_at":"2026-08-06T17:26:44.096238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.082816Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":"b1c5a375-8b23-4731-b992-bbe0c0862724","year":2020},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.246340Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:e671a242c2b979664b3aa094976385d0a9c1af3618d4d57d16aa4153a774c6ec","observation_id":"c4b53ea2-908e-4d6e-ac65-f4e5e6974249","resolution":{"observed_at":"2026-08-06T17:26:44.085885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.073703Z","title":"Visual instruction tuning,","venue":null,"work_id":"dd8df61d-4fc4-4da8-892d-f37c7e1fa5f5","year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.321346Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8978bc010f8eb0adfbce090c27b9dae8004eeee814677ef1a88b4f489398389f","observation_id":"14a3a940-618e-426e-b011-b094ce65ca34","resolution":{"observed_at":"2026-08-06T17:26:44.077443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.064190Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"19b7ddca-4884-47e3-a584-6e87f5a6504b","year":2002},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.381224Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1b6feb7734d31b2fd4fab9a0c036f136acd68f53e57f167337ba8da404305e5c","observation_id":"27eb50c0-19e7-4ef8-b2cd-281d96d8e02f","resolution":{"observed_at":"2026-08-06T17:26:44.067482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.054376Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"a782977b-46db-46a1-b32c-aafde91a5b10","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.520663Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:b86c839d65269680beb470badf5fc8242c36d35f20b42ee5b9a5d4ac7e0d195d","observation_id":"7e4715a2-04d0-41fb-abd4-b97a82fd66a9","resolution":{"observed_at":"2026-08-06T17:26:44.057996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:41.645320Z","title":"Cutting the gordian knot: The moving-average type–token ratio (mattr),","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.645320Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:69b49aa318865fe1629c902abef46786875bad4ca1a04ecff6dd4cd5473cc03c","observation_id":"fcc4dadf-e352-4213-a471-636f6c12b421","resolution":{"observed_at":"2026-08-06T17:26:41.645320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:41.755589Z","title":"Locally typical sampling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.755589Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:db61a80a3b7ec8361196b0a20be45cb6dc920199aa4b52bf7556c02ce7417260","observation_id":"9d0a2613-97d5-4adc-93a8-0ae22ebcc604","resolution":{"observed_at":"2026-08-06T17:26:41.755589Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.043993Z","title":"Texygen: A benchmarking platform for text generation models,","venue":null,"work_id":"b6fe64ef-aff5-4f84-8af8-5af0cf72f056","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:41.876239Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:0da4c557c943f9cfa305be6bca35ab09259ee9442f4b60b4aa870682065e5cea","observation_id":"f0e708ec-b3a9-45e2-ae65-c66232e35414","resolution":{"observed_at":"2026-08-06T17:26:44.048817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:42.017758Z","title":"Standardizing the measurement of text diversity: A tool and a comparative analysis of scores,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.017758Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:31d5c8c83ee3567fa88ee949b3d0a1c1f7cee0b3e3583a05f8da110a30e7c046","observation_id":"15627557-607d-42bc-9114-4b9486b1ce47","resolution":{"observed_at":"2026-08-06T17:26:42.017758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T17:26:42.152760Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.152760Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:365c1fc0d58e04cfdfe4eecf839527cae85bd98714bc23035ab3c977c5b7d625","observation_id":"8c2ba964-e269-4872-b6ac-2d45b22fb411","resolution":{"observed_at":"2026-08-06T17:26:42.152760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.034924Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":"5e317f3e-976b-468c-8ffe-f14ae6b9a551","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.420639Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:752037df3f90febeb8268b6074019130ed6d8c3c3b26c6c37321674f71d3c88a","observation_id":"a6530019-9259-4309-80ff-38276acef15a","resolution":{"observed_at":"2026-08-06T17:26:44.038618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.025732Z","title":"Places: A 10 million image database for scene recognition,","venue":null,"work_id":"f8effe45-6705-44ed-b253-6f1ab2936ff2","year":2018},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.589056Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1dbdaf0c21f7f378ddfd392c514d530f91b3a61cb931b7d781ccf89895aac8a0","observation_id":"897009f2-c011-48d7-b139-16b23f4927cb","resolution":{"observed_at":"2026-08-06T17:26:44.029351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.016985Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"a7025137-ab17-482b-a627-5a40292add70","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.755630Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:80cf390db235036909e9d2063331b1241d129a217a2f2e8354d2b38826a538fb","observation_id":"8f2f6ac3-43d4-4d5c-adb6-cb66239809e6","resolution":{"observed_at":"2026-08-06T17:26:44.020039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T17:26:42.870226Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.870226Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:12bef7b534586f4636268f81ec2adc89e905f9250bb2c3265c9db0e55fcb0864","observation_id":"c6cccb69-2e66-428c-a754-1c8b3e39b82d","resolution":{"observed_at":"2026-08-06T17:26:42.870226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:44.007590Z","title":"GPT-4o mini: advancing cost-efficient in- telligence","venue":null,"work_id":"fc434797-1f5b-4650-9d92-1abbdb1def69","year":null},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.873716Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:828a6dd27730226ca556cc65546e43ab88591637a5876f5d9fc928bebb417569","observation_id":"4452d2f4-3dbb-4912-beb9-97b5addd3fc4","resolution":{"observed_at":"2026-08-06T17:26:44.011684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T17:26:42.877278Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.877278Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:72655d7b15969384e171dfdd05df4839506157c645af4abd66ce10f2451dcbcd","observation_id":"4ab11380-5c49-4707-aab2-06129999fad6","resolution":{"observed_at":"2026-08-06T17:26:42.877278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T17:26:42.892226Z","title":"Gemma 2: Improving open language models at a practical size,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.892226Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:af16bd8e1645108bda48617484f20ce673ef4010142663ce186ca873784747a8","observation_id":"a8c8dc48-1b17-4bd8-b79c-91866c6a70e0","resolution":{"observed_at":"2026-08-06T17:26:42.892226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:26:42.996218Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:42.996218Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:0e1e76e18a96f3808f4f7075c93018c34492cb11c206935b601aa33facc44505","observation_id":"b0bdb53a-ba0f-41b8-9619-687c91c69ae3","resolution":{"observed_at":"2026-08-06T17:26:42.996218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.092511Z","title":"Openclip,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.092511Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:987686e391b279415ea8521c0a889c4cc6b4a3769bdc0d1c6c4e1262f7fd8233","observation_id":"b7bdd802-c3b5-401a-92a6-815bd1315e18","resolution":{"observed_at":"2026-08-06T17:26:43.092511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.191390Z","title":"Torchmetrics - measuring reproducibility in pytorch,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.191390Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:8bedc44011715ece8b769234cc5fbac7b5eb72808d83e4e75d4ecde13afeb6ff","observation_id":"fee5a68b-2a12-4e76-b3fd-6f2feac95f21","resolution":{"observed_at":"2026-08-06T17:26:43.191390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.998281Z","title":"Coca: Contrastive captioners are image-text foundation models,","venue":null,"work_id":"994c3a8c-b712-4683-8e3d-b91fd55e9e9b","year":2022},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.275308Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:1ebb7c02f9232a71c03cf31ad158d8816df94b97a11cf71fe7e98fa5c2ea567e","observation_id":"e7acea5c-bc75-4730-9fc6-307e4ca84cfd","resolution":{"observed_at":"2026-08-06T17:26:44.001587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.988510Z","title":"Llava-next: A strong zero-shot video understanding model,","venue":null,"work_id":"4a99a8cf-d618-4d62-8f05-6b2cb6b95abc","year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.314145Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:9c8ab58f0cf284f2c76760738ef0753f455acb058f89d74c249d66fff0155cfb","observation_id":"f81e374e-5483-48e2-a264-9e627404a796","resolution":{"observed_at":"2026-08-06T17:26:43.992269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.979199Z","title":"Habitat-matterport 3d dataset (HM3d): 1000 large-scale 3d environments for embodied AI,","venue":null,"work_id":"fde3f349-e959-4f78-97d1-78363f6b18e3","year":2021},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.350446Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:6758c758230b012cb58de6f9615477ac6fc0e32d3acecb8d7498bb3975b443cb","observation_id":"b1854ce4-7a63-4ad5-92b7-736cd657a4f0","resolution":{"observed_at":"2026-08-06T17:26:43.982841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.968623Z","title":"Scenenet rgb-d: Can 5m synthetic images beat generic imagenet pre-training on indoor segmentation?","venue":null,"work_id":"0b707c55-4435-43dd-8e8c-61fc6f39a469","year":2017},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.380318Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:ae804d942e938babb2eaca3736496a6f3cd61c5d88ab8848ef7bf82a73e286fd","observation_id":"657da7f3-f228-4c2a-9e96-5dd84ce52051","resolution":{"observed_at":"2026-08-06T17:26:43.973049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10943","last_updated":"2024-07-15T17:40:46Z","snapshot_observed_at":"2026-07-06T18:46:39.497352Z","submitted_at":"2024-07-15T17:40:46Z","title":"GRUtopia: Dream General Robots in a City at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10943","snapshot_observed_at":"2026-08-06T17:26:43.401732Z","title":"Grutopia: Dream general robots in a city at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.401732Z"},"links":{"cited_paper":"/paper/2407.10943","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:425314eab0e2e86d881719fad12c80bb522900bd1477fe585ae7b81ab961cdd6","observation_id":"50046585-1b74-4c97-a40c-c8877d309220","resolution":{"observed_at":"2026-08-06T17:26:43.401732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.879280Z","title":"Sun3d: A database of big spaces reconstructed using sfm and object labels,","venue":null,"work_id":"dc84c5ab-60e8-44d1-8901-0d953034e9c2","year":2013},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.407659Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:356e4b4d9fadc57dd273b90494510a7c77917a28649bd10d003074ec3854ab6c","observation_id":"0a01de21-e13d-40f3-9ec3-33838189d519","resolution":{"observed_at":"2026-08-06T17:26:43.927862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.825719Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes,","venue":null,"work_id":"bc5883bb-71b7-480b-9dda-498642ae3bb7","year":2017},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.413279Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:95dadc328c4d023d148cf90f8dd562d1688c20485e2c0173ac7d0cd7c94b5597","observation_id":"505e524b-fc7c-4f03-a10f-e591e1571320","resolution":{"observed_at":"2026-08-06T17:26:43.849072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.786046Z","title":"A benchmark for the evaluation of rgb-d slam systems,","venue":null,"work_id":"d0c9ef31-2ce8-460f-bf10-2d8af1aba078","year":2012},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.419507Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:cc53431c224a7bfafbba8b2d132813ac9acec49160cf8b8b6fa15571e83da187","observation_id":"a268142b-4b52-423d-a890-b6594a577936","resolution":{"observed_at":"2026-08-06T17:26:43.798243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.718375Z","title":"Learning to navigate the energy landscape,","venue":null,"work_id":"5d9166e7-8d8f-43d7-a9b0-d6c74a2de6c2","year":2016},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.425274Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:dce3287dfbb4747381bb6f821f46866aee4cab0d42972520978bc55cbc96b25e","observation_id":"6467cdaf-05aa-47e0-a458-28270e1a30ac","resolution":{"observed_at":"2026-08-06T17:26:43.748638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-03T12:37:47.747612Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-06T17:26:43.431393Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.431393Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:a74fa70dc1797677c2d050d6e37b281cd09322c4a486fc610e7ffa923cda1581","observation_id":"224e5921-e4fc-47e8-811d-6c2248a5c419","resolution":{"observed_at":"2026-08-06T17:26:43.431393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:43.664954Z","title":"Vision meets robotics: The kitti dataset,","venue":null,"work_id":"9cd13e78-1c4e-4874-ac9d-4b1ae49a4b35","year":2013},"citing_paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:43.437116Z"},"links":{"citing_paper":"/paper/2507.10894"},"observation_digest":"sha256:a01c5f017cce4696f741d6363600218fde187023f304070865c9e9208e257dd5","observation_id":"3672e4eb-aa87-4be4-964d-ee67f5298424","resolution":{"observed_at":"2026-08-06T17:26:43.696891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10894","last_updated":"2025-07-15T01:20:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T14:08:49.627452Z","submitted_at":"2025-07-15T01:20:22Z","title":"NavComposer: Composing Language Instructions for Navigation Trajectories through Action-Scene-Object Modularization"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2507.10894."}