{"as_of":"2026-08-16T08:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f331a07ee9ffe1fc7885bedd7dc50b5c22eb3fa6636fa8a54db9aa53257b3cf9","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:59:11.164370Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:04:39.821353Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T14:37:03.075467Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2511.17097","last_updated":"2026-04-14T15:21:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T09:52:07Z","title":"Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T21:02:38.013115Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2511.17097"},"observation_digest":"sha256:d931bd450a04959eeae5b4e15da88a3d83c8be74084586d69f98f7894c083c51","observation_id":"10920aae-b0b6-40f6-bfb5-c4bd0db6c11c","resolution":{"observed_at":"2026-05-17T21:05:15.944979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2605.13328","last_updated":"2026-05-13T10:41:24Z","snapshot_observed_at":"2026-08-11T08:12:01.149533Z","submitted_at":"2026-05-13T10:41:24Z","title":"What Limits Vision-and-Language Navigation ?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-14T17:59:58.891151Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2605.13328"},"observation_digest":"sha256:9327dee6a3d420a2cf2e37ee9818ec8ac957a0309e92c49917d8a6f42d7fcc26","observation_id":"a7609af3-49f1-4cfe-b0ae-76e5d5b2bd0e","resolution":{"observed_at":"2026-05-14T18:02:32.616304Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2605.22036","last_updated":"2026-05-21T06:20:17Z","snapshot_observed_at":"2026-08-15T17:22:17.879626Z","submitted_at":"2026-05-21T06:20:17Z","title":"GA-VLN: Geometry-Aware BEV Representation for Efficient Vision-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-22T06:45:35.920991Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2605.22036"},"observation_digest":"sha256:475e67e508ed47f3316adea95e69e0952d08faf8953858b65bf163b8283e2242","observation_id":"0e70a95a-c0ab-45f8-ba18-94a5f067105f","resolution":{"observed_at":"2026-05-22T06:46:10.563944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2606.00095","last_updated":"2026-05-25T08:53:21Z","snapshot_observed_at":"2026-08-02T11:09:28.452176Z","submitted_at":"2026-05-25T08:53:21Z","title":"Bridging the 2D-3D Gap: A Hierarchical Semantic-Geometric Map for Vision Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T22:33:32.671550Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2606.00095"},"observation_digest":"sha256:e5a218d44c44d97c26061e08d69fff0daadf1d825941510a5b75421cb3bd124c","observation_id":"60fad76a-54e2-40b7-abc8-9a427e75a6d3","resolution":{"observed_at":"2026-06-29T22:34:01.357198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":"2505.11383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-07-02T14:37:03.075467Z","title":"Dynam3d: Dynamic layered 3d tokens empower vlm for vision-and- language navigation.arXiv preprint arXiv:2505.11383","venue":null,"work_id":"9890d033-0d8f-4665-afd5-c10751fc165b","year":2025},"citing_paper":{"arxiv_id":"2607.00529","last_updated":"2026-07-01T07:18:07Z","snapshot_observed_at":"2026-08-07T14:21:37.840021Z","submitted_at":"2026-07-01T07:18:07Z","title":"NoPA: Non-Parametric Online 3D Scene Graph Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-02T14:36:02.425820Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2607.00529"},"observation_digest":"sha256:c72032f0eb46620d1c05368079d5ea49fb96d6f41fd4fc4da3b4d5e903aa53c3","observation_id":"a7332381-e0b8-49e3-94e3-26f339981b26","resolution":{"observed_at":"2026-07-02T14:37:03.076919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11383","snapshot_observed_at":"2026-08-01T12:04:39.821353Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19695","last_updated":"2026-07-22T02:53:46Z","snapshot_observed_at":"2026-08-08T18:58:08.657904Z","submitted_at":"2026-07-22T02:53:46Z","title":"NavVerse: Benchmarking Indoor-to-Outdoor Embodied Navigation in Continuous Robot Simulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T12:04:39.821353Z"},"links":{"cited_paper":"/paper/2505.11383","citing_paper":"/paper/2607.19695"},"observation_digest":"sha256:f183824d332adbca00a5ab568b18143f0383aca9e7497c737cd0e0cc4d58cbd9","observation_id":"6068e15d-7e0d-4aa9-ae6b-46132f95e96f","resolution":{"observed_at":"2026-08-01T12:04:39.821353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11383/citation-record","integrity":"/paper/2505.11383/integrity","json":"/paper/2505.11383/citation-record.json","paper":"/paper/2505.11383"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.849564Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.849564Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:33a64f77546f932daf02621e993dcb725d232b370cda18ba860dc348c584aa8a","observation_id":"01d8955a-8656-45e7-b7e4-24c4531b860d","resolution":{"observed_at":"2026-08-15T20:59:10.849564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.903499Z","title":"Reverie: Remote embodied visual referring expression in real indoor environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.903499Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:c9c33187d86b2113b6e59070e0460976a48d435256f8208cafa819cf508341dc","observation_id":"d038db71-6345-4fb3-ad16-aeb9a5715e14","resolution":{"observed_at":"2026-08-15T20:59:10.903499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.936174Z","title":"Beyond the nav- graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.936174Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:af3c6ed755b93ac403330c21a868aa603b70433ee2dd7eb7e60d4e78a512ad22","observation_id":"d9e9caf6-4b13-4bed-8dd9-b3e6c09b2f2c","resolution":{"observed_at":"2026-08-15T20:59:10.936174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11142","last_updated":"2025-03-07T06:06:29Z","snapshot_observed_at":"2026-08-12T10:07:25.847288Z","submitted_at":"2025-02-16T14:17:36Z","title":"NavRAG: Generating User Demand Instructions for Embodied Navigation through Retrieval-Augmented LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11142","snapshot_observed_at":"2026-08-15T20:59:10.939678Z","title":"Navrag: Generating user de- mand instructions for embodied navigation through retrieval-augmented llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.939678Z"},"links":{"cited_paper":"/paper/2502.11142","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:ea5f780593535829223e6cec88362548cd962e9b7edb4375207d8467789aa8a5","observation_id":"45278d17-f96a-4c42-baeb-20620e5e5c34","resolution":{"observed_at":"2026-08-15T20:59:10.939678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.799763Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":"73111b3c-ca6b-4fa2-b3ce-d3dd0fe1a0ed","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.943451Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:756eb8c4ba4627ca1fe1308e9d8db42687720f6851b88a9f8f5b429624f85c91","observation_id":"705f5863-bebe-4c38-8383-8273c10a40e6","resolution":{"observed_at":"2026-08-15T20:59:11.803239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-15T20:59:10.947005Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.947005Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:01185aec623144532e1d551812936dd76d385c6f810ca5164ae0ca07f30801a8","observation_id":"bcaf25e4-d524-4bf8-a3f5-77a3e0cbd0ec","resolution":{"observed_at":"2026-08-15T20:59:10.947005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.788227Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":"9972f363-d2ea-4398-99e3-472b7e3840d1","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.952731Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:9895c85b368fdb95c1d022e228801ee4a26665cb845c761315e53331fd46fe14","observation_id":"d61b36e6-545f-431c-a197-7e3e499c7063","resolution":{"observed_at":"2026-08-15T20:59:11.792553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T20:59:10.956883Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.956883Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e7fc91d5ba4c4ad0336af3c0ffbc7006ed04607c7273aab7403cb9fa6e48be9f","observation_id":"b3b93662-d1aa-4d52-8dc3-4e5398686caa","resolution":{"observed_at":"2026-08-15T20:59:10.956883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.961049Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.961049Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:2ef63b5ff34b6fbd2222a23e63fa1739d41ea988a3822e6d9fee8c250ca88a92","observation_id":"0f5cd850-a1ea-407f-85f6-db18870e19c9","resolution":{"observed_at":"2026-08-15T20:59:10.961049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.964786Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.964786Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:1dd61fbb2817da2f088d125748c164ea610d524ba72c6256f1c35041973f26d7","observation_id":"996261e8-7526-41ee-a2bd-20522179c51d","resolution":{"observed_at":"2026-08-15T20:59:10.964786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.968497Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.968497Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f728f231fe3e5965b62697184154e6cdcd5e47addd3058aa46e41314340239d1","observation_id":"da6b1330-cdc2-43e2-8445-7722539e026e","resolution":{"observed_at":"2026-08-15T20:59:10.968497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-13T11:12:44.426861Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-15T20:59:10.972360Z","title":"Fast segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.972360Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:bde82e7dfb8f6f5dc8ec9d76bac3440dd20710f19d9756e4bb002896053894d8","observation_id":"9e8723f9-ff7d-4355-be5c-e9272afdcde4","resolution":{"observed_at":"2026-08-15T20:59:10.972360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.758107Z","title":"Embodied- sam: Online segment any 3d thing in real time","venue":null,"work_id":"906f2b9d-0ec4-418c-8854-eac5a5325b1f","year":null},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.976611Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f23c91b87a54e4c533ad816667a9d0cb6b6aa7a03e370661168ae92ee8e5d49f","observation_id":"3efa4660-06ae-47dd-9c5c-2562faa81aa3","resolution":{"observed_at":"2026-08-15T20:59:11.761723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17030","last_updated":"2024-11-26T01:54:52Z","snapshot_observed_at":"2026-08-16T08:13:24.686581Z","submitted_at":"2024-11-26T01:54:52Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","version":1},"cited_work":{"arxiv_id":"2411.17030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.17030","snapshot_observed_at":"2026-08-15T20:59:11.313603Z","title":"g3D-LF: Generalizable 3D-Language Feature Fields for Embodied Tasks","venue":"cs.CV","work_id":"4b28e66d-713b-4398-a61e-5aef89c6aff3","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.980663Z"},"links":{"cited_paper":"/paper/2411.17030","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f8f9d47ad2d399ae58110f7b85622b31f31844e6558777f0b338bfa759a54fec","observation_id":"b51ff56e-42fa-4640-a62e-899912c30b18","resolution":{"observed_at":"2026-08-15T20:59:11.320907Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.747268Z","title":"Vln bert: A recurrent vision-and-language bert for navigation","venue":null,"work_id":"f46144cf-2bf9-4387-b37d-31c98eadd2e3","year":2021},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.984771Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:6472271727b83577762a51398885d1605e8c40f8a9e9bc619921e3e09f821188","observation_id":"8a0a6a91-d385-4944-8dd5-5be7d7a306d6","resolution":{"observed_at":"2026-08-15T20:59:11.750903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.988386Z","title":"History aware multimodal transformer for vision-and-language navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.988386Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:fa3434e1846ed3ab65eb9d9c04e41b7804afdc7bba3ab09195129041e5655a13","observation_id":"d746555c-a006-4a4d-9404-4d5878ab8a2f","resolution":{"observed_at":"2026-08-15T20:59:10.988386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.992525Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.992525Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:17f1cf59d10470d80373bf33e6960c6e67193076506fc5f6b1a48366562c2f2f","observation_id":"131334fe-8c88-4760-9047-80e969dac600","resolution":{"observed_at":"2026-08-15T20:59:10.992525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:10.995663Z","title":"Vision- and-language navigation via causal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.995663Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4c41efa897c27ae834f78567f1204076ba644dcd66279613565f1c75f36c8e0b","observation_id":"3bdf7c7a-c675-42f4-b41c-a9caadf81c4c","resolution":{"observed_at":"2026-08-15T20:59:10.995663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.716889Z","title":"Hop+: History- enhanced and order-aware pre-training for vision-and-language navigation","venue":null,"work_id":"ca6cbe22-15b1-453d-b4fa-6eb6948a9bc7","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:10.998621Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:0db5c78e4d51f10e6eddb442ffc5a7f259bad2a458c97f636f95e9cab9fa37ba","observation_id":"eb7cb573-bf4a-4532-9ac4-ba7134ed269c","resolution":{"observed_at":"2026-08-15T20:59:11.720871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.706259Z","title":"Bird’s-eye-view scene graph for vision- language navigation","venue":null,"work_id":"d4822b2b-7a4f-49c1-9ef5-39b5bb9fa484","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.001793Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:480cbb3fa9fe65bfee89a5af2dc6ee7b6c22ced305cf32ac0c333bfc3d735ef7","observation_id":"2620a608-4819-4edf-b17a-1b0256c8985e","resolution":{"observed_at":"2026-08-15T20:59:11.709765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.004945Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.004945Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:cd07a0b56b2c3fd0a335044f41a0d3c454dbeaeda103bea69095a1be33d6a3c6","observation_id":"fe999097-561a-4e17-811a-ea95375f2453","resolution":{"observed_at":"2026-08-15T20:59:11.004945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.008702Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.008702Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:32b14c421b7122a2722c51c694148e3be464ccc3f2b28b7190ddfd2bbedbfb72","observation_id":"ba6d9897-ac8a-498f-827d-5d122622a9d3","resolution":{"observed_at":"2026-08-15T20:59:11.008702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.682167Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":"1ab67eba-ce77-49a5-a03e-358b8b3cc5e0","year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.011706Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:34b9d0ced09400cfd8a88f5e05f0f691892d8d088a24d4e08b135979fa4d2722","observation_id":"3826abaa-d65d-423e-90ed-837387ce4795","resolution":{"observed_at":"2026-08-15T20:59:11.685462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.015092Z","title":"Gridmm: Grid memory map for vision-and-language navigation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.015092Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:7925fb4cde2cdcfe8b3463a25c992dbf01b7d9b348496a93930dfaf39680e2fb","observation_id":"0dd1d137-ae3a-48d7-a8fd-b90898c06c12","resolution":{"observed_at":"2026-08-15T20:59:11.015092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.018222Z","title":"Etpnav: Evolving topological planning for vision-language navigation in continuous environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.018222Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:21a2abf2e4b8985c78e9d57cb26a1654350f2397122e8fa91c30e14047059a9f","observation_id":"32cf35d3-5940-4fe4-8d7c-d0e5f10a224b","resolution":{"observed_at":"2026-08-15T20:59:11.018222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.657965Z","title":"Bevbert: Multimodal map pre-training for language-guided navigation","venue":null,"work_id":"6467661f-c4d0-477c-b54d-16f7de1ef2a4","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.021346Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:ec7686f5157e80fc30fe2f994c1a785b08fa6ef2d6ba5664c7d995dff682b966","observation_id":"9026c242-c737-4e68-bdb4-8cb23b074a4f","resolution":{"observed_at":"2026-08-15T20:59:11.661909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.647410Z","title":"Sim-to-real transfer via 3d feature fields for vision-and-language navigation","venue":null,"work_id":"49c875c3-45f0-4002-aee5-e0f3b016df7a","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.024387Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:45b5863a27b2996fda68982d111e28b71e72472259dfc0b6e580269de706bdf8","observation_id":"6d3d0a0b-aaeb-4744-9d4f-1dbf17bd71f3","resolution":{"observed_at":"2026-08-15T20:59:11.650854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.636611Z","title":"Open-nav: Exploring zero-shot vision-and-language navigation in continuous environment with open-source llms","venue":null,"work_id":"6c847569-7981-423f-9790-3869469944aa","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.028544Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:fa3e4373f89f4263fd36a50dc520118d2ee73763c1569d09de4aea4e266cfb7a","observation_id":"3b312087-5dd7-42f7-ae1f-96e991bd4927","resolution":{"observed_at":"2026-08-15T20:59:11.640342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12366","last_updated":"2024-09-20T01:32:35Z","snapshot_observed_at":"2026-08-13T22:38:53.044751Z","submitted_at":"2024-07-17T07:44:26Z","title":"NavGPT-2: Unleashing Navigational Reasoning Capability for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12366","snapshot_observed_at":"2026-08-15T20:59:11.033358Z","title":"Navgpt-2: Un- leashing navigational reasoning capability for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.033358Z"},"links":{"cited_paper":"/paper/2407.12366","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:95a6264eae2ada5c51c12e9153c3d28de19598e7fe360d296674e007b1333ed9","observation_id":"0cfb4c6b-3c7b-40f8-8066-1e7ab584f861","resolution":{"observed_at":"2026-08-15T20:59:11.033358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.625337Z","title":null,"venue":null,"work_id":"6e8b402d-c720-46fc-aa2a-648b14985c64","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.037712Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:ad68e77e29d63d4fab509df16e1d6a5e7af05d5804707b18b13aee00b9765484","observation_id":"bf22fda2-2145-4d70-ab77-38def4453fd7","resolution":{"observed_at":"2026-08-15T20:59:11.629551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.613562Z","title":null,"venue":null,"work_id":"25a1f749-57f6-4a13-9ec1-d5f7bae03289","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.041499Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:eda646003e5d5308f5c07a880782d9b3fde94a175a242d29a59ec463dfffeeec","observation_id":"9f6a8151-3867-41fe-81e5-0f6fdbd0d5d9","resolution":{"observed_at":"2026-08-15T20:59:11.617339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.045479Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.045479Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e6a370b5a5fcf38d31a4855f0b44d59bccb959e84f7771099952c65cd53ca459","observation_id":"725ba98b-b1d8-4018-aa3a-29813f2fba55","resolution":{"observed_at":"2026-08-15T20:59:11.045479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.049094Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.049094Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:a06d59f83f07b26eb4cd7e30bbe5cd943c487bbd22fbc6a786d92081882bd39b","observation_id":"42c64cff-a0f4-41e9-a8e7-87ab19b0a4f7","resolution":{"observed_at":"2026-08-15T20:59:11.049094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.053125Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.053125Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:3992214f2d3108fd3eaf54d485b9e5a8bf6e70764d624ee90ae87e3f17e5d22e","observation_id":"a916a59d-7d46-48e3-aac3-24f8236b1d8c","resolution":{"observed_at":"2026-08-15T20:59:11.053125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-16T00:43:27.541826Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-15T20:59:11.056801Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.056801Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:7e72cc9dab123b3402387426d31211e1e75ce7ddc09d2277b1215ce0a1a5e7d6","observation_id":"b171e546-d8cd-4076-8a8f-7972e223fc3f","resolution":{"observed_at":"2026-08-15T20:59:11.056801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.575885Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":"8aa88dbd-e8a2-441c-837a-7a435f93fb58","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.061079Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:523087fe21866dd381e5dfc34a289aea10ab00b3248319a533efa1780304ecc0","observation_id":"8eecf82a-69cd-4065-92be-1720cb442572","resolution":{"observed_at":"2026-08-15T20:59:11.583760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-13T00:52:19.292622Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-15T20:59:11.064457Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.064457Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:d3bfbb827e637a2b10ea77958baf97e617181693dae4e346ee0645e5205d78d8","observation_id":"64c95c6e-091b-4714-81cf-6abfc2239f41","resolution":{"observed_at":"2026-08-15T20:59:11.064457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.068061Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.068061Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:07c4fba8a8cac0228d1c62a9877794917835846a788edda57629e7d6c74b4f84","observation_id":"c782b4a2-c2ee-4cfe-b079-3788ba651885","resolution":{"observed_at":"2026-08-15T20:59:11.068061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-12T23:13:45.948951Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-08-15T20:59:11.071380Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.071380Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:f6828c830f3bc5239a89fe3ccd089cc418bb563cc3805a0c76ad9e5c46f64cb8","observation_id":"950c6378-f069-49eb-9012-56ffe44cb7b6","resolution":{"observed_at":"2026-08-15T20:59:11.071380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T02:34:58.000053Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-15T20:59:11.074859Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.074859Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:2bde02e24ce497c05d94e6a0024ad0cacb293866984cfaaaa7de6464978855ab","observation_id":"346d152d-5f34-45c0-a6a0-ab946f40cebc","resolution":{"observed_at":"2026-08-15T20:59:11.074859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.554758Z","title":"Lookahead exploration with neural radiance representation for continuous vision-language navigation","venue":null,"work_id":"b763a63d-7e03-4d82-b9c2-2d4e8abe8710","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.078810Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:bb2fc6fef59d6c1a6102ccec8941af75232ef7ec1a897307ec181fda3863a707","observation_id":"14734b56-16dd-4f6c-a957-0ba37e13f1e0","resolution":{"observed_at":"2026-08-15T20:59:11.560550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07563","last_updated":"2024-11-26T10:31:15Z","snapshot_observed_at":"2026-08-15T17:49:27.773942Z","submitted_at":"2024-03-12T11:51:55Z","title":"Learning Generalizable Feature Fields for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07563","snapshot_observed_at":"2026-08-15T20:59:11.081771Z","title":"Learning generalizable feature fields for mobile manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.081771Z"},"links":{"cited_paper":"/paper/2403.07563","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:69bed92cf5a62244b11d8784fc0a31e0e73f221c4c435c36db8b402665615d3b","observation_id":"474084a7-5bbd-4641-92f0-e2fe4e7770e0","resolution":{"observed_at":"2026-08-15T20:59:11.081771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.085792Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.085792Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:89f929a69dc6f1cc32e3c5bece8a17fe99aa02af918e9509e0f0fcadc5907023","observation_id":"ecc44f67-62e1-4f06-9120-7508788c4a01","resolution":{"observed_at":"2026-08-15T20:59:11.085792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.089780Z","title":"Habitat- matterport 3d semantics dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.089780Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:e964a64d298973efdbab3b847e4e8b7c663f6714813105b18a409a1ec5e1ef79","observation_id":"35e81402-52cf-4eca-a141-d8ad255f3ee7","resolution":{"observed_at":"2026-08-15T20:59:11.089780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.526808Z","title":"Rio: 3d object instance re-localization in changing indoor environments","venue":null,"work_id":"c2f81847-fbfd-43b3-a3c8-ee477e73af68","year":2019},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.093803Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:c24ede7c9a98a625182fd3ea3070b81a27f9a1eeb3c5f2d5d86b11fb25f6d168","observation_id":"1c8ec00f-2ea0-492b-9143-af31ef56b098","resolution":{"observed_at":"2026-08-15T20:59:11.532040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.507838Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"2f393181-00cc-44d3-bf2f-8ecf5d0f56ee","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.098172Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:1ee3e92fa6b7c2d8e4edb25613a6ecf6966e2614bdbb0eceb643053d27679f5e","observation_id":"c4f3ca20-cb4a-47ad-843d-610c1d23d289","resolution":{"observed_at":"2026-08-15T20:59:11.517526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01223","last_updated":"2024-04-01T16:31:04Z","snapshot_observed_at":"2026-08-13T00:39:59.655011Z","submitted_at":"2024-04-01T16:31:04Z","title":"Feature Splatting: Language-Driven Physics-Based Scene Synthesis and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01223","snapshot_observed_at":"2026-08-15T20:59:11.102040Z","title":"Feature splatting: Language-driven physics-based scene synthesis and editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.102040Z"},"links":{"cited_paper":"/paper/2404.01223","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:b88a2c8d8ee3709e04e9e46f5e20c0b7ff772f9a5d7dc590f269e1519c01a586","observation_id":"5d428d5f-01d3-4f7f-b810-584d1861ed4b","resolution":{"observed_at":"2026-08-15T20:59:11.102040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.106040Z","title":"Xtuner: A toolkit for efficiently fine-tuning llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.106040Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:48a038c315ba938668dc6ed989fa8b2db6c70585fb767aa7e499ae873368a7bd","observation_id":"80f4a096-6e24-4429-aae3-3da3c5fb0227","resolution":{"observed_at":"2026-08-15T20:59:11.106040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T20:59:11.110249Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.110249Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:010fd086ce48dba576633911e5831fd2f991aecf5271fb855fff8e26ee67118e","observation_id":"c1f25e16-a2e5-4f69-a7bd-1be5f863865c","resolution":{"observed_at":"2026-08-15T20:59:11.110249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.484050Z","title":"Cross-modal map learning for vision and language navigation","venue":null,"work_id":"166039b3-9c9b-46ef-92ef-d26a7944dd84","year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.116507Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:33970ecf6999f70d68871102c3ddb80db41acdd7378eb7b325c3f0b73dafdff6","observation_id":"ee9c700a-27dd-4ec4-bc40-bd90809ce39b","resolution":{"observed_at":"2026-08-15T20:59:11.490076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.466551Z","title":"Weakly-supervised multi-granularity map learning for vision-and-language navigation","venue":null,"work_id":"60d6ab7f-a097-4ab6-b94d-9079dd6a5fb4","year":2022},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.122152Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:98a6793b29f797ab07047cff3165684c2193fba6da527162fe144cca3c64c2fa","observation_id":"0745b914-d419-47a4-8055-e89f749e0b04","resolution":{"observed_at":"2026-08-15T20:59:11.471819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.452830Z","title":"Instructnav: Zero-shot system for generic instruction navigation in unexplored environment","venue":null,"work_id":"bbf3cb0d-fa63-4e7a-9dce-1dd146ee06dc","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.126143Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:a195f0fb640089436a6e5007746a504ce1a03260c9166f0ebc0be86f07e14210","observation_id":"480992bc-787d-44d2-90d6-9fe4a143bf06","resolution":{"observed_at":"2026-08-15T20:59:11.456951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.440755Z","title":"Affordances-oriented planning using foundation models for continuous vision-language nav- igation","venue":null,"work_id":"f5825404-6e21-4fe9-9434-ca13a6fc57a2","year":2025},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.129374Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4ae4183e61977531c7523ac2bdd4f2571148b7f32c283b7908e23d5d5107d0ad","observation_id":"eeb33017-9d81-4ecc-ac59-29b2f28d52c1","resolution":{"observed_at":"2026-08-15T20:59:11.444755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.132492Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.132492Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:187ffd64b036fda5e1fb94f98e0514f910266c62401a8339825f2d40a36c4b99","observation_id":"8a683655-5628-45f2-840f-6cbd29249200","resolution":{"observed_at":"2026-08-15T20:59:11.132492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.421606Z","title":"Structured3d: A large photo-realistic dataset for structured 3d modeling","venue":null,"work_id":"3a75f09c-23dd-4011-9edb-7303fc74297d","year":2020},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.135977Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:01b50c541f248b503c64143243566089788df10781484db2a773556d500c686e","observation_id":"0e832c77-1435-4575-82fc-4d87149dd052","resolution":{"observed_at":"2026-08-15T20:59:11.425999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.406707Z","title":"Scaling data generation in vision-and-language navigation","venue":null,"work_id":"04e83fca-24a1-4545-a32f-68e760ea35a7","year":2023},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.142816Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:39ae29b236c8e9d0f09cac4f0c8fb35ebb2fa78471221587c2c90d3d089ffd27","observation_id":"d0d8957f-b1f3-40df-8ac2-c8058f3bad83","resolution":{"observed_at":"2026-08-15T20:59:11.412170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.148767Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.148767Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:329c3949b2618e346b82c9307717a004fa4f6291d5535b62bc950edaff4fd8ad","observation_id":"5bd952d9-d33d-4e06-a66b-e976435b16bf","resolution":{"observed_at":"2026-08-15T20:59:11.148767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.157244Z","title":"Adafactor: Adaptive learning rates with sublinear memory cost","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.157244Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:4ea6fe009b7ce0cc920a992db28e603f6f122beabc411738ff6dc124412fcf49","observation_id":"1ecbbded-bccb-4ae6-a056-5c7da6d6e675","resolution":{"observed_at":"2026-08-15T20:59:11.157244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-15T20:59:11.160541Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.160541Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:3cde085994eaf732baef36e257763205db6b8c57969c456dcd7a261276770cf2","observation_id":"1f72137b-27b2-4585-9596-37037a535bad","resolution":{"observed_at":"2026-08-15T20:59:11.160541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:11.380946Z","title":"Dynamem: Online dynamic spatio-semantic memory for open world mobile manipulation","venue":null,"work_id":"05baa371-4b49-4f55-8d83-529415c3f9e5","year":2024},"citing_paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:11.164370Z"},"links":{"citing_paper":"/paper/2505.11383"},"observation_digest":"sha256:85ab3169c40a37b96230c1bacaa4d5e97cd8f5cb3db7990bdd9909f83c3b14fd","observation_id":"3d4c7a5b-a3b9-4828-a977-cf88c588ed25","resolution":{"observed_at":"2026-08-15T20:59:11.384825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11383","last_updated":"2025-05-16T15:46:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T08:14:10.224936Z","submitted_at":"2025-05-16T15:46:27Z","title":"Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language Navigation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 6 inbound Pith citation observations for arXiv:2505.11383."}