{"as_of":"2026-08-08T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:305d82679686626b688d7d9db4cf3d50227c063257524e6f81cb9f573f11a1e0","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:41:52.473153Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14586/citation-record","integrity":"/paper/2607.14586/integrity","json":"/paper/2607.14586/citation-record.json","paper":"/paper/2607.14586"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:48.500807Z","title":"HM3D- OVON: A dataset and benchmark for open-vocabulary object goal navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:48.500807Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:c4eec4c894c71cafbd9990ca273a9bfeb433041ce62d956e0fc71b647c2723ac","observation_id":"18a3fdb3-4f74-4a0e-acdd-06fce3c33428","resolution":{"observed_at":"2026-08-02T01:41:48.500807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:48.673352Z","title":"GOAT-Bench: A benchmark for multi-modal lifelong navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:48.673352Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:59516d36e2db5ec1ec23720721de1334a40f64776c701d22e623237370a61a76","observation_id":"f9b56fb0-b2b5-417e-b0a8-d256ce72b834","resolution":{"observed_at":"2026-08-02T01:41:48.673352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04034","last_updated":"2025-03-08T01:37:47Z","snapshot_observed_at":"2026-08-03T22:29:46.696330Z","submitted_at":"2024-08-07T18:30:18Z","title":"Task-oriented Sequential Grounding and Navigation in 3D Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04034","snapshot_observed_at":"2026-08-02T01:41:48.849680Z","title":"Task-oriented sequential grounding and navigation in 3D scenes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:48.849680Z"},"links":{"cited_paper":"/paper/2408.04034","citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:1f76ae6c4fcadee3600af60010dc5c828bf5a2f919fc95fcee1cb32d27d63500","observation_id":"eadc8c0c-5395-45cd-9797-00c5b107faed","resolution":{"observed_at":"2026-08-02T01:41:48.849680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.022785Z","title":"Object goal navigation using goal-oriented semantic exploration,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.022785Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:df11c723ae90efcfb1bc7f7359c2ed7b0033c07df8a6b65a31c9423084a62dbc","observation_id":"e0f17fa7-441f-42a7-a952-368e7d833415","resolution":{"observed_at":"2026-08-02T01:41:49.022785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.144127Z","title":"VLFM: Vision-language frontier maps for zero- shot semantic navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.144127Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:06a25ce42e13be929e79d2b72365ef760ea0b654f57d4b8bce6771f846ab5dd4","observation_id":"4c796ac1-d23e-45b0-b045-ec58a7283cb8","resolution":{"observed_at":"2026-08-02T01:41:49.144127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.291227Z","title":"Move to understand a 3D scene: Bridging visual ground- ing and exploration for efficient and versatile embodied navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.291227Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:872732957919ce25660ad03a6cde7b203eb66a1686329fdaa4fb815d89d804a6","observation_id":"8a067809-8a12-46ae-aa37-5bb25bb21965","resolution":{"observed_at":"2026-08-02T01:41:49.291227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.436063Z","title":"Unifying 3D vision-language understanding via prompt- able queries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.436063Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:54098f546b742520556ff888615f35871202dfcdcd0a511ad369a8f5faf31c92","observation_id":"50a43686-fe47-4752-9f7b-62aac0e018f3","resolution":{"observed_at":"2026-08-02T01:41:49.436063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.573559Z","title":"NavGPT: Explicit reasoning in vision- and-language navigation with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.573559Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:8ba5fddd51b53286c04f0ee1659d4d35ba9029db3033e05efefc0c72046f9093","observation_id":"3d527683-1a5e-4d70-b51b-fc4b5c3fe068","resolution":{"observed_at":"2026-08-02T01:41:49.573559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.701297Z","title":"NaVid: Video-based VLM plans the next step for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.701297Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:87c9afb7ac4964b088c95a883a6b21a312e7150c3d74398bb1a4db9f4197588e","observation_id":"5aa67a84-1514-45aa-b566-4eae579fd2a3","resolution":{"observed_at":"2026-08-02T01:41:49.701297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:49.873639Z","title":"L3MVN: Leveraging large language models for visual target navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:49.873639Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:0f0d209358dc654f40fa296867beeb3894a091f7064710e4b78b2e7588474b60","observation_id":"dce93dd5-08cb-4fd7-8c8e-71b966f293d7","resolution":{"observed_at":"2026-08-02T01:41:49.873639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.039088Z","title":"SayNav: Grounding large language models for dynamic planning to navigation in new environments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.039088Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:0a59d3449027f99f4ee815686ad91dcf4d73dcbc8b4ccd609e55c922a20ad98d","observation_id":"69f1c1d8-2f6f-4429-a47c-f4ca7c899a6a","resolution":{"observed_at":"2026-08-02T01:41:50.039088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.157628Z","title":"SG-Nav: Online 3D scene graph prompting for LLM-based zero-shot object navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.157628Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:b73d888ac78e5c131e9f19948c3eab2fce6dde63195432b61508b5f1715f253c","observation_id":"892e9a91-5e9e-48ad-8e2b-d1d3b5a24d47","resolution":{"observed_at":"2026-08-02T01:41:50.157628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.256336Z","title":"A frontier-based approach for autonomous exploration,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.256336Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:0a0802e269a19c6683f138aec5c61e087c894b735d01f5fd4e1d44d840860253","observation_id":"79a23742-38c4-4ea3-91ac-b217f9128ac8","resolution":{"observed_at":"2026-08-02T01:41:50.256336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.349270Z","title":"PONI: Potential functions for ObjectGoal navigation with interaction-free learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.349270Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:99782987e39d8c2604eb1d992e7c456b438ec3b56862d3aefad6d963e60be486","observation_id":"fc107c30-578f-49fe-ac81-c41f2db81e81","resolution":{"observed_at":"2026-08-02T01:41:50.349270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.444445Z","title":"PIRLNav: Pre- training with imitation and RL finetuning for ObjectNav,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.444445Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:cfd45eeb57fac18586ca5266095fcac7dc197bbf83331f28a69bf57356f24945","observation_id":"da2cbd47-b561-478a-b215-033197827d8c","resolution":{"observed_at":"2026-08-02T01:41:50.444445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.542590Z","title":"Uni-NaVid: A video-based vision-language-action model for unifying embodied navigation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.542590Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:8f8a0e1bd35847f0e71fcd1c74ee20b19f78ef164333cdf55af287921fd72ace","observation_id":"09e1a243-b281-4ec8-b3e7-5648140213bb","resolution":{"observed_at":"2026-08-02T01:41:50.542590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.628115Z","title":"V oroNav: V oronoi-based zero-shot object navigation with large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.628115Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:9c322e76f4fb0290517402084a214a0446ff82ca04b95b8824ee1a12d55205d2","observation_id":"6a3d1d78-6de2-4ea9-ab8d-aa01ba6f415d","resolution":{"observed_at":"2026-08-02T01:41:50.628115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.724452Z","title":"MapGPT: Map-guided prompting with adaptive path planning for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.724452Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:ca365917bcab68f8daed6f334cfca41e1acce87a3d26478b49d67f43ac5196a9","observation_id":"802f9793-758c-4bf7-977d-bc16ec2717fb","resolution":{"observed_at":"2026-08-02T01:41:50.724452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.790386Z","title":"ESC: Exploration with soft commonsense constraints for zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.790386Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:74034f8f73ff5b5b4dd21ecd812f1bbe2930bb673dce245f9877e001eea60db5","observation_id":"498b2f0e-96c6-4f64-a22a-dc8358fbb9a0","resolution":{"observed_at":"2026-08-02T01:41:50.790386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.867928Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.867928Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:951528774dfbc684db4289e754adb7decfb9498d66daf85be188fd7fc51b62d2","observation_id":"24574323-eae1-4655-80a9-1195d1452786","resolution":{"observed_at":"2026-08-02T01:41:50.867928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:50.920017Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:50.920017Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:5376282ec457244d5e4de700b30ffd2262094ba60da186608801f42acc0485da","observation_id":"9e2fba9b-0600-4a47-887f-d57a4a4582dd","resolution":{"observed_at":"2026-08-02T01:41:50.920017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.006655Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.006655Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:738116afcf450a912f47b5e219efebc2defc285c7f5366d79ece2db0e8d924ef","observation_id":"6c8710cb-484d-441d-8c36-40d5c00b95ea","resolution":{"observed_at":"2026-08-02T01:41:51.006655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.065132Z","title":"3D-LLM: Injecting the 3D world into large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.065132Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:ca2101c257fbd0eb9336e8f727112c29dec17c1979d476b3ea768b2a092405ec","observation_id":"b29a0332-5521-4879-b866-2c8ecbf728ad","resolution":{"observed_at":"2026-08-02T01:41:51.065132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.157750Z","title":"An embodied generalist agent in 3D world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.157750Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:7bc704c7265e47a6d9b745ce517589fdb435e9ee0f04fde55f43fe62a75e2730","observation_id":"08cbdb82-3867-4f6f-b8e6-85aead536ee5","resolution":{"observed_at":"2026-08-02T01:41:51.157750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.255377Z","title":"LL3DA: Visual interactive instruction tuning for omni- 3D understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.255377Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:b87e419d0f96d4a88de64280eb0c6a4533f9661be96b940c4bfc54ccaf7bf5a7","observation_id":"e34d34f8-d4b2-4fb4-af0b-4e5b6366163d","resolution":{"observed_at":"2026-08-02T01:41:51.255377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.351345Z","title":"EmbodiedGPT: Vision-language pre-training via em- bodied chain of thought,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.351345Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:9552f1f7b9ac34bcdf7c669438bea7bdfbe6e1f2b24b4d8707324aaf4d69ed7b","observation_id":"9487fa09-aa21-4e69-8356-ece45640f4d8","resolution":{"observed_at":"2026-08-02T01:41:51.351345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.444318Z","title":"Dynam3D: Dynamic layered 3D tokens empower VLM for vision-and-language navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.444318Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:d289e426e4d577f40bc3fa929f27f37268de43497bb9fd64faa8aecbc52431f4","observation_id":"384b949d-474e-4ee8-aa98-4e388da0437a","resolution":{"observed_at":"2026-08-02T01:41:51.444318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.535275Z","title":"AstraNav-Memory: Contexts compression for long memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.535275Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:7767fe1ea57c23a650338035838d2b824acc78e03b2b3e1fb6d461ae3c64b6be","observation_id":"ac9517b3-6973-40af-8537-4165a3d72d82","resolution":{"observed_at":"2026-08-02T01:41:51.535275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T01:41:51.639055Z","title":"Siméoni et al., “DINOv3,”arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.639055Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:8f29fa568789191e2c9e0c641d072fea2a0be059361bd1cd90f989b0a6cb7dcd","observation_id":"396570cb-60cd-49dc-b30b-6293bab5e135","resolution":{"observed_at":"2026-08-02T01:41:51.639055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T01:41:51.731349Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.731349Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:04610ac863790856a0a0febe50b211b1ad80e7e62d777171d3b13bf34d439bf5","observation_id":"091fa90e-0c94-4c79-a71b-30384284b95c","resolution":{"observed_at":"2026-08-02T01:41:51.731349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.859604Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.859604Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:9468ee5ac08bf8c4c37f56eb94381ba471665a9d090750ca1aca4497de526aef","observation_id":"eee35148-b0bf-4a26-ba8a-f59e8a7f2822","resolution":{"observed_at":"2026-08-02T01:41:51.859604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:51.952688Z","title":"Habitat: A platform for embodied AI research,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:51.952688Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:e40dd2a700e5486157c501abc56211e4b7a27186e79f0a350d010ed1707548bc","observation_id":"8d1a3746-65ce-4bce-a4be-876c4a5f6a2d","resolution":{"observed_at":"2026-08-02T01:41:51.952688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.050418Z","title":"The design of stretch: A compact, lightweight mobile manipulator for indoor human environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.050418Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:5917b9a7182b3aa785d6c4745532ada8d3779b9b51de168b744682778c4b6e34","observation_id":"cc49ba36-6586-4ca4-96c2-dfda73da8a48","resolution":{"observed_at":"2026-08-02T01:41:52.050418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.146704Z","title":"TANGO: Training- free embodied AI agents for open-world tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.146704Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:d802568bdb14d75c2c45b65f6343068ec662b8529afd6cdebf3a4d93a9a7984e","observation_id":"7e48a6d5-2dde-493f-9901-72f9c75493a3","resolution":{"observed_at":"2026-08-02T01:41:52.146704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.243259Z","title":"MSGNav: Unleashing the power of multi-modal 3D scene graph for zero-shot embodied navigation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.243259Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:25659fab706fd22be6dc0dd0fee55c0073039b2371e40c7eb512be194bc33fa3","observation_id":"6e30485e-cbee-4082-a043-3c7a8f232d83","resolution":{"observed_at":"2026-08-02T01:41:52.243259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.342874Z","title":"Cows on pasture: Baselines and benchmarks for language-driven zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.342874Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:813ec18ccc5db0429f348f68b4dc5adb2a02f7e1e63e65e0a79e3a72fa0ad87e","observation_id":"3f91037b-3f67-4718-8b22-302b24b279ee","resolution":{"observed_at":"2026-08-02T01:41:52.342874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:41:52.473153Z","title":"Embodied VideoAgent: Persistent memory from ego- centric videos and embodied sensors enables dynamic scene under- standing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:41:52.473153Z"},"links":{"citing_paper":"/paper/2607.14586"},"observation_digest":"sha256:971228b140c9fec6dbf571b263d2255dce209628a478f9186d5c321dda991f7b","observation_id":"24499448-6823-4f3b-a2b8-66be4601a539","resolution":{"observed_at":"2026-08-02T01:41:52.473153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14586","last_updated":"2026-07-16T05:32:52Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T20:07:02.765521Z","submitted_at":"2026-07-16T05:32:52Z","title":"SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.14586."}