{"as_of":"2026-08-11T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf5aa840aa6486bacefbfbbc7df80043db096560aa18870fdd5e562574742839","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T12:55:38.286333Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.01483/citation-record","integrity":"/paper/2510.01483/integrity","json":"/paper/2510.01483/citation-record.json","paper":"/paper/2510.01483"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:34.072800Z","title":"What’s in the image? a deep- dive into the vision of vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.072800Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:2c0833533694f972ab8448e75e500cc2dc0369aaa1359ed1d9949121781aaa6e","observation_id":"2862ee51-2e54-4592-9a76-7fb8eb6b3fb5","resolution":{"observed_at":"2026-08-04T12:55:34.072800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:34.132059Z","title":"A survey of attacks on large vision–language models: Resources, advances, and future trends,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.132059Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:c509b187eb792d3f85cff2a8759d1183c408bf8c7faae542e15a4b711ed9478e","observation_id":"c05d8d2b-87db-42fa-a69b-2a919781bbd7","resolution":{"observed_at":"2026-08-04T12:55:34.132059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02247","last_updated":"2025-07-19T03:44:28Z","snapshot_observed_at":"2026-08-10T23:21:20.795270Z","submitted_at":"2025-03-04T03:51:36Z","title":"WMNav: Integrating Vision-Language Models into World Models for Object Goal Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02247","snapshot_observed_at":"2026-08-04T12:55:34.218173Z","title":"Wmnav: Integrating vision-language models into world models for object goal navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.218173Z"},"links":{"cited_paper":"/paper/2503.02247","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:d304b989178fe486f91b5a46f15af55af0127551ec4774fde43f9acd5a0b07a2","observation_id":"e9062898-a49a-4f1a-bbfd-45d3a6611cca","resolution":{"observed_at":"2026-08-04T12:55:34.218173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:34.303423Z","title":"Robohop: Segment-based topological map representation for open-world visual navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.303423Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:30ed7da82776b62c6f903cc4ac42ec328264fefe759bdc8f7dabcea9f5887542","observation_id":"5c2774b3-a683-40c1-a955-99d17e8af306","resolution":{"observed_at":"2026-08-04T12:55:34.303423Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:34.476447Z","title":"Remembr: Building and reasoning over long-horizon spatio- temporal memory for robot navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.476447Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:793bff30c7f0d54bef957eb565276e5bf5ff9381f0c5a8bd3157f078a45170d5","observation_id":"596d5114-6f76-483d-801c-ddf7bc2ba0a4","resolution":{"observed_at":"2026-08-04T12:55:34.476447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T12:55:34.650458Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.650458Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:c612be910e0c65582ca33333cb03803c741e33388ca3e39f0d7c2567dcd1a984","observation_id":"dd7b7207-6111-44b2-8bac-a4c2b25b2653","resolution":{"observed_at":"2026-08-04T12:55:34.650458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T12:55:34.875572Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:34.875572Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:085b0fae398399a800e56584d550dfe2f1f8802d4c0f7a52195bc6f0c0016e59","observation_id":"0dd248c9-d9ec-49a5-aa09-af5e47b9d825","resolution":{"observed_at":"2026-08-04T12:55:34.875572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:35.126987Z","title":"Knowledge graphs as tools for explainable machine learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.126987Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:8d81e82c97754bf8413119c11cb9de44b4b6cfdb4c7ec6beb936a45bcd76899a","observation_id":"63623c47-158f-40ae-a6a0-0670d9df3e75","resolution":{"observed_at":"2026-08-04T12:55:35.126987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-11T09:47:06.410749Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-04T12:55:35.208142Z","title":"An introduction to vision-language modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.208142Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:61d4ff84af158514c805df2c69cdb82bdf6e09b31169d23001f3d525098cb8cf","observation_id":"e592f8e0-fd7f-4609-988e-70e8a3a81a67","resolution":{"observed_at":"2026-08-04T12:55:35.208142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-08-09T23:19:02.113499Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-04T12:55:35.364167Z","title":"A review of multi-modal large language and vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.364167Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:2e391a5eade336343836f9de955db0acbc377ca364f2cdb115cc8bfee6450f7c","observation_id":"a4878e1b-08ea-4c31-b93e-a8c591c66d13","resolution":{"observed_at":"2026-08-04T12:55:35.364167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:35.447877Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.447877Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:41bdbae63fd133c90e0c424450e7472e87c6049df51b1e384b7f3fb51b43af2b","observation_id":"8265fc70-8c06-4f98-b6d7-aefb098a4604","resolution":{"observed_at":"2026-08-04T12:55:35.447877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-04T12:55:35.566224Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.566224Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:a6c18d34303bb3728d6cdae9ec69ee9b4f898dd45391db1cb2ed5793a4e05f6c","observation_id":"dcf86852-90e1-416f-b5df-7fd51a8ead70","resolution":{"observed_at":"2026-08-04T12:55:35.566224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-07-06T18:05:11.700127Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-04T12:55:35.673692Z","title":"From local to global: A graph rag approach to query-focused summa- rization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.673692Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:0bdaa26d7692fa9a7887e6115347aaf7def099c62ab99c9bc8422c9e2376a83c","observation_id":"71f62a9d-841b-448e-8922-1ea5b4dfe34c","resolution":{"observed_at":"2026-08-04T12:55:35.673692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:35.845742Z","title":"Vision-language navigation: a survey and taxonomy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.845742Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:4ae85457391cec7625dc4bb12ce1837ba08c71fff212d211ce659be8d14bbadb","observation_id":"b9fea18f-f772-4ead-9e5a-3534a4387c80","resolution":{"observed_at":"2026-08-04T12:55:35.845742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:35.972929Z","title":"Visual language maps for robot navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.972929Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:2bc2e1b2591457c8595ad9309f9dddbf1e15e0c3585861fdadf9d01426921a4c","observation_id":"bc472ae9-a3e8-4fda-8518-cc4dc4c27626","resolution":{"observed_at":"2026-08-04T12:55:35.972929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.195331Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for percep- tion and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.195331Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:da25dfaf3e374c9b77e9db6a6831d9e28c835b88d3b3bdcf1ba41efbbc4d1af7","observation_id":"5e705b18-f9fe-448b-97ba-c4b9e99205e4","resolution":{"observed_at":"2026-08-04T12:55:36.195331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.280706Z","title":"Lm-nav: Robotic nav- igation with large pre-trained models of language, vision, and action,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.280706Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:64941db74f06b13c7a153ca41a1a08d1b87a3ca6c4fd7222b44bc34a55823ec3","observation_id":"1594f410-90bf-4a8b-b3d3-4c3b1f3d41e3","resolution":{"observed_at":"2026-08-04T12:55:36.280706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.428913Z","title":"Spoc: Imitating shortest paths in simulation enables effective navigation and manipulation in the real world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.428913Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:b30ce5a0b008f9ae80feabaa55155b294a013145f556a37d7696e49db8b66363","observation_id":"8298bd73-6d33-400b-9a42-3a9921412540","resolution":{"observed_at":"2026-08-04T12:55:36.428913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.577870Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.577870Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:abe4805b6413d34a64629e2305cef04db0e444ea50b774c153f6a0ae664b585c","observation_id":"e218d8cb-b458-4711-945a-09f15c232324","resolution":{"observed_at":"2026-08-04T12:55:36.577870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.634278Z","title":"Speaker-follower models for vision-and-language navigation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.634278Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:7a8dcadbd04d2f7b0e1df65a87814fddadf649438b16f2f920a35a9dc281767a","observation_id":"96487b6c-29de-4b3d-bce5-bb4d1c58a920","resolution":{"observed_at":"2026-08-04T12:55:36.634278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.675590Z","title":"Reinforced cross- modal matching and self-supervised imitation learning for vision- language navigation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.675590Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:12acc5b7fabfaf742651a0821fce45c9c413b7e5533590924c2850950bfc9d3b","observation_id":"22144266-9b46-4840-b3b4-75c5591553e9","resolution":{"observed_at":"2026-08-04T12:55:36.675590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.743665Z","title":"Cows on pasture: Baselines and benchmarks for language- driven zero-shot object navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.743665Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:2ee9fa7bcdcc048471a9335148d29eaef6ae649a519e3aac0a2e9823e1ad3589","observation_id":"aecd7e5c-30a6-488a-813a-605a235bb2a8","resolution":{"observed_at":"2026-08-04T12:55:36.743665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.777749Z","title":"Navrag: Generat- ing user demand instructions for embodied navigation through retrieval-augmented llm,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.777749Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:f0bc31594277421d54821b825a16cbc0379bbde35ec63dfdb692f3044331e612","observation_id":"fb27c526-5343-4336-b6f2-d97293cbcd3a","resolution":{"observed_at":"2026-08-04T12:55:36.777749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:36.879638Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.879638Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:39e4866dde93fea1551736e3d46a930e116ad8a99f62b0a36285cec5e946a956","observation_id":"354415b1-860f-409c-8a40-76f030aaa081","resolution":{"observed_at":"2026-08-04T12:55:36.879638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08791","last_updated":"2025-07-22T21:17:17Z","snapshot_observed_at":"2026-08-09T07:29:36.731881Z","submitted_at":"2025-02-12T21:07:10Z","title":"VL-Explore: Zero-shot Vision-Language Exploration and Target Discovery by Mobile Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08791","snapshot_observed_at":"2026-08-04T12:55:36.951077Z","title":"Cliprover: Zero-shot vision-language exploration and target discovery by mobile robots,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:36.951077Z"},"links":{"cited_paper":"/paper/2502.08791","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:8c06557775eefea99bc3cc83b1c0b359e0502a074be89bc4bf7e908c359aed9f","observation_id":"21ff231f-62c2-49e2-aa14-f6135ba3ff27","resolution":{"observed_at":"2026-08-04T12:55:36.951077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.004270Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.004270Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:159d16f14075cde7455558f90f8139195258569b2dbb494df7dc1e713899013c","observation_id":"1f36d528-1199-4896-8cf8-17ff717c6403","resolution":{"observed_at":"2026-08-04T12:55:37.004270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.074529Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.074529Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:3dab9640696ad5bca286f6aa8b21f3281656d737544592082fb8f6d8a76c6281","observation_id":"3a20bb74-d26a-4d93-b38e-73b192d8a943","resolution":{"observed_at":"2026-08-04T12:55:37.074529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.197153Z","title":"Uni-navid: A video-based vision- language-action model for unifying embodied navigation tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.197153Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:e6a7b40aa991820f45ecf342da9fd7b49e4d8d730cc4b9e465ed6a6d468dc78c","observation_id":"34c1664c-e6be-493d-8114-f9a9b1626980","resolution":{"observed_at":"2026-08-04T12:55:37.197153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.207593Z","title":"Conceptfusion: Open-set multimodal 3d mapping,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.207593Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:b463728cd42480221d8d26172ad4d190cdb3200fe786187ea2df02e5f232e281","observation_id":"a37219ec-9233-4ce4-a7f7-fb2ff0a3871f","resolution":{"observed_at":"2026-08-04T12:55:37.207593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17044","last_updated":"2025-08-23T14:45:48Z","snapshot_observed_at":"2026-08-05T17:00:50.437651Z","submitted_at":"2025-08-23T14:45:48Z","title":"M3DMap: Object-aware Multimodal 3D Mapping for Dynamic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17044","snapshot_observed_at":"2026-08-04T12:55:37.264433Z","title":"M3dmap: Object-aware multimodal 3d mapping for dynamic environments,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.264433Z"},"links":{"cited_paper":"/paper/2508.17044","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:64408ea41aba6e3bfe56ee01a18b99e044b83cf10ba7800fa4b4aa7bc5228672","observation_id":"5add74e7-09ff-4818-9b2b-fd27874a5de1","resolution":{"observed_at":"2026-08-04T12:55:37.264433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.413714Z","title":"3d scene graph: A structure for unified seman- tics, 3d space, and camera,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.413714Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:f19eb8f66f9123b3b01c3d7134bf6d33f02adf4f93f7de3d2d19bc3e08b2c5a7","observation_id":"8eb47a7b-cf00-4e2c-9efd-a4f31cd9840b","resolution":{"observed_at":"2026-08-04T12:55:37.413714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13360","last_updated":"2022-06-20T21:54:36Z","snapshot_observed_at":"2026-08-10T13:34:10.316437Z","submitted_at":"2022-01-31T17:15:41Z","title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13360","snapshot_observed_at":"2026-08-04T12:55:37.539746Z","title":"Hydra: A real-time spatial perception system for 3d scene graph construction and optimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.539746Z"},"links":{"cited_paper":"/paper/2201.13360","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:2b86a36304c4d03e875ae6e614009dea12f5f6cf6b606c299ecaaa7b6e644ddc","observation_id":"d1cd8322-1a68-4206-bc63-811b6e295d78","resolution":{"observed_at":"2026-08-04T12:55:37.539746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.657552Z","title":"Clio: Real-time task-driven open-set 3d scene graphs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.657552Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:dedd21b0220ff5ad85b82f20a2e8c41632ecb4aebbc97efec74204314371e393","observation_id":"c2c6553b-eb59-4a20-a0f2-1514a11cd4bc","resolution":{"observed_at":"2026-08-04T12:55:37.657552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.840540Z","title":"Ving: Learning open-world navigation with visual goals,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.840540Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:bc446e8d50234052bc81ab8a85542d96d6b4090590bf33cf91d9ed7b40f3c282","observation_id":"a244d7f0-ad78-4135-884f-fdd2693559d1","resolution":{"observed_at":"2026-08-04T12:55:37.840540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.905887Z","title":"Graph database applications and concepts with neo4j,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.905887Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:78b86b2494a212165d67058cb9761440b7e781329757561b814063001cc42725","observation_id":"0eeb7d70-84f1-422c-9a0a-4574a0b76dbf","resolution":{"observed_at":"2026-08-04T12:55:37.905887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:37.977019Z","title":"Vint: A foundation model for visual navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:37.977019Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:06cb710a55e9934cb0416d0b5c003fa85ae59f70ce74ff1c9a62016b678457ad","observation_id":"181c4784-57fe-452c-819f-374e9b1060be","resolution":{"observed_at":"2026-08-04T12:55:37.977019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:38.038485Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:38.038485Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:95a8db123ac792bf24bdb5f6540a851f6bf4cd06037ac2558707243562f8b140","observation_id":"789c8329-2cae-450e-81df-e3a95ae41162","resolution":{"observed_at":"2026-08-04T12:55:38.038485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21282","last_updated":"2026-04-19T13:43:39Z","snapshot_observed_at":"2026-08-05T20:01:00.305386Z","submitted_at":"2025-05-27T14:51:34Z","title":"EgoWalk: A Multimodal Dataset for Robot Navigation in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21282","snapshot_observed_at":"2026-08-04T12:55:38.105187Z","title":"Egowalk: A multimodal dataset for robot navigation in the wild,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:38.105187Z"},"links":{"cited_paper":"/paper/2505.21282","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:bc1a2f321d0612100e1f1a856c196ef2acdd52d1c95d9aebfaf884df4a97723f","observation_id":"2d7d1e6a-f3bf-4e63-a94f-a100b1feedc2","resolution":{"observed_at":"2026-08-04T12:55:38.105187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:38.197025Z","title":"Slam toolbox: Slam for the dynamic world,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:38.197025Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:a9f3120092768adc12e92769588622c3f8b4f7f2d7c639b2e83b677eee3ec8ae","observation_id":"45a55133-aecb-46ac-9e6c-00937109ee96","resolution":{"observed_at":"2026-08-04T12:55:38.197025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T12:55:38.286333Z","title":"Ros navigation: Concepts and tutorial,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:38.286333Z"},"links":{"citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:beb59a6dcdb21ab91728820386c0695783130c3d5e5ced28f433c340d3ee998c","observation_id":"a795cf78-473f-41d2-be04-27c3b471bd4a","resolution":{"observed_at":"2026-08-04T12:55:38.286333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2510.01483."}