{"as_of":"2026-08-10T11:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fa1abfe8cbf2e582b750577c0d43845cc9124fcfd584a7acb14854120f3f612","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:55:47.906837Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:21:23.668559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T18:43:16.526891Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"cited_work":{"arxiv_id":"2506.01174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01174","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Graphpad: Inference- time 3d scene graph updates for embodied question answering","venue":null,"work_id":"b0ceeb8b-2cf6-4d08-ae0f-e5fc0c05587a","year":2025},"citing_paper":{"arxiv_id":"2512.24985","last_updated":"2026-05-12T10:54:09Z","snapshot_observed_at":"2026-07-06T22:40:27.178487Z","submitted_at":"2025-12-31T17:31:29Z","title":"DarkQA: Benchmarking Vision-Language Models on Visual-Primitive Question Answering in Low-Light Indoor Scenes","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T18:42:01.266249Z"},"links":{"cited_paper":"/paper/2506.01174","citing_paper":"/paper/2512.24985"},"observation_digest":"sha256:dcd71e34d05e75995ce78e435e16fc9b0972eb73f0b550abbc4c445d32ec760e","observation_id":"b59e730b-2f7b-4f27-8a8a-66afeaaebb0b","resolution":{"observed_at":"2026-05-16T18:43:16.530077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01174","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"Graphpad: Inference- time 3d scene graph updates for embodied question answering.arXiv preprint arXiv:2506.01174, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2506.01174","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:5898b6ac0fb320583d1dd69de6fb4baddf4dfd19e8a0d1421a0947226672096c","observation_id":"74fe9ae1-1a1f-43fa-897c-01420579a064","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01174","snapshot_observed_at":"2026-08-02T07:21:23.668559Z","title":"Graphpad: Inference- time 3d scene graph updates for embodied question answering.arXiv preprint arXiv:2506.01174, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:23.668559Z"},"links":{"cited_paper":"/paper/2506.01174","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:9ea72a62891a84581b5b63bcb84f21261d414411cfe53a0ea32133f5fdf4101e","observation_id":"de8d181f-585d-4723-a00f-67c6da80fcba","resolution":{"observed_at":"2026-08-02T07:21:23.668559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01174/citation-record","integrity":"/paper/2506.01174/integrity","json":"/paper/2506.01174/citation-record.json","paper":"/paper/2506.01174"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.13682","last_updated":"2024-09-20T17:50:07Z","snapshot_observed_at":"2026-07-06T19:18:53.582890Z","submitted_at":"2024-09-20T17:50:07Z","title":"ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13682","snapshot_observed_at":"2026-08-07T11:55:47.748673Z","title":"Remembr: Building and reasoning over long- horizon spatio-temporal memory for robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.748673Z"},"links":{"cited_paper":"/paper/2409.13682","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:a2d87d0183339d8fde4345f0261d42b649b13c7e2542fa4fae5e304dcdce6b32","observation_id":"1174e00a-b0d5-4e92-a807-536de7581f9b","resolution":{"observed_at":"2026-08-07T11:55:47.748673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-07-06T18:44:20.262496Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-07T11:55:47.755002Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.755002Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:93871d80e1247b18a6271bc48dc97c7bbd0b219570e4b877af3f6d5395e621f9","observation_id":"8350be29-6b15-4fc8-91eb-b4463f5830ee","resolution":{"observed_at":"2026-08-07T11:55:47.755002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.617565Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"a3f515ba-6934-473a-9d8f-23e8243c5dc6","year":2017},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.760646Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:8f951c70a2d1d89c25d8c61abc7541809c312ac1a90817e79ba4d8530d8b927d","observation_id":"4eecb41f-eb91-4635-a216-377be90d8fb4","resolution":{"observed_at":"2026-08-07T11:55:48.623774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.599852Z","title":"Embodied question answer- ing","venue":null,"work_id":"e14f0dc2-5a38-40e8-baaf-1b5277eed6e6","year":2018},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.766424Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:55105b272a6eb0f5a97f630343271c27e85c3ca86042bb207e4f7c194d9bfff5","observation_id":"64eb14ae-da12-4bc2-ba66-1501ac3a69d3","resolution":{"observed_at":"2026-08-07T11:55:48.605139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:47.772601Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.772601Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:cb8e96e1b520f51752802c65b9bc945fd6fe88480ba8c886a134f99948a24785","observation_id":"5de05476-00cd-4ebc-aeb9-be3019f64fd8","resolution":{"observed_at":"2026-08-07T11:55:47.772601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.568749Z","title":"Collaborative dynamic 3d scene graphs for automated driving","venue":null,"work_id":"901149a1-b4f3-433b-ad31-3d886251fba4","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.777770Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:a98b765e4cdfc73b2fafed742900b072a8cf92a35c8163134549780db2fdeeb1","observation_id":"26df55e3-2351-4399-a4bc-0009350d7f6e","resolution":{"observed_at":"2026-08-07T11:55:48.575441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.541185Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for per- ception and planning","venue":null,"work_id":"90e5d385-c497-4768-bef9-a4d33bf4eb5e","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.783791Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:5b8b897bc54b7e6c95dc9e573abc96a7dbf29d32384c604bf8df40960ea9a849","observation_id":"73fdd160-d210-4f88-ae05-9f78282dcb30","resolution":{"observed_at":"2026-08-07T11:55:48.547389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.520015Z","title":"Language-grounded dy- namic scene graphs for interactive object search with mobile manipulation","venue":null,"work_id":"3ec978e5-5a56-4aa1-802d-977f09e65da3","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.789648Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:9855990425da05b2f9c8c49ec547c24899da179f93b21df8e09635423e7e2290","observation_id":"6dde27aa-ac8c-4d5f-a325-372b2ffa14b3","resolution":{"observed_at":"2026-08-07T11:55:48.526347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.501234Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"4ffdd264-a6d3-416f-b118-5827a5c2e9eb","year":2023},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.794594Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:1340822a8f0cf17910377533ecc30e6d451ccc9b038b0d1b121cf2b4cb31e103","observation_id":"74110899-9882-4d4b-8a74-49ba6c38b7b1","resolution":{"observed_at":"2026-08-07T11:55:48.507288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13360","last_updated":"2022-06-20T21:54:36Z","snapshot_observed_at":"2026-08-06T11:45:35.114773Z","submitted_at":"2022-01-31T17:15:41Z","title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13360","snapshot_observed_at":"2026-08-07T11:55:47.799528Z","title":"Hy- dra: A real-time spatial perception system for 3d scene graph construction and optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.799528Z"},"links":{"cited_paper":"/paper/2201.13360","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:f38da3d1e54198730e02b337067722bcbecfb1f3247b3e35769995643c15aa61","observation_id":"5e2a6b3c-8dd5-404c-a931-389712ccbaaf","resolution":{"observed_at":"2026-08-07T11:55:47.799528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.482733Z","title":"Llm-enhanced scene graph learning for household rearrangement","venue":null,"work_id":"ee237e36-9d93-4a5d-be48-b87ab10dd95f","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.804749Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:8a129fc28f8f348fb7e9f2549d96cdd62c07a1049755357f63566acfb45defda","observation_id":"b881dd2c-6365-4589-98f4-4e2947046a06","resolution":{"observed_at":"2026-08-07T11:55:48.488628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04999","last_updated":"2025-05-29T13:57:04Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:59:27Z","title":"DynaMem: Online Dynamic Spatio-Semantic Memory for Open World Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04999","snapshot_observed_at":"2026-08-07T11:55:47.809537Z","title":"Dynamem: Online dynamic spatio-semantic mem- ory for open world mobile manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.809537Z"},"links":{"cited_paper":"/paper/2411.04999","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:0a8f256e62e185b305d527ea7ef75747ab64208597c8627f1c03603e459005b8","observation_id":"fe3536f7-99fa-4437-9d5f-8f292014dcd6","resolution":{"observed_at":"2026-08-07T11:55:47.809537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13696","last_updated":"2024-09-26T20:34:51Z","snapshot_observed_at":"2026-07-06T18:03:19.407231Z","submitted_at":"2024-04-21T15:50:40Z","title":"Clio: Real-time Task-Driven Open-Set 3D Scene Graphs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13696","snapshot_observed_at":"2026-08-07T11:55:47.814614Z","title":"Clio: Real-time task-driven open-set 3d scene graphs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.814614Z"},"links":{"cited_paper":"/paper/2404.13696","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:50ec1aefb9b381d3a9c192feb10da4fbdfa8e49c298bde9167139a8fd88b7fa3","observation_id":"4ffe43d1-26d9-4a9c-8076-0bc1b7cb361c","resolution":{"observed_at":"2026-08-07T11:55:47.814614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.461958Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"c4364baf-91bd-4f79-9b1f-5d578df7df71","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.820865Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:3c8159320719cf5b3b271410b94937189f8fe97afaccc503de0e39d6056dce16","observation_id":"a5d11a5e-ead0-49e5-8b27-d417b8255818","resolution":{"observed_at":"2026-08-07T11:55:48.468306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:47.825579Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.825579Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:36297661d01c2e2f83a485627b75c2d677012e3513c12dfd3f8ab2d16cd05107","observation_id":"555e71cb-7832-48d4-b7b6-9fdafb3c7575","resolution":{"observed_at":"2026-08-07T11:55:47.825579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.431587Z","title":"Introducing Gemini 2.0: our new AI model for the agen- tic era","venue":null,"work_id":"47523d0c-a48c-4241-ac7f-ea5a9a3ca87c","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.830384Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:ed8b756bc4a91dc869484112e92f5a478c910f60a826e1e23a6de3930ab47067","observation_id":"7134828d-b5b7-4411-bba6-967143bd09e1","resolution":{"observed_at":"2026-08-07T11:55:48.437163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.415032Z","title":"Saynav: Grounding large language models for dynamic planning to navigation in new environments","venue":null,"work_id":"968beac2-45fd-45ce-81e6-b3470206f96a","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.835158Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:4da539599020c78ef07698424903e180b435a09bf201c69d8b51851a8cc8772e","observation_id":"3002d202-1d6b-4bd6-9bd1-0beb4b55aa9e","resolution":{"observed_at":"2026-08-07T11:55:48.420163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.398328Z","title":"Habitat-matterport 3d dataset (HM3d): 1000 large- scale 3d environments for embodied AI","venue":null,"work_id":"c2242d68-a2de-4378-9adf-9920c1f9e5ff","year":2021},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.839991Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:dfd05b3e765891cf5bb0cc2c19f6a487786d7abafc81d21b38a92037290c11d8","observation_id":"32f9e538-903b-4346-a6d4-30f749ab0209","resolution":{"observed_at":"2026-08-07T11:55:48.403472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:47.845078Z","title":"Sayplan: Ground- ing large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.845078Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:48e31142e0c7282633dcc5aaa4f73e6c4002e5e7cfddc2a14eb7d9093b8eb00a","observation_id":"20d3811f-085a-4ea4-9715-9a2cd39c0432","resolution":{"observed_at":"2026-08-07T11:55:47.845078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06894","last_updated":"2021-10-20T18:52:36Z","snapshot_observed_at":"2026-07-06T10:33:20.283496Z","submitted_at":"2021-01-18T06:17:52Z","title":"Kimera: from SLAM to Spatial Perception with 3D Dynamic Scene Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06894","snapshot_observed_at":"2026-08-07T11:55:47.850750Z","title":"Rosinol, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.850750Z"},"links":{"cited_paper":"/paper/2101.06894","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:8b021864f6eb758b88f8f084d8a7afd12a5746dfec9116ac93adf29bf59568b5","observation_id":"b9c7a77c-f3c0-472a-9207-a3d2c67a0404","resolution":{"observed_at":"2026-08-07T11:55:47.850750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:47.857024Z","title":"Grapheqa: Using 3d semantic scene graphs for real-time embodied question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.857024Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:1a307253724c30eefe91c4fa0114486d5cd70d62192a63cfa7f24659ab5c1343","observation_id":"ced01236-5678-4691-8330-1f010e9683d2","resolution":{"observed_at":"2026-08-07T11:55:47.857024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06237","last_updated":"2024-10-08T17:52:29Z","snapshot_observed_at":"2026-08-06T03:12:41.018982Z","submitted_at":"2024-10-08T17:52:29Z","title":"BUMBLE: Unifying Reasoning and Acting with Vision-Language Models for Building-wide Mobile Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06237","snapshot_observed_at":"2026-08-07T11:55:47.862292Z","title":"Bumble: Unifying reasoning and acting with vision-language models for building-wide mobile manipula- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.862292Z"},"links":{"cited_paper":"/paper/2410.06237","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:979c69fd9d7be0fa0cb54b862b81cec0ce7d71a1fd354e3d1b99ceeec9a482cc","observation_id":"d7281bd9-6ec3-4add-aa20-444ee6eb7638","resolution":{"observed_at":"2026-08-07T11:55:47.862292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18431","last_updated":"2025-01-22T15:09:00Z","snapshot_observed_at":"2026-08-07T17:59:55.822816Z","submitted_at":"2024-09-27T03:44:07Z","title":"Search3D: Hierarchical Open-Vocabulary 3D Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18431","snapshot_observed_at":"2026-08-07T11:55:47.867183Z","title":"Search3d: Hierarchical open-vocabulary 3d segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.867183Z"},"links":{"cited_paper":"/paper/2409.18431","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:e7afc0ad43fd127f521d1b20f1cdbe7cea395227a378bd99d31cbbf962dea455","observation_id":"ade34c68-d998-43d9-aa34-ff7cd99f2aa5","resolution":{"observed_at":"2026-08-07T11:55:47.867183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04279","last_updated":"2025-01-08T05:01:59Z","snapshot_observed_at":"2026-07-06T20:18:03.181364Z","submitted_at":"2025-01-08T05:01:59Z","title":"OpenIN: Open-Vocabulary Instance-Oriented Navigation in Dynamic Domestic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04279","snapshot_observed_at":"2026-08-07T11:55:47.873733Z","title":"Openin: Open-vocabulary instance-oriented navigation in dynamic domestic environ- ments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.873733Z"},"links":{"cited_paper":"/paper/2501.04279","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:1797314abd9db972ce8c910b077dc253554bb1fa8676b1b3486e25cd2c043e32","observation_id":"919706a4-a683-4079-bcab-b53b2122a8ca","resolution":{"observed_at":"2026-08-07T11:55:47.873733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14908","last_updated":"2025-03-21T01:58:00Z","snapshot_observed_at":"2026-08-09T09:21:42.293084Z","submitted_at":"2024-09-23T11:02:46Z","title":"KARMA: Augmenting Embodied AI Agents with Long-and-short Term Memory Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14908","snapshot_observed_at":"2026-08-07T11:55:47.879368Z","title":"Karma: Augmenting embodied ai agents with long-and-short term memory systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.879368Z"},"links":{"cited_paper":"/paper/2409.14908","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:8b4984cfb9cd5ba4365c48a9b4e4c80fb8be311461d9ef6feacdba2e8398ef29","observation_id":"5c8de0d7-defb-42c2-94c4-f413bcbcf481","resolution":{"observed_at":"2026-08-07T11:55:47.879368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.370439Z","title":"Hierarchical open- vocabulary 3d scene graphs for language-grounded robot navigation","venue":null,"work_id":"ab9553bd-4b32-4e7c-b8ea-987d5f2e96b0","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.884618Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:52cc5c91a571bcc13b05b2ce6027f453ee9d0a198e27ec59a232a15f8ae9fd0e","observation_id":"2c0e309c-501d-4801-a92f-937939da9991","resolution":{"observed_at":"2026-08-07T11:55:48.375846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:55:48.349796Z","title":"C-pack: Packed resources for general chinese embeddings, 2024","venue":null,"work_id":"264067d2-0f56-4d62-bc22-4c219c621688","year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.890242Z"},"links":{"citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:df1d4dc3b215db1c5367495bc6657d38799f31c13b77735719829ac7ef4611f9","observation_id":"c4dda6aa-5e59-42ac-86e8-b55d97b14fd0","resolution":{"observed_at":"2026-08-07T11:55:48.356979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18313","last_updated":"2025-01-21T02:38:32Z","snapshot_observed_at":"2026-07-06T19:23:06.818254Z","submitted_at":"2024-09-26T21:44:11Z","title":"Embodied-RAG: General Non-parametric Embodied Memory for Retrieval and Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18313","snapshot_observed_at":"2026-08-07T11:55:47.896125Z","title":"Embodied-rag: General non-parametric embodied memory for retrieval and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.896125Z"},"links":{"cited_paper":"/paper/2409.18313","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:e4ce26b7a5eea2c5097e679aa3c3e5a7512d6b4d3f706b1c844da01251dc4393","observation_id":"fa5e380d-c95a-43cd-ba2d-f761abd081fe","resolution":{"observed_at":"2026-08-07T11:55:47.896125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17735","last_updated":"2025-04-04T06:02:20Z","snapshot_observed_at":"2026-07-06T19:57:33.013839Z","submitted_at":"2024-11-23T09:57:43Z","title":"3D-Mem: 3D Scene Memory for Embodied Exploration and Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17735","snapshot_observed_at":"2026-08-07T11:55:47.901623Z","title":"3d-mem: 3d scene memory for embodied exploration and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.901623Z"},"links":{"cited_paper":"/paper/2411.17735","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:d6d6b17f948ad3cea10a6e8b1473dcfa72c70a9b082a9c57ec34991997293200","observation_id":"d4927118-f40f-4c55-bca2-3b92414feeb4","resolution":{"observed_at":"2026-08-07T11:55:47.901623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15451","last_updated":"2024-09-23T18:26:19Z","snapshot_observed_at":"2026-08-04T09:29:04.191239Z","submitted_at":"2024-09-23T18:26:19Z","title":"Tag Map: A Text-Based Map for Spatial Reasoning and Navigation with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15451","snapshot_observed_at":"2026-08-07T11:55:47.906837Z","title":"Tag map: A text-based map for spatial rea- soning and navigation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:47.906837Z"},"links":{"cited_paper":"/paper/2409.15451","citing_paper":"/paper/2506.01174"},"observation_digest":"sha256:55d9b3250a89384aea3fd2483eb30ccfa567b0cf186921244370a6710db9f21e","observation_id":"42e83a4a-2d33-4920-a938-59bead00488e","resolution":{"observed_at":"2026-08-07T11:55:47.906837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01174","last_updated":"2025-06-01T21:13:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T03:01:56.494818Z","submitted_at":"2025-06-01T21:13:38Z","title":"GraphPad: Inference-Time 3D Scene Graph Updates for Embodied Question Answering"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 3 inbound Pith citation observations for arXiv:2506.01174."}