{"as_of":"2026-08-19T15:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:872a31c9a7064a897ba1f7b2afb201469b689c5612d82c27a1ec4edff1059e47","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:03:04.897476Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10886/citation-record","integrity":"/paper/2608.10886/integrity","json":"/paper/2608.10886/citation-record.json","paper":"/paper/2608.10886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:04.660370Z","title":"Describe anything anywhere at any moment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.660370Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:2c163f437ddd4356c1fe642e698d68db05e6060457c5b4f26fa36de5587f7a44","observation_id":"609006d0-bda2-466f-bc87-51031f7d2d2f","resolution":{"observed_at":"2026-08-12T15:03:04.660370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13185","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.237072Z","title":"Towards spatio-temporal world scene graph generation from monocular videos,","venue":null,"work_id":"550f2840-ec32-4661-8fb3-3086f9085ceb","year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.667213Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:bedd5e51b4ada8c57383cccf3f4a6da8b8625475ea9e2364e313e1fc1b059f2c","observation_id":"edaa7b90-29e3-4669-b5a3-d161cc246c38","resolution":{"observed_at":"2026-08-12T15:03:05.246521Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.03787","last_updated":"2026-06-06T15:58:25Z","snapshot_observed_at":"2026-08-15T08:37:31.904391Z","submitted_at":"2026-06-02T15:39:27Z","title":"Worth Remembering: Surprise-Gated Robot Episodic Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.03787","snapshot_observed_at":"2026-08-12T15:03:04.672635Z","title":"Worth re- membering: Surprise-gated robot episodic memory,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.672635Z"},"links":{"cited_paper":"/paper/2606.03787","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:bad8364740275baa2fe042ae705ecc835582a9a699618383411eb282fdfa1d90","observation_id":"3eee583b-93d6-4e6b-8c3c-93a3b26b22c4","resolution":{"observed_at":"2026-08-12T15:03:04.672635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.897444Z","title":"A V A: A video dataset of spatio-temporally localized atomic visual actions,","venue":null,"work_id":"5a7af2e9-e7a9-4cf8-b940-7607ad3e1437","year":2018},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.679755Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:671519b6c5c13620365e029076943bb32e7773fb8570d4a09a86932cff1b999b","observation_id":"7a870ba7-e522-47ce-9c04-67e384ccaa49","resolution":{"observed_at":"2026-08-12T15:03:05.903178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.877623Z","title":"Action genome: Ac- tions as compositions of spatio-temporal scene graphs,","venue":null,"work_id":"9eac1329-efb9-44a1-87ff-369c9aa90df7","year":2020},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.685091Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:9e3cb8e9fa1bedd4f432b9cdfa18a2ee0c81dc4b87f519fec642b9008a67261c","observation_id":"c091b86b-8a03-464e-b8e5-a399f3c1214f","resolution":{"observed_at":"2026-08-12T15:03:05.885225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.859763Z","title":"Moma: Multi-object multi-actor activity parsing,","venue":null,"work_id":"f4d7cf13-fa29-4f97-80c8-39d1ca35e6c8","year":2021},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.690592Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:2ce182755c74643b1939390b8edfdf3e0795116689d622382aa81f6dc055a0ff","observation_id":"8982389d-8e2d-4bfe-af93-822c135fa6aa","resolution":{"observed_at":"2026-08-12T15:03:05.865386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.841403Z","title":"Ego4d goal-step: Toward hierarchical understanding of procedu- ral activities,","venue":null,"work_id":"76f71c9b-c265-4ac3-aedb-cf5c6e7b2e96","year":2023},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.697023Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:55aac580780190ad473d51249217ba2f1be3d91ad1ac5a308998eb7f2b44af38","observation_id":"a874839e-cc7f-4d11-ae9f-8582d4f1da5c","resolution":{"observed_at":"2026-08-12T15:03:05.847370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.822962Z","title":"Event-grounding graph: Uni- fied spatio-temporal scene graph from robotic observations,","venue":null,"work_id":"1fdb32ff-a9a5-4adc-b78d-a78c393a2b59","year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.702508Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:12835b43af4df68826af62096f5c1b4387f114084126d9312b72101751fdde1e","observation_id":"356aa0b3-f757-4d72-a1bc-ddfacc9c2d61","resolution":{"observed_at":"2026-08-12T15:03:05.828813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.806453Z","title":"3d scene graph: A structure for unified semantics, 3D space, and camera,","venue":null,"work_id":"c9f8aa28-2b71-4a9a-9602-e15a396f50eb","year":2019},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.708359Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:36c024370a7f8c986a5ac21fab09e71bd58a574a388ac234636d94dcecf6e297","observation_id":"5bef97e0-45fb-4c91-9ed0-8b5af750825d","resolution":{"observed_at":"2026-08-12T15:03:05.811590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.789179Z","title":"Hier- archical Open-V ocabulary 3D Scene Graphs for Language-Grounded Robot Navigation,","venue":null,"work_id":"d4bb756e-9dff-4cd8-a904-e2b5ded2ff33","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.714270Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:6c94022c52be000295287d7ecc3515780575c1868d4267e441edc20bafab1df8","observation_id":"b94c1532-2771-4303-93b7-423a142bc8c8","resolution":{"observed_at":"2026-08-12T15:03:05.794354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.771696Z","title":"Foundations of spatial perception for robotics: Hierarchical representations and real-time systems,","venue":null,"work_id":"ac494db6-8ced-4804-96cb-7d78ef83ef08","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.725424Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:64fb1cff89e0887211a591843c3daa1b8d57c223f4ef6cc7bd41fbcc19e429a0","observation_id":"124d26ed-7556-467b-aa29-890dcbafafeb","resolution":{"observed_at":"2026-08-12T15:03:05.777204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.754182Z","title":"Keysg: Hierar- chical keyframe-based 3d scene graphs,","venue":null,"work_id":"f8f9d8d9-baff-4c1e-9feb-0f332ff2b309","year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.731230Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:f3555f6e793baf2abb33027800fe0c3c17d0e5591d4268bc734983ac8ac5073b","observation_id":"36a65fd1-6a52-459c-bd91-9e0d83d7154d","resolution":{"observed_at":"2026-08-12T15:03:05.759729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19383","last_updated":"2026-06-15T08:14:08Z","snapshot_observed_at":"2026-08-04T21:50:05.254282Z","submitted_at":"2026-06-15T08:14:08Z","title":"3D Scene Graphs: Open Challenges and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19383","snapshot_observed_at":"2026-08-12T15:03:04.737115Z","title":"3d scene graphs: Open challenges and future directions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.737115Z"},"links":{"cited_paper":"/paper/2606.19383","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:c83db2917049b95c99ec3801ab56ec24b2e3588fe41b8af1c582d112eae89acb","observation_id":"6fee0534-6b4e-4b96-aae2-4198e99c6ca5","resolution":{"observed_at":"2026-08-12T15:03:04.737115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13360","last_updated":"2022-06-20T21:54:36Z","snapshot_observed_at":"2026-08-16T17:24:38.649709Z","submitted_at":"2022-01-31T17:15:41Z","title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.13360","snapshot_observed_at":"2026-08-12T15:03:04.744184Z","title":"Hydra: A real-time spatial perception system for 3d scene graph construction and optimization,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.744184Z"},"links":{"cited_paper":"/paper/2201.13360","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:4bda544592afb19680f889c6bf1e86a4ed5601edc614db44fbbb9c6ac52ff12e","observation_id":"caf0d940-6f01-4224-9d0f-ab55b4c4feac","resolution":{"observed_at":"2026-08-12T15:03:04.744184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.734811Z","title":"Conceptgraphs: Open-vocabulary 3D scene graphs for perception and planning,","venue":null,"work_id":"f4754a22-e675-4b53-99a8-1970a2692071","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.750680Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:fe3fe27c70bfcd07315a8847cf5929a859137eeaaab8d98f15a47ed84422cd98","observation_id":"bd696861-8ddb-4ebd-8231-bc4d72e0ad2a","resolution":{"observed_at":"2026-08-12T15:03:05.741263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.712826Z","title":"Hi- erarchical open-vocabulary 3D scene graphs for language-grounded robot navigation,","venue":null,"work_id":"e952bbfa-667c-418a-a405-c14b450506fe","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.756398Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:85858eba0e66fed2792a24d06a13ecacb52eaf5e31d90a0da24036d21ab4a09e","observation_id":"70e24170-5f17-4db7-9f0e-c165e553e2d4","resolution":{"observed_at":"2026-08-12T15:03:05.719997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.694351Z","title":"Clio: Real-time task-driven open-set 3D scene graphs,","venue":null,"work_id":"209315a6-c618-40c8-b573-57fd672e0672","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.762061Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:94b49dc3a8b17436154ed83249a679c592ccbdc49b8fcf983637d3eb152e173a","observation_id":"7a844798-92ff-4749-ba09-3a8bf163324e","resolution":{"observed_at":"2026-08-12T15:03:05.700047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.675089Z","title":"Open-vocabulary functional 3D scene graphs for real- world indoor spaces,","venue":null,"work_id":"b3307b2d-8c65-4b8f-941e-058613b96739","year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.768062Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:2719f0bcc7f9c8364dedd775e1ff436b5b8d243e613bef95e2dcb5fe7cf6da1e","observation_id":"356ecfc7-7906-4d3d-9854-593c16b043ac","resolution":{"observed_at":"2026-08-12T15:03:05.680840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.654266Z","title":"Fungraph: Functionality aware 3D scene graphs for language-prompted scene interaction,","venue":null,"work_id":"7be2e52a-2544-4b95-8c17-30d0707d37a5","year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.773876Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:063447c2e83d339638d9f0de2390482bfcfb1bb3423d8f769a0fa384f91f96e1","observation_id":"c58c59b2-e3ae-44d5-b570-f671e445db54","resolution":{"observed_at":"2026-08-12T15:03:05.661045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.632961Z","title":"Ashita: Automatic scene-grounded hierarchical task analysis,","venue":null,"work_id":"60115bfc-e9fa-499c-a586-fd3b07a0c33b","year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.779756Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:c0d3fd9e8363a35f552cda2afa25f43fb35009fcb7d45bbd4845c9596808de27","observation_id":"6bab9d3e-6c6f-450d-a7e2-2ddb4378841e","resolution":{"observed_at":"2026-08-12T15:03:05.639662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.609785Z","title":"3d dynamic scene graphs: Actionable spatial perception with places, objects, and humans,","venue":null,"work_id":"19452a00-47ed-4ca3-a292-efd008ce0f6b","year":2020},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.786724Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:cbfdd584510bfd686140fcf9bce0c34b7cd69e24cea2d7b997f8f174c552e535","observation_id":"cdb6a8cc-6e97-40ad-b04d-729b1f6638e0","resolution":{"observed_at":"2026-08-12T15:03:05.617433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.589791Z","title":"Kimera: From SLAM to spatial perception with 3D dynamic scene graphs,","venue":null,"work_id":"e83f5c0d-191e-4634-b487-a8a122265942","year":2021},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.792293Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:651ceaf4b11959fccd61f789f0a77fbff20292882bebfb41ae4984b18cc4d627","observation_id":"7bc32eb3-5495-45e6-ab30-04921c4fe262","resolution":{"observed_at":"2026-08-12T15:03:05.595863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.570644Z","title":"Khronos: A unified approach for spatio-temporal metric-semantic SLAM in dynamic envi- ronments,","venue":null,"work_id":"75180a89-778a-4135-b678-aaf3002e0762","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.797763Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:44078b53469fddbc9b829b3840d736bd35e03765a2112f66dbc23558660db5d7","observation_id":"8b71e6bf-3da0-4109-9ce8-56f6f19f44f7","resolution":{"observed_at":"2026-08-12T15:03:05.576433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.549512Z","title":"Aion: Towards hierarchical 4D scene graphs with temporal flow dynamics,","venue":null,"work_id":"b94475a6-69cd-4348-b784-6a12b351537b","year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.803377Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:9310a27dc23590fb3ed430fa43413124bb59fffcb7e5e9d089632e468b19067e","observation_id":"8073c7dd-1f0d-4356-8181-9ac3d3fbd8ee","resolution":{"observed_at":"2026-08-12T15:03:05.555807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:04.808870Z","title":"Remembr: Building and reasoning over long-horizon spatio-temporal memory for robot navigation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.808870Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:0a833e1018332751ee5609e86793115caa61a8a3d268f7a97f9a1194b0bd8117","observation_id":"9aa7f07a-3948-4bf9-8ad3-03e1c73144ef","resolution":{"observed_at":"2026-08-12T15:03:04.808870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18313","last_updated":"2025-01-21T02:38:32Z","snapshot_observed_at":"2026-08-16T19:50:08.307621Z","submitted_at":"2024-09-26T21:44:11Z","title":"Embodied-RAG: General Non-parametric Embodied Memory for Retrieval and Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18313","snapshot_observed_at":"2026-08-12T15:03:04.814128Z","title":"Embodied- RAG: General non-parametric embodied memory for retrieval and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.814128Z"},"links":{"cited_paper":"/paper/2409.18313","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:fd3e438c10e3fc088ef767d0b68075aa4d804e4f478430ab0b5a29fce59d5bcb","observation_id":"e5f51535-7c3e-47c8-9cfe-702697a39021","resolution":{"observed_at":"2026-08-12T15:03:04.814128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09173","last_updated":"2025-03-12T09:00:45Z","snapshot_observed_at":"2026-08-16T12:50:50.050883Z","submitted_at":"2025-03-12T09:00:45Z","title":"Long-Term Planning Around Humans in Domestic Environments with 3D Scene Graphs","version":1},"cited_work":{"arxiv_id":"2503.09173","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09173","snapshot_observed_at":"2026-08-12T15:03:05.013787Z","title":"Long-Term Planning Around Humans in Domestic Environments with 3D Scene Graphs","venue":"cs.RO","work_id":"921b3933-b578-41bf-bb35-fd5a2ac5ffc8","year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.819586Z"},"links":{"cited_paper":"/paper/2503.09173","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:261bc50086d09a6f8a6280b8209ee85cefbf3ddae3ac8a7dd9d9c4e4e060f28b","observation_id":"0a7afc51-3f4c-4b15-b074-e39e6d666be5","resolution":{"observed_at":"2026-08-12T15:03:05.023775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.516544Z","title":"Social 3d scene graphs: Modeling human actions and relations for interactive service robots,","venue":null,"work_id":"2055b3ae-3d40-4999-9f10-ea75097f6393","year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.824985Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:9268aca895bfa39b48a6882a56e41608d064adff2a9b638c98ce14c14dca59eb","observation_id":"cbe90bb7-239e-4f7d-acd6-ba0a0ebee589","resolution":{"observed_at":"2026-08-12T15:03:05.522355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.497322Z","title":"Event segmentation,","venue":null,"work_id":"20e62b73-eb70-4795-ad4e-cd5013b09b61","year":2007},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.830926Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:a4182206dc9b6667a710af1adb28fa95fab3b0714fa2664b33b15de98ffb5218","observation_id":"19b27015-0332-4e61-9690-1c206fdab684","resolution":{"observed_at":"2026-08-12T15:03:05.503322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.479156Z","title":"The language of actions: Re- covering the syntax and semantics of goal-directed human activities,","venue":null,"work_id":"19aafa2a-de54-4d04-92ed-284e3835485d","year":2014},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.836274Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:a55a2a05b0fa9e532e91b9ce484d4fd83d2aaad7ca1ac4efb5b47df071d34ce8","observation_id":"0d5aef68-62f2-4aa8-b444-fd23570c2e58","resolution":{"observed_at":"2026-08-12T15:03:05.484667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.459740Z","title":"4D panoptic scene graph generation,","venue":null,"work_id":"ed218d51-b0d9-402a-9ad9-4fe354995373","year":2023},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.841426Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:a6b17f644c4224c235da044401112e6cff50c13134de2389d7f2ea7da033d60a","observation_id":"922550e5-2c38-4621-97a7-04aa3a9f5731","resolution":{"observed_at":"2026-08-12T15:03:05.465959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.440455Z","title":"Action scene graphs for long-form understanding of egocentric videos,","venue":null,"work_id":"a1adacae-5b2f-4b8a-a282-e73d9475f7ea","year":2024},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.847064Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:83b11a9bc46af1e839d018740a9ba601db616afe5f7a36e679cd875886c14384","observation_id":"597700f0-6387-4321-8397-ecddc790cd98","resolution":{"observed_at":"2026-08-12T15:03:05.446128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.421756Z","title":"Building a mind palace: Structuring environment-grounded semantic graphs for effective long video analysis with LLMs,","venue":null,"work_id":"43eca0eb-0b5b-40ea-8b49-c6e8b65e683c","year":2025},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.852709Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:cc0ec486300517a6cda52b930e3f747c6d31cd0b35ac5727045ff37119aa127e","observation_id":"db2bdb32-5953-4ce2-b903-74b66cb1edb1","resolution":{"observed_at":"2026-08-12T15:03:05.427826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.400744Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"1421ff9f-ca5d-4843-b47f-b71175a8f487","year":2022},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.859207Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:6391e34ff65266353bce07a72e68a94ac289f421941488541e8c3c1fbaa0ed7b","observation_id":"cab0803a-1a3d-4c37-b43a-30757d7753cb","resolution":{"observed_at":"2026-08-12T15:03:05.406403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.382582Z","title":"The epic-kitchens dataset: Collection, challenges and baselines,","venue":null,"work_id":"0b2ec8a2-60e7-4a01-8721-8a1842fc807f","year":2020},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.864554Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:f7be4194f9bd54ff399faf6fb4bb21cb79dc76ae5a7a30b805688d0ce0a43268","observation_id":"de8ab2f1-2a15-4b63-8291-4765f6b3fdb3","resolution":{"observed_at":"2026-08-12T15:03:05.387884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.23570","last_updated":"2026-04-26T07:21:15Z","snapshot_observed_at":"2026-08-18T10:12:20.804766Z","submitted_at":"2026-04-26T07:21:15Z","title":"EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.23570","snapshot_observed_at":"2026-08-12T15:03:04.870411Z","title":"Egolive: A large-scale egocentric dataset from real-world human tasks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.870411Z"},"links":{"cited_paper":"/paper/2604.23570","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:de900c077edcdd4188e5aaa9e687399483110a3f2d9dc779e418368fa6fd9eb8","observation_id":"6cdcc482-030d-4983-8d1d-fe281b52494a","resolution":{"observed_at":"2026-08-12T15:03:04.870411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.364193Z","title":"Cosmos-Reason2-8B: Physical ai common sense and embodied reasoning model,","venue":null,"work_id":"a88250f3-ccc8-4a78-af7e-6c3b1c2cd951","year":2026},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.877863Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:6563686d2c3fce66ea84480ced4f60c20f2fd047229a0ecc1b77f45361e6f603","observation_id":"014c149e-ccba-42dd-8363-35b7f8198fdd","resolution":{"observed_at":"2026-08-12T15:03:05.369643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-19T15:15:13.657700Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-12T15:03:04.883808Z","title":"Fast segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.883808Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:e47513e5c8bbdb6161c52e3f240f60a0e4880310beb2e55bec02f77d65da5c9e","observation_id":"aa835902-7575-4184-9de6-b5698407eb22","resolution":{"observed_at":"2026-08-12T15:03:04.883808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:04.890991Z","title":"Sentence-t5: Scalable sentence encoders from pre-trained text-to-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.890991Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:fb56e4e9910fbcbfd9e079ac66dbce3ca0b788b025a539a4517bdde6a6434193","observation_id":"bbc49c2b-ec06-471f-be6b-6aaf4fe206bc","resolution":{"observed_at":"2026-08-12T15:03:04.890991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:03:05.331454Z","title":"Hoi4d: A 4d egocentric dataset for category- level human-object interaction,","venue":null,"work_id":"6a0756fa-1502-4e02-b1f4-fa50710b72fe","year":2022},"citing_paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:04.897476Z"},"links":{"citing_paper":"/paper/2608.10886"},"observation_digest":"sha256:6498b4487dbb5dfe0ff459f8683fc0c1ca5e8ffbb39958e7464b6edb78cce52f","observation_id":"772c1934-9ab1-45c2-a26b-cb1c640df169","resolution":{"observed_at":"2026-08-12T15:03:05.338395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10886","last_updated":"2026-08-11T13:03:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T19:50:21.884077Z","submitted_at":"2026-08-11T13:03:33Z","title":"GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.10886."}