{"as_of":"2026-08-15T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96ddfec1489f160ee66d0d776d02f9742be8beff4596eb60d0a2009af8a9501f","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:11:15.122695Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:21:29.776719Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:08:59.824731Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17629","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clivis: Unleashing cognitive map through linguistic-visual synergy for embodied visual rea- soning","venue":null,"work_id":"3db349f9-1052-4619-984d-054b9606c7bc","year":2025},"citing_paper":{"arxiv_id":"2511.20886","last_updated":"2026-04-08T06:35:31Z","snapshot_observed_at":"2026-08-15T20:59:59.767713Z","submitted_at":"2025-11-25T22:06:30Z","title":"V$^{2}$-SAM: Marrying SAM2 with Multi-Prompt Experts for Cross-View Object Correspondence","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T04:08:32.413555Z"},"links":{"cited_paper":"/paper/2506.17629","citing_paper":"/paper/2511.20886"},"observation_digest":"sha256:827d8ab49ae0966d4568b3f42dba5f5f88d3ba553a5fba8c7db23fa820c516fc","observation_id":"8b986300-5312-4992-9628-5e010a6e1a45","resolution":{"observed_at":"2026-05-26T03:04:02.909446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17629","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clivis: Unleashing cognitive map through linguistic-visual synergy for embodied visual rea- soning","venue":null,"work_id":"3db349f9-1052-4619-984d-054b9606c7bc","year":2025},"citing_paper":{"arxiv_id":"2512.03666","last_updated":"2026-04-04T05:41:47Z","snapshot_observed_at":"2026-08-11T00:27:11.421915Z","submitted_at":"2025-12-03T10:54:44Z","title":"ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T02:50:17.955287Z"},"links":{"cited_paper":"/paper/2506.17629","citing_paper":"/paper/2512.03666"},"observation_digest":"sha256:1cdc287302f80c27dab30c79b3d0fde1b6ae063edb7fd85ed1a110f7ebd1dbf8","observation_id":"7c1461e4-1bbd-49a4-854b-b25ce684d2b6","resolution":{"observed_at":"2026-05-26T03:04:02.909446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2506.17629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17629","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clivis: Unleashing cognitive map through linguistic-visual synergy for embodied visual rea- soning","venue":null,"work_id":"3db349f9-1052-4619-984d-054b9606c7bc","year":2025},"citing_paper":{"arxiv_id":"2602.14122","last_updated":"2026-04-18T15:08:17Z","snapshot_observed_at":"2026-08-13T15:03:26.321098Z","submitted_at":"2026-02-15T12:46:35Z","title":"EgoSound: Benchmarking Sound Understanding in Egocentric Videos","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T21:44:47.636912Z"},"links":{"cited_paper":"/paper/2506.17629","citing_paper":"/paper/2602.14122"},"observation_digest":"sha256:39287c512919541477cc7acf48e4f2a407e307655484cb93b3a0c5154c1a4043","observation_id":"d7f51606-6c0e-42af-99f7-38c41c4575c6","resolution":{"observed_at":"2026-05-26T03:04:02.909446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17629","snapshot_observed_at":"2026-08-06T21:21:29.776719Z","title":"Clivis: Unleashing cognitive map through linguistic-visual synergy for embodied visual rea- soning.arXiv preprint arXiv:2506.17629, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04589","last_updated":"2026-08-05T08:51:20Z","snapshot_observed_at":"2026-08-13T20:23:59.133794Z","submitted_at":"2026-08-05T08:51:20Z","title":"The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:21:29.776719Z"},"links":{"cited_paper":"/paper/2506.17629","citing_paper":"/paper/2608.04589"},"observation_digest":"sha256:21fcf34148ff0a6857bd57f08427df4eb3859dbb8163566cc61cc671c8430bc7","observation_id":"e5bd53a0-5e08-49a5-8aaa-a277d9c73123","resolution":{"observed_at":"2026-08-06T21:21:29.776719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17629/citation-record","integrity":"/paper/2506.17629/integrity","json":"/paper/2506.17629/citation-record.json","paper":"/paper/2506.17629"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.885957Z","title":"Remembr: Building and reasoning over long- horizon spatio-temporal memory for robot navigation","venue":null,"work_id":"73088852-5d56-460b-80c3-b4c7d7a225d3","year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.919634Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:4d4c643673800fd99bfaa9ca7706b2577f86efc9e213dee77f87a09c9190d3f3","observation_id":"c88ea755-e6c0-420f-a647-b26e2366fe41","resolution":{"observed_at":"2026-08-15T19:11:15.890596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T19:11:14.924830Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.924830Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:8d49a06afbec8f34fd52ae64ca8dc226304e64b18cd6f2425f7710beb73d0f3f","observation_id":"0ddeae4d-d437-4f04-9da2-a723437a9cf8","resolution":{"observed_at":"2026-08-15T19:11:14.924830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T19:11:14.929732Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.929732Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:4ecba3423afbdfd48a79874810992c8b7082f73286d2613970e417b17c61af9c","observation_id":"4f914b26-6b94-4f76-98d4-fcb94b281d5e","resolution":{"observed_at":"2026-08-15T19:11:14.929732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.872398Z","title":"Cafuser: Condition-aware multimodal fusion for robust semantic perception of driving scenes.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":"4941daad-fc8d-4ec8-a24a-b025ac8a54a7","year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.934080Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:68c51bef74e794453078f33f14231638cd0ba832edad9e0d240602e7fcfeed15","observation_id":"9be3426a-da38-44c2-a187-b1000d024a2a","resolution":{"observed_at":"2026-08-15T19:11:15.877183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T19:11:14.938127Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.938127Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:a90c7e059c7d14c3ff1de36445ff182e67ac6f3bc7aa3b6f26b6acf4151de7dc","observation_id":"d7e7d189-72dd-4cd7-a9b0-cc308bb2bd38","resolution":{"observed_at":"2026-08-15T19:11:14.938127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.859266Z","title":"Embodied question answer- ing","venue":null,"work_id":"a3e797b2-5d47-49f4-a221-67c6d046eedb","year":2018},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.942516Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:c341b3ac7d5e1909f788749f8b571a90ed84e806c91c9de4d60bfb81a913fb64","observation_id":"ea286289-857c-4ef9-8025-4c5b2cf3e324","resolution":{"observed_at":"2026-08-15T19:11:15.863511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:14.947269Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.947269Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:15e55208d17b2966fd31b753587e6b328f8f22773d40ba841ff16ce011352d8d","observation_id":"eceea4e6-d709-4315-abac-b2fb5d308170","resolution":{"observed_at":"2026-08-15T19:11:14.947269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.835709Z","title":"Videoagent: A memory-augmented mul- timodal agent for video understanding","venue":null,"work_id":"14ba9672-61aa-4ffc-8541-3b497b56fdae","year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.951436Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:e6e5392a812f8d18659c7bbb14094301f8d111020836882bc57bbe0b014b518b","observation_id":"3cf23b82-8498-474f-b127-b2271b84c125","resolution":{"observed_at":"2026-08-15T19:11:15.840637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-15T19:11:14.955692Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.955692Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:de77c76896d9ad325ce4a16c35bdda46209d0999c247101fcc3be33b721c9a53","observation_id":"9b97ae9f-b38a-4e0e-8eae-176329a48208","resolution":{"observed_at":"2026-08-15T19:11:14.955692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.820723Z","title":"Objectrelator: Enabling cross-view object rela- tion understanding across ego-centric and exo-centric per- spectives","venue":null,"work_id":"f6d6acfa-39be-48f8-a6f7-0e837eadf12b","year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.960706Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:58e688854622e5c121085153795a2fca811202b2b7238c1445a05a0db0737e30","observation_id":"4d2c6250-70f5-4be3-9c5a-cddea093f0e6","resolution":{"observed_at":"2026-08-15T19:11:15.825270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.806534Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"3186873c-d8f0-477b-9801-49c246b5c81b","year":2022},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.964752Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:6a8d0e721d6c1719f1f423362c3f42bc1067d6166c83f7e50257141e4477c7fc","observation_id":"42d19641-6415-495a-93d9-097d6f6852ac","resolution":{"observed_at":"2026-08-15T19:11:15.811481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.792900Z","title":"A survey of deep learning techniques for autonomous driving.Journal of field robotics, 37(3):362– 386, 2020","venue":null,"work_id":"853dc689-9255-4077-ab32-7d38f484f5f0","year":2020},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.968640Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:d261c2b6a4988d7ed3ec158fc6e9054ec8b63141eb2c6bd3e6d9b0202ff8111b","observation_id":"a33312fa-4b74-44fc-a458-c3804a03c990","resolution":{"observed_at":"2026-08-15T19:11:15.797307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.780061Z","title":"Open vocabulary multi- label video classification","venue":null,"work_id":"298dddc7-c20b-4c93-b322-ca8d75295063","year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.972620Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:3549081a4bb58373ed8d142368e58d0d1b06138729ebe7cd7dfb6b583fea3f09","observation_id":"b04b94a0-179f-4609-bd50-62918aa1362b","resolution":{"observed_at":"2026-08-15T19:11:15.784150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.766244Z","title":"Sequential multi-object grasping with one dexterous hand","venue":null,"work_id":"bf2ab4ee-d2bc-421c-ae1f-94743aa15ee8","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.976838Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:6a41b3f49bcec806944b79bbbf781beac9cb188f46656da4cfbb682ee4ffa06b","observation_id":"1e1e9735-5ac2-4121-9370-5d275f21e18e","resolution":{"observed_at":"2026-08-15T19:11:15.771258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03901","last_updated":"2023-06-07T17:22:22Z","snapshot_observed_at":"2026-08-13T11:23:12.289034Z","submitted_at":"2023-06-06T17:58:24Z","title":"ChatDB: Augmenting LLMs with Databases as Their Symbolic Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03901","snapshot_observed_at":"2026-08-15T19:11:14.980788Z","title":"Chatdb: Augmenting llms with databases as their symbolic memory.arXiv preprint arXiv:2306.03901, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.980788Z"},"links":{"cited_paper":"/paper/2306.03901","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:afcf1e17d7ec987c1ddb0736fa854175130866117497dc6ab1d80700928b92a8","observation_id":"2d2b7f61-358d-43a7-881e-f901f3eba15a","resolution":{"observed_at":"2026-08-15T19:11:14.980788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:14.984953Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.984953Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:93491fa87da963676ec0a0eea119ff18c3cfec093bac7fb4b9f5fa0410373e02","observation_id":"c4739f48-111e-47b9-a529-13c37b7e8077","resolution":{"observed_at":"2026-08-15T19:11:14.984953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.744869Z","title":"Egotaskqa: Understanding human tasks in egocentric videos","venue":null,"work_id":"0b34b0df-1797-4c6a-b863-3ea2536e598b","year":2022},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.988940Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:ec01a8ce597ed3b812fe70a77d57379fbd545587be1d85b04dfd647f6e3d0da9","observation_id":"7c97ef85-f5ba-4fc2-926f-7ae99b48003c","resolution":{"observed_at":"2026-08-15T19:11:15.749389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.730227Z","title":"Context-aware planning and environment-aware memory for instruction following em- bodied agents","venue":null,"work_id":"33da48d2-6439-4e5c-b825-542d0e3b90e8","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.993172Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:17cd57eb32d132958f36441eac2fcd8f62521394726843ae3fb6d722e511c3b7","observation_id":"d6159f40-45fc-4137-b1c8-affd4ba9e33c","resolution":{"observed_at":"2026-08-15T19:11:15.735632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T19:11:14.997487Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:14.997487Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:b8e70c754270d862730c8e5c88541cc3db231541166c1c0abd2989aeed8fa164","observation_id":"ff7b1043-b31e-419f-8804-8e98638da4c8","resolution":{"observed_at":"2026-08-15T19:11:14.997487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.001732Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.001732Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:a0217f874488197a7b7997c5233169d4c2e06287b95605d87f349a72f1b53ba0","observation_id":"83a1f811-dee2-4958-b4fe-fe50e014fbc2","resolution":{"observed_at":"2026-08-15T19:11:15.001732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.705097Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai.IEEE/ASME Transactions on Mechatronics, 2025","venue":null,"work_id":"8a10e62d-9c12-47b4-9d7d-689e14e359ab","year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.005682Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:102d77ed77478fa233989a428fdedfe225481a291116a86d48a9db1c84b5ad65","observation_id":"ed89a511-4efe-4444-bcd2-fbbc92b60f6a","resolution":{"observed_at":"2026-08-15T19:11:15.710217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-08-15T19:11:15.009577Z","title":"A survey on vision-language-action models for embodied ai.arXiv preprint arXiv:2405.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.009577Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:62ec9e5e3a75a257ee92a80bac39d6325cb2d6ea6543983059b045ea46cab147","observation_id":"e3e2a5a0-9fc5-4b46-a50b-6f6492bce91e","resolution":{"observed_at":"2026-08-15T19:11:15.009577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.690564Z","title":"Openeqa: Embodied question answering in the era of foun- dation models","venue":null,"work_id":"323e510d-65a3-4406-8af3-67a6410f66b2","year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.013900Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:fbde6ad2026bd1f68a4057801c45f3d7add175b188d33994fa0d139174a5c4af","observation_id":"3378b811-4abc-4fe7-afda-5c2cd7f7406b","resolution":{"observed_at":"2026-08-15T19:11:15.695086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.677317Z","title":"Egoschema: A diagnostic benchmark for very long- form video language understanding.Advances in Neural In- formation Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":"f17e4be1-d5fb-4883-9962-b3e4ccbfa1a5","year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.017972Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:1f28dd43338366723702f6c8dd30afb8f1dc79541da922f459dc1e352867a7e6","observation_id":"27352482-e06b-40f3-a7bc-1ade7ebc192c","resolution":{"observed_at":"2026-08-15T19:11:15.681595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-15T11:39:49.280087Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-15T19:11:15.021957Z","title":"Patil, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.021957Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:ca76fca0db1282e221aa0236137f4a4b06b72c66027621d4cf3dd6d354d23091","observation_id":"c3d13be7-5da6-4c23-9a6a-337731811b1d","resolution":{"observed_at":"2026-08-15T19:11:15.021957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.661404Z","title":"V2-sam: Mar- rying sam2 with multi-prompt experts for cross-view object correspondence.CVPR, 2026","venue":null,"work_id":"79999742-6713-4a8b-a47e-c75bb89d89ab","year":2026},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.026221Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:c56d5db98c79a151aa4b4c0b7a21d751a250332ff5452adbff707c9fcbff6aeb","observation_id":"bfb242e3-a4ea-457c-9d14-d078fbc2945b","resolution":{"observed_at":"2026-08-15T19:11:15.667593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.648391Z","title":null,"venue":null,"work_id":"096e29f3-91f2-47cf-9aa8-569f356b560a","year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.030352Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:3f5245782d66696c94d1fcb7882ce5e4017a8de3e2650711cbe1ec321272883f","observation_id":"7abbdd78-a7b5-4447-a4f6-a9625c299c44","resolution":{"observed_at":"2026-08-15T19:11:15.652598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06975","last_updated":"2025-02-10T19:14:51Z","snapshot_observed_at":"2026-08-14T08:32:12.525435Z","submitted_at":"2025-02-10T19:14:51Z","title":"Position: Episodic Memory is the Missing Piece for Long-Term LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06975","snapshot_observed_at":"2026-08-15T19:11:15.034372Z","title":"Position: Episodic memory is the missing piece for long-term llm agents.arXiv preprint arXiv:2502.06975, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.034372Z"},"links":{"cited_paper":"/paper/2502.06975","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:a5d8b57bccf1dcdfb540ce6a40d0387e64245b0c1f993d49c3c77e29e2e9eb4c","observation_id":"f1d8620f-2305-4dcb-9292-d78a4b4f7b79","resolution":{"observed_at":"2026-08-15T19:11:15.034372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.634745Z","title":"Omnia de egotempo: Benchmarking temporal understanding of multi-modal llms in egocentric videos","venue":null,"work_id":"e02cdc56-f6d4-4922-bfa9-d90fe1c52b20","year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.038662Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:13d203e370b62099c55da930bb5d02e4a53bb04b71dc33369960f769e248c9ba","observation_id":"77d510d2-e44b-40d6-9ba0-57e218681358","resolution":{"observed_at":"2026-08-15T19:11:15.639266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.042504Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.042504Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:131bb6b322fb22a374d6cf5f0c96302e860f12ee7076729a2078b2dc49d4087d","observation_id":"37a66466-2bb3-4eeb-916d-dcd03f3ee448","resolution":{"observed_at":"2026-08-15T19:11:15.042504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.612107Z","title":"Character-llm: A trainable agent for role-playing","venue":null,"work_id":"5f52da72-ba32-4787-83c4-7d70bf3daa11","year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.046328Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:feefbcbc12b66093e3e65db91c20f2f6527d29a2599962b328d16cdee8b03a55","observation_id":"6f8b06ee-aa50-4191-86e9-99aa0e57a90f","resolution":{"observed_at":"2026-08-15T19:11:15.616461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.050586Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.050586Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:979ad83f8290db6e80802b470255ebfb9ef2ec819510a787377b91645e969ce3","observation_id":"e58510fb-2bab-47e2-868e-a3cc19b0bdd9","resolution":{"observed_at":"2026-08-15T19:11:15.050586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.590443Z","title":"Part, Ioannis Papaioannou, Arash Eshghi, Ioannis Konstas, and Oliver Lemon","venue":null,"work_id":"ebd02cba-7ec0-4003-b497-3ee07f4b2eae","year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.054683Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:d53f1b552b8e5e65931200e80ff502a4640711bfb9ca7e429129a7c4a44d46d9","observation_id":"4fe840ef-5720-4867-90a8-8014fa7b8bac","resolution":{"observed_at":"2026-08-15T19:11:15.594670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.577356Z","title":"Mac: a meta-learning approach for fea- ture learning and recombination.Pattern Analysis and Ap- plications, 27(2):63, 2024","venue":null,"work_id":"3bc00eda-829f-4fdb-8d5a-1cdc4491b370","year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.058811Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:fcdddf8b257f60ad5ae26f68edce4ac11ed1ed5d24e02c44f922d5b0442ab74f","observation_id":"8b145558-78f5-46ec-a715-a83df2731935","resolution":{"observed_at":"2026-08-15T19:11:15.581786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T19:11:15.062766Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.062766Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:9d9969a848a1571a708d7b51b1515745c991133fc1dfec86c7ec077adb8d784e","observation_id":"a6def184-c419-49f3-a854-58a7b1b38159","resolution":{"observed_at":"2026-08-15T19:11:15.062766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.067040Z","title":"Ocra: Object-centric learning with 3d and tactile priors for human-to-robot action transfer.arXiv preprint arXiv:2603.14401, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.067040Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:586655630ef2726b79fed4a900096fc35b7ded01fd2ba687b464b07bf8eafb17","observation_id":"76c53c38-ea5b-4444-a9d7-10b86e9e747f","resolution":{"observed_at":"2026-08-15T19:11:15.067040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T19:11:15.070895Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.070895Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:3f266349a90eafc3248ad9114b3b10d216b5780b45908c2d72b8e4eb3a7aec33","observation_id":"de32a317-a7c5-4105-beeb-3824e4cea282","resolution":{"observed_at":"2026-08-15T19:11:15.070895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.563961Z","title":"Videotree: Adaptive tree-based video representation for llm reasoning on long videos","venue":null,"work_id":"eeb7cbbf-f88e-4f12-8d27-d5b15e8dda83","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.075030Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:1b87e4ffb85b966f38351f98ea32bd4cdbabcef438aca32d0d5f86f50fa9a063","observation_id":"af51e76d-04ab-457a-8371-9b9b83cba00c","resolution":{"observed_at":"2026-08-15T19:11:15.568874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.550015Z","title":"Lighttrack: Finding lightweight neural net- works for object tracking via one-shot architecture search","venue":null,"work_id":"065464a3-b2b9-4879-97c9-91268b19121d","year":2021},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.079136Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:4944a9a7b94b452c85451a6f6b09b098e44d55319e621a9db9ddaeae5ef117a0","observation_id":"a3563688-65bb-4c91-80b4-0552db3507bb","resolution":{"observed_at":"2026-08-15T19:11:15.554970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T19:11:15.082999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.082999Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:ea288caff3236877f03575b9b17cb4b147566a5b253a86ae98232b531cf7d8df","observation_id":"171999ef-dca6-4d0e-9888-6e7024ac3186","resolution":{"observed_at":"2026-08-15T19:11:15.082999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.536587Z","title":"So- cratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":"4471c044-6ea0-4857-aead-8afabdece02f","year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.087046Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:b79b77a7571e7247f22261efda45fb71379eb4cfcdf5f070e2b08177f9bfea79","observation_id":"aa6c9143-a734-4197-9b9c-8265a34361f5","resolution":{"observed_at":"2026-08-15T19:11:15.541247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-15T19:11:15.092018Z","title":"Videollama 3: Frontier multi- modal foundation models for image and video understand- ing.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.092018Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:31f31b0fe1e4cbb7af3f88fd9875e43c6f5817d884876d53df61fd8b1d61d6dc","observation_id":"b627dae2-a079-487f-8340-cce3aa692acd","resolution":{"observed_at":"2026-08-15T19:11:15.092018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.522372Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":"ef07e635-cd3c-4196-a092-7969e25493bf","year":2023},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.096261Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:7a4c67760d2ea282ca0d697c2b13bb8abee5961eb9f9d85a0d43ac61d73b8672","observation_id":"9de21945-e071-4fa5-b778-410270d01b50","resolution":{"observed_at":"2026-08-15T19:11:15.526735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T19:11:15.100496Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.100496Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:b0eb549c4d95e650e25e77019cb947d7393cb04a7092cc05fa935ad697b0a690","observation_id":"490c09d0-828f-4d01-a647-ed0d7877173e","resolution":{"observed_at":"2026-08-15T19:11:15.100496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.507428Z","title":"Considering hardware limitations and ef- ficiency, we preprocess videos by sampling frames at 0.5 FPS on OpenEQA and EgoSchema, while limiting frame count to 32 for EgoTempo","venue":null,"work_id":"d2d58927-6e4e-4271-b55f-ad7c18c41b9f","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.105067Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:de7e68c8ea750aea28db8532454cc150a29fbd33f6e4862596f18701518376a4","observation_id":"368d900c-88a4-42bd-bd2c-2196ed159593","resolution":{"observed_at":"2026-08-15T19:11:15.512053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.493262Z","title":null,"venue":null,"work_id":"4b0cb44c-aa59-427a-920b-b4e401c838a9","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.109245Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:20902eed33783903f587083a2e9d1ab2a22af998a6de86be018cd51762297541","observation_id":"cd6243c8-5e00-4e97-b4b1-c09ac06c76ec","resolution":{"observed_at":"2026-08-15T19:11:15.498046Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.479435Z","title":"The results are presented in Table 6","venue":null,"work_id":"98635f5c-f583-4fca-b405-790d4055f726","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.113320Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:c55a6d97339bda63de301666e7c21b36612cc1bc5e2a30ba39d15d8e51509f04","observation_id":"a500b113-a6fc-41ff-89eb-4a0f364785ed","resolution":{"observed_at":"2026-08-15T19:11:15.483608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.465020Z","title":null,"venue":null,"work_id":"47a09260-cb1a-4a7d-9f73-2b4b0b944303","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.117778Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:9d08d5dae6bb08c993eaebc19238399e215f0ce23896c96e983e3caad8caedc9","observation_id":"580dda91-a3db-45a6-89c0-5bb6bf94f7e0","resolution":{"observed_at":"2026-08-15T19:11:15.469738Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:11:15.448415Z","title":"We highlight relevant infor- mation throughout the reasoning trace, marking correct de- tails in green and erroneous ones in red","venue":null,"work_id":"b6027867-fa2b-40bc-aaa7-6c09fad96683","year":null},"citing_paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:11:15.122695Z"},"links":{"citing_paper":"/paper/2506.17629"},"observation_digest":"sha256:094ee13336dab38347322cd986f2e19bf1daf468da09d2b6db5dd3b09c76997a","observation_id":"7791ed57-e883-47e7-9ad0-03d8c3784990","resolution":{"observed_at":"2026-08-15T19:11:15.455018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17629","last_updated":"2026-05-25T08:31:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:02:58.911884Z","submitted_at":"2025-06-21T08:11:40Z","title":"CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 4 inbound Pith citation observations for arXiv:2506.17629."}