{"as_of":"2026-08-06T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cd8ad954166c507f673ea2c3b4a1450e1cb0ddd2c8980f4162b24aa3633c628","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T02:24:21.020383Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03449/citation-record","integrity":"/paper/2607.03449/integrity","json":"/paper/2607.03449/citation-record.json","paper":"/paper/2607.03449"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:bdb16bbec56673aadb1621e1d05d49b0b76aa3d94280844d46bffb77667eddf0","observation_id":"29a15744-bce3-4904-a96d-9a8312252e95","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:5e94160a4e1a5f9d46d1523904998786c765d644dd714604b70cd2634cd8537a","observation_id":"e345f539-ead1-4f99-8ac6-a1963f3e78d0","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09561","last_updated":"2025-05-19T20:37:41Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:00:47Z","title":"Learning Long-Context Diffusion Policies via Past-Token Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09561","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Learning long-context diffusion policies via past-token prediction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2505.09561","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:a6c0dbce55dd39c8107cd6a916de7e712434a25e865f00f4b0f75787776c2495","observation_id":"73234499-18fc-48ff-8b0c-86f764801830","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Sam2act: Integrating visual foundation model with A memory architecture for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:1942f886e996c13966efbf8e682419548770c9c5cc7616ea3472477c6ad887de","observation_id":"81e14421-bdde-4eaa-8d81-65f33cf1e5e9","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Scaling up memory for robotic control via experience retrieval","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:268b34351530bbf05ce686824ff305e2e40c03cfbe2aa34ef4ad0746624e7ab7","observation_id":"6cdf18fa-ada6-4f9a-8352-1b0b5d27a136","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Roboomni: Proactive robot manipulation in omni-modal context","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:6817c6eb99e9bfcc7e449bc60e537868287eef8d18918abc0fac060de8d1c1b1","observation_id":"eca11e2e-3f07-4685-ac97-2129125c0b23","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:a5e2127c61cebbc207d317b4ba8f7908a0669083a4d6ad5114b7fc34a7725c55","observation_id":"9661f342-6644-41aa-9a76-ac1ff40f68e9","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Hi robot: Open-ended instruction following with hierarchical vision-language-action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:db194bd795549e2b93323eb2f05f766a91465ebe6fdb95206b5c5e2cb947b86a","observation_id":"d406fc82-c4a4-49e2-8e86-4f1ce8a786c0","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"HAMSTER: hierarchical action models for open-world robot manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:8fb5a4e13e6a824cbe12605918e825eb9289733b6fead1300f2416fb1d9208e2","observation_id":"de3eb154-0207-4582-815d-b3f9106834c5","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"From llms to actions: Latent codes as bridges in hierarchical robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:80288ed49afbb1be416516f18dcf8fa88cd25a8e3bd1207214d2f33e3e43bf7f","observation_id":"8ddc3011-2570-49ab-9b65-6185ff053d78","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"MAP-VLA: memory-augmented prompting for vision-language-action model in robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:60acbac9ba7f4122e3a89e59d1e9a33b8ae2263501856d828ec0af5fc2adf89d","observation_id":"55fd1163-a2ed-44b8-b883-4ea7fe5b79b6","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06745","last_updated":"2020-03-15T03:08:06Z","snapshot_observed_at":"2026-07-31T16:34:40.721603Z","submitted_at":"2020-03-15T03:08:06Z","title":"Vision-Dialog Navigation by Exploring Cross-modal Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06745","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Vision- dialog navigation by exploring cross-modal memory","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2003.06745","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:11f6d0f6eebc430c018db0080353d2895f47b457b32c8a2df1950a92c6a68f00","observation_id":"f913e45b-6ee6-4c80-aad9-313a1a3a81b7","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"MemoryVLA: Perceptual-cognitive memory in vision-language-action models for robotic manip- ulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:bd4d19b86e5f85c0f84cca40f332f860afdeaafb60004ce5a405e6ff71947267","observation_id":"56be8bcf-37f3-491d-9ec6-72370dbd191d","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:303272cb251a3d3a8bbd0b8e01e459bb0441fa749b42ef0227286f531eadb38c","observation_id":"92caf5df-9c17-4582-9621-3a4a744bd12d","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05997","last_updated":"2023-11-30T07:39:48Z","snapshot_observed_at":"2026-07-06T16:45:40.019771Z","submitted_at":"2023-11-10T11:17:58Z","title":"JARVIS-1: Open-World Multi-task Agents with Memory-Augmented Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05997","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"JARVIS-1: open-world multi-task agents with memory- augmented multimodal language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2311.05997","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:0e2e2fdadd52dd23726f8b610df18442ced82fac8aaf109ce70103058c682f60","observation_id":"0ce76651-5009-4389-bde0-20a88a50eefc","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Optimus-1: Hybrid multi- modal memory empowered agents excel in long-horizon tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:22ab13ab9875fb0389fc373d9ef8697653ccc6cabf20d2c0fc16f690ab05692c","observation_id":"3bf82939-53bd-4f2c-80fa-9e45111dee24","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Describe, explain, plan and select: Interactive planning with LLMs enables open-world multi-task agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:9e2122369077d0055fd4286818a9084abc765a81b9d9aa194796c0fb30679834","observation_id":"fcb50f85-a603-430a-a703-34c74962806f","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03627","last_updated":"2026-06-02T03:13:58Z","snapshot_observed_at":"2026-08-03T18:48:56.892789Z","submitted_at":"2025-12-03T10:06:14Z","title":"MemVerse: Multimodal Memory for Lifelong Learning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03627","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Memverse: Multimodal memory for lifelong learning agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2512.03627","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:4f002179b99f87528fed3bce91f2cf39892db8caa297f2eec6f440b37b297af4","observation_id":"43c6ebd8-7934-4675-9c33-c591e1ce9484","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-03T06:31:15.541423Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Patil, Kevin Lin, Sarah Wooders, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:3ca2e9b7ead05e625dd8edbb8d97de08e98c7a899a1af4001b780aaf6de8839a","observation_id":"ccb5a042-3c86-49ed-8639-570f05356c0b","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19413","last_updated":"2025-04-28T01:46:35Z","snapshot_observed_at":"2026-08-02T07:32:11.339534Z","submitted_at":"2025-04-28T01:46:35Z","title":"Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19413","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Mem0: Building production-ready ai agents with scalable long-term memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2504.19413","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:fb86e5a5c9417ace9e736e11f5f1459b7dc7e3c6d1d95f9b63293f1d99a7a642","observation_id":"2ec8323c-7831-4ee1-bd91-40b1154072a3","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"A-mem: Agentic memory for LLM agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:221c778e49b29cff839a1b2816cff07b7fd51f6ddef86918dcca2255a4ce75f2","observation_id":"fc463582-bba4-46ce-82fa-a1d95b624b80","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19828","last_updated":"2026-01-14T14:21:21Z","snapshot_observed_at":"2026-07-06T22:19:28.487854Z","submitted_at":"2025-08-27T12:26:55Z","title":"Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19828","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Memory-r1: Enhancing large language model agents to manage and utilize memories via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2508.19828","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:2826fd0371256de0d5a68d4f2742435bbc2ddd27a01e539e44a7c7375e5868f3","observation_id":"08f98928-a6ec-4830-b2a9-8e47c8786b88","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Seeing, listening, remem- bering, and reasoning: A multimodal agent with long-term memory","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:7be08c43934f3f5c876822de596ea17de91a43378379df0e2b0aa6171c4a744f","observation_id":"cd9a91d3-75c5-40d3-94fb-b2b15aa25d58","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Worldmm: Dynamic multimodal memory agent for long video reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:619077ed6ada344bacab6a7f18bd82be1f116a0a87c3664149df863c7b23a672","observation_id":"1558eae4-218f-4fce-b02a-58b2ee8c596d","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-981-95-4158-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SCM: enhancing large language model with self-controlled memory framework","venue":"Lecture notes in computer science","work_id":"5f997524-1786-4a8c-a513-8ec6547322ce","year":2025},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:c480ae05d6fb04458f6e5e9e4b013dcef8e54534f808cd36dc1ba7bd4e31fe11","observation_id":"59775146-1fe9-4722-9f28-190b81dc59ef","resolution":{"observed_at":"2026-07-12T02:28:27.310168Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:49:36.139955+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:49:36.139955+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:2bc3bdacd5774f8649efe20de7b3f14215792a0ee2a2cac0bb2a5dc1929b24c8","observation_id":"7aacc25c-f6f1-412a-a278-bdb79ef7a715","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:a6b89b86647050ca4f7746bafc64200fdefc2e4937cecde18b423052061fef58","observation_id":"3404b495-1314-4c34-9377-5807c82e899f","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:b3de5798a2bf2f4dca3bfb57a3a8e83a2ea9ee8056fe49fcb0c3be887ba38904","observation_id":"fed5e535-9a09-454a-b05b-1a7e957eb8e4","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:4455363e3d6263c5722a79d75622d1be478ab0694885a83f95cc629a55956e75","observation_id":"13031202-ff78-425c-a6b5-1532ed12b3d7","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Tag Usage Rules: Use 2-5 tags per record","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:8555c359067a8107898f4435439af2d875863eb9af105cc6fedc276fcc97f38d","observation_id":"81b9acda-c4e1-49ec-9e70-00ea5e87875f","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"Use when information is missing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:241681a6654701bd974f1aeb9fd5ee23d630194ef2ba839dbbe6625254712ffa","observation_id":"6aa2232f-0f21-4252-b3cf-4abb6c3d69fb","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:24:21.020383Z","title":"# REQUIRED OUTPUT FORMAT FOR EACH TURN <summary> <!-- Concise reasoning summarizing observations and memory interaction --> </summary> <memory_operations> <!-- Turn 1: QUERY only","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T02:24:21.020383Z"},"links":{"citing_paper":"/paper/2607.03449"},"observation_digest":"sha256:8f6a2e1bbb28895426590f9323dba015ccf1dd57d7eed37642ee51da2e1b1523","observation_id":"b9ca0b60-ac28-4437-af5b-af357c80ae43","resolution":{"observed_at":"2026-07-12T02:24:21.020383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03449","last_updated":"2026-07-03T16:06:48Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-04T20:14:57.604753Z","submitted_at":"2026-07-03T16:06:48Z","title":"HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2607.03449."}