{"as_of":"2026-08-10T09:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b7d81fa7522b88241648de58dfb1494d9fc505d25cde2d7267ce49896432b39","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:24:50.446116Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:07:48.049036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":298,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:dbf9030fc65725ecb38bf5c80190cf8a32cb4f35041fd725483441c8576d1bda","observation_id":"7bd97203-c6c8-4d65-bb23-8e11cfbce296","resolution":{"observed_at":"2026-05-15T02:39:33.575547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-16T21:55:40.808698Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2407.01284"},"observation_digest":"sha256:0dea8011ef31ac872d7672640b1335046b41fd892b87f24ceff15b0f5fb1a7cd","observation_id":"9b14a2b8-40a2-4d26-80d6-41f4d12ee8f1","resolution":{"observed_at":"2026-05-16T21:55:40.884165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2407.13193","last_updated":"2026-05-19T15:04:52Z","snapshot_observed_at":"2026-07-06T18:48:16.629078Z","submitted_at":"2024-07-18T06:06:53Z","title":"Retrieval-Augmented Generation for Natural Language Processing: A Survey","version":4},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-05-23T23:06:41.081461Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2407.13193"},"observation_digest":"sha256:c21bcb21d13f265dffd30e9dcdb14046fd7402b72d60b62adcd936d06a9104b2","observation_id":"1727ab36-8d02-4368-a557-82c30127ae44","resolution":{"observed_at":"2026-05-23T23:08:35.594993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:693316a086d41987006945a81aba64bd061f12f5a4f9e98ce16ff3c2d16fc7e5","observation_id":"61bc92fe-f535-4189-b836-8fc7225e2706","resolution":{"observed_at":"2026-05-19T11:08:28.039800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-08T14:24:50.446116Z","title":"Large multimodal agents: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06776","last_updated":"2025-05-22T17:59:11Z","snapshot_observed_at":"2026-08-08T15:07:58.758525Z","submitted_at":"2025-02-10T18:54:05Z","title":"InSTA: Towards Internet-Scale Training For Agents","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:24:50.446116Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2502.06776"},"observation_digest":"sha256:a0b08ff4460f70a2ecdcf4f42599cc8e79f543c89399c32da991b03d500240fe","observation_id":"6b8baf50-50fc-4489-ac81-7eccc8655f94","resolution":{"observed_at":"2026-08-08T14:24:50.446116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-07T23:27:13.332029Z","title":"Large multimodal agents: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08869","last_updated":"2025-08-30T06:05:18Z","snapshot_observed_at":"2026-08-09T02:41:02.846944Z","submitted_at":"2025-02-13T00:42:11Z","title":"Harnessing Vision Models for Time Series Analysis: A Survey","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T23:27:13.332029Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2502.08869"},"observation_digest":"sha256:dff1e7790f9d73dd83719371b7858c57681487b5e5bd0c76cece970bedd3930b","observation_id":"547a527c-a1f7-46b0-9b23-f8554b909ff2","resolution":{"observed_at":"2026-08-07T23:27:13.332029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2505.16120","last_updated":"2026-05-04T12:54:07Z","snapshot_observed_at":"2026-08-02T10:48:03.601811Z","submitted_at":"2025-05-22T01:52:15Z","title":"LLM-Powered AI Agent Systems and Their Applications in Industry","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T14:05:54.535411Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2505.16120"},"observation_digest":"sha256:d0a71ac24f9adc25a1026158c3ea25791583cc291ff9e76f4a73ebb85a7fb4db","observation_id":"ad5e7ec5-97c4-4b7a-93e7-5aff8a9f2120","resolution":{"observed_at":"2026-05-22T14:06:37.943060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-07T14:50:11.620669Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18215","last_updated":"2025-05-23T05:46:42Z","snapshot_observed_at":"2026-08-09T16:52:11.863188Z","submitted_at":"2025-05-23T05:46:42Z","title":"Do BERT-Like Bidirectional Models Still Perform Better on Text Classification in the Era of LLMs?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:50:11.620669Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2505.18215"},"observation_digest":"sha256:464ebf9ad8554b97215de80ff4febd3aa956ee373757fc27e5b4eac795db8ae8","observation_id":"76119cef-610b-4cf5-941f-d4d7999768d5","resolution":{"observed_at":"2026-08-07T14:50:11.620669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2505.19662","last_updated":"2026-06-07T05:49:00Z","snapshot_observed_at":"2026-08-07T14:06:54.539806Z","submitted_at":"2025-05-26T08:21:46Z","title":"FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-19T14:36:30.827705Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2505.19662"},"observation_digest":"sha256:d9de8632f58b236ebd2227e695e08be2d03f6d782963169cf0de9222a2447609","observation_id":"be487a59-0ac6-4069-8945-8349a0dedbd3","resolution":{"observed_at":"2026-05-19T14:37:35.799963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-07T14:11:57.352926Z","title":"arXiv preprint arXiv:2402.15116 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19662","last_updated":"2026-06-07T05:49:00Z","snapshot_observed_at":"2026-08-07T14:06:54.539806Z","submitted_at":"2025-05-26T08:21:46Z","title":"FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:57.352926Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2505.19662"},"observation_digest":"sha256:8a9d2269c7fb5e5a15462be023712c899cf2468046ef3c41d1e2249306b0e1f2","observation_id":"571c231a-425d-47f9-b608-2e5bb469bbbf","resolution":{"observed_at":"2026-08-07T14:11:57.352926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-07T11:42:32.798379Z","title":"Large multimodal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01616","last_updated":"2025-06-02T12:56:27Z","snapshot_observed_at":"2026-08-08T16:00:43.942253Z","submitted_at":"2025-06-02T12:56:27Z","title":"MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:42:32.798379Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2506.01616"},"observation_digest":"sha256:f839d646358ddca2c423f1686d989919a6b0808a2bce69f3005120a63f561191","observation_id":"8d38a11e-35f0-43d8-a017-45eca82fbdc1","resolution":{"observed_at":"2026-08-07T11:42:32.798379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-07T04:52:01.033693Z","title":"Large multimodal agents: A survey.arXiv preprint arXiv:2402.15116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09420","last_updated":"2025-06-11T06:08:13Z","snapshot_observed_at":"2026-08-09T00:55:40.500387Z","submitted_at":"2025-06-11T06:08:13Z","title":"A Call for Collaborative Intelligence: Why Human-Agent Systems Should Precede AI Autonomy","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T04:52:01.033693Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2506.09420"},"observation_digest":"sha256:b05ce7de9990d75e2e03314a5019b7d22c5f75c23b9f59de353eeb32bf94785a","observation_id":"44bc4e89-6678-4444-b925-14a68984d6f6","resolution":{"observed_at":"2026-08-07T04:52:01.033693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-07T00:40:34.549165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-08T06:33:39.031465Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":222,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:34.549165Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:91a4b591907992dddb85096c4d211f319d35975c5e35034116200150ce6e955f","observation_id":"2e00334d-a644-47be-ae29-b0c17baae915","resolution":{"observed_at":"2026-08-07T00:40:34.549165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-06T23:26:54.729073Z","title":"Large multimodal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18019","last_updated":"2025-07-04T14:29:40Z","snapshot_observed_at":"2026-08-09T01:56:23.536720Z","submitted_at":"2025-06-22T12:59:12Z","title":"Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities","version":3},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:54.729073Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2506.18019"},"observation_digest":"sha256:40a148bc82b2c7b3328058e4bc8ba707fd090738c1097f511377f2fd3b077333","observation_id":"498bf72b-b4fa-40f1-a079-858d25e9bb2a","resolution":{"observed_at":"2026-08-06T23:26:54.729073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-06T20:55:26.612502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01376","last_updated":"2025-07-02T05:31:17Z","snapshot_observed_at":"2026-08-06T20:50:38.382088Z","submitted_at":"2025-07-02T05:31:17Z","title":"AI Agents and Agentic AI-Navigating a Plethora of Concepts for Future Manufacturing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:55:26.612502Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2507.01376"},"observation_digest":"sha256:98a6bbe23eaba75ec4f700f83e2ba8d8c63abdb0fdfc02bd666fedb1b021ccda","observation_id":"7a112c35-61ce-4add-b2b9-ad3c1a90411b","resolution":{"observed_at":"2026-08-06T20:55:26.612502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-06T20:13:29.225522Z","title":"arXiv preprint arXiv:2402.15116 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03543","last_updated":"2025-07-04T12:50:43Z","snapshot_observed_at":"2026-08-09T14:15:17.133848Z","submitted_at":"2025-07-04T12:50:43Z","title":"H2HTalk: Evaluating Large Language Models as Emotional Companion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:29.225522Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2507.03543"},"observation_digest":"sha256:c1d51e73ef5901a3ad77cea81fb5ecfcdedc894e5336606547fc8ca378a67f15","observation_id":"17ba5b95-d048-4c3d-adcc-9757eb13e694","resolution":{"observed_at":"2026-08-06T20:13:29.225522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-06T18:20:53.530368Z","title":"Large multimodal agents: A survey.arXiv preprint arXiv:2402.15116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08505","last_updated":"2025-07-14T08:25:14Z","snapshot_observed_at":"2026-08-09T18:03:32.025768Z","submitted_at":"2025-07-11T11:30:57Z","title":"Efficient Deployment of Vision-Language Models on Mobile Devices: A Case Study on OnePlus 13R","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:20:53.530368Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2507.08505"},"observation_digest":"sha256:bb166b425a3d538719ea3582a28dc43b4c9aab15ad8f155a4dc5582adf921c85","observation_id":"6f975698-f196-4643-939a-8f482f3ce123","resolution":{"observed_at":"2026-08-06T18:20:53.530368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-06T04:51:51.808479Z","title":"Large multimodal agents: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02978","last_updated":"2025-08-05T01:04:32Z","snapshot_observed_at":"2026-08-09T08:31:25.608374Z","submitted_at":"2025-08-05T01:04:32Z","title":"Separating Shared and Domain-Specific LoRAs for Multi-Domain Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T04:51:51.808479Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2508.02978"},"observation_digest":"sha256:3a1277738df0187cce07f9f8f7684e3cb3cfbda2dc5036093f0c5e201cafd220","observation_id":"6c79fc6c-5692-48db-a413-ec83758c0a2a","resolution":{"observed_at":"2026-08-06T04:51:51.808479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-05T17:20:09.852081Z","title":"In Proceedings of the 12th Joint Conference on Lex- ical and Computational Semantics (* SEM 2023) , pages 11–17","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18297","last_updated":"2025-08-22T16:47:37Z","snapshot_observed_at":"2026-08-09T16:10:41.504868Z","submitted_at":"2025-08-22T16:47:37Z","title":"Can VLMs Recall Factual Associations From Visual References?","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:20:09.852081Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2508.18297"},"observation_digest":"sha256:738599ba9406015cb99eeedbba4143b728bce0d17c56ba7935efb185194e9981","observation_id":"7cc3317f-0044-4f5b-8930-7c461e447166","resolution":{"observed_at":"2026-08-05T17:20:09.852081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-05T10:39:43.093769Z","title":"Xie , author Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05363","last_updated":"2025-09-04T02:23:23Z","snapshot_observed_at":"2026-08-10T05:09:38.036996Z","submitted_at":"2025-09-04T02:23:23Z","title":"SasAgent: Multi-Agent AI System for Small-Angle Scattering Data Analysis","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T10:39:43.093769Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2509.05363"},"observation_digest":"sha256:9633911e340c0684845b07505fe41ac4919759651ff96c76b6480fdeea3a8695","observation_id":"ba59b81e-0967-4dc3-868a-10fbf0be5475","resolution":{"observed_at":"2026-08-05T10:39:43.093769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-04T22:00:55.140398Z","title":"Large multimodal agents: A survey.arXiv, 2024.doi:10.48550/arXiv.2402.15116","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07595","last_updated":"2025-09-09T11:07:50Z","snapshot_observed_at":"2026-08-08T21:41:01.955896Z","submitted_at":"2025-09-09T11:07:50Z","title":"AgentX: Towards Orchestrating Robust Agentic Workflow Patterns with FaaS-hosted MCP Services","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T22:00:55.140398Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2509.07595"},"observation_digest":"sha256:cd4b9eef75ba0fa81b3598b3cf388993eb18ada4c82f5d576efdfa68e6a4cbff","observation_id":"dd1b79bf-6f97-437e-9484-71204811695c","resolution":{"observed_at":"2026-08-04T22:00:55.140398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2510.14133","last_updated":"2026-04-15T13:47:37Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T22:02:30Z","title":"Formalizing the Safety, Security, and Functional Properties of Agentic AI Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T06:38:40.544764Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2510.14133"},"observation_digest":"sha256:742005a3bb938ff5fdf915c0a2f78631220270c42c88844fd504e344930a1d56","observation_id":"99a4d9aa-e189-4486-b4b1-2a1b7afb8a03","resolution":{"observed_at":"2026-05-18T06:41:00.482230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-04T08:40:51.196641Z","title":"InThe Thirteenth Inter- national Conference on Learning Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.19600","last_updated":"2026-06-30T06:40:13Z","snapshot_observed_at":"2026-08-06T12:42:34.778498Z","submitted_at":"2025-10-22T13:53:57Z","title":"Human-Agent Collaborative Paper-to-Page Crafting","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T08:40:51.196641Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2510.19600"},"observation_digest":"sha256:50285afcd4254b45d8592cdb533cd79acf62788e10aa554f5688b129de7b430c","observation_id":"dc60c76b-6214-483a-be42-cdb79f00c89d","resolution":{"observed_at":"2026-08-04T08:40:51.196641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2602.08392","last_updated":"2026-04-04T07:19:18Z","snapshot_observed_at":"2026-08-09T04:39:04.658750Z","submitted_at":"2026-02-09T08:47:14Z","title":"ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-16T06:00:02.043029Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2602.08392"},"observation_digest":"sha256:75efe82bef8c19fe422c8273ba035aae1e0a092617a11f02be236a24f36d2dfe","observation_id":"ecb6a1a1-0756-444b-ba0c-414be4942486","resolution":{"observed_at":"2026-05-16T06:00:40.480054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2602.22683","last_updated":"2026-04-09T08:16:21Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-26T06:55:48Z","title":"SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T19:18:36.314029Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2602.22683"},"observation_digest":"sha256:332f6dcbccb6c1547a1412b60251022c75655efde2011283c1b332516422292e","observation_id":"b9611ff0-b530-4cc6-891c-ddf680381fae","resolution":{"observed_at":"2026-05-15T19:20:16.407108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:bb4c59183c853ff088d8c2e9fdea24df2446f6b46215c9a885faa6b56536b7a5","observation_id":"2a99e6f8-c524-448c-96a2-ce1119528069","resolution":{"observed_at":"2026-05-15T18:10:13.100889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-13T12:31:42.782821Z","title":"Large multimodal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03697","last_updated":"2026-04-04T12:01:49Z","snapshot_observed_at":"2026-07-13T12:31:42.135286Z","submitted_at":"2026-04-04T12:01:49Z","title":"SGTA: Scene-Graph Based Multi-Modal Traffic Agent for Video Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T12:31:42.782821Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2604.03697"},"observation_digest":"sha256:2a0446bbcb659441a79f892c76256b6966504d0973330d98a2ba1ba3589a532a","observation_id":"46309d11-72cb-44a5-add1-678289556243","resolution":{"observed_at":"2026-07-13T12:31:42.782821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-08T21:49:06.109128Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:241422772ed4a29cc8afbae5175475f5503b194f3d6983cb2a6bef4abca8025e","observation_id":"9f617e8a-6e47-49b3-87a1-05614046708c","resolution":{"observed_at":"2026-05-10T06:56:47.738283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2605.13213","last_updated":"2026-05-13T09:06:21Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:06:21Z","title":"Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T20:16:30.070819Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2605.13213"},"observation_digest":"sha256:b7122ca4436a7507732636ac3e2557999dd5fc1424e2ee0c320fa9bd51c7056e","observation_id":"a7b806be-2f91-4e73-a25d-6fff87641245","resolution":{"observed_at":"2026-05-14T20:19:27.880718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2605.15128","last_updated":"2026-05-14T17:37:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T17:37:52Z","title":"MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T21:02:58.640918Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2605.15128"},"observation_digest":"sha256:3bdb1de7c41701875ff224fb5e546ec477f0c13c640f24ebfad84658068fd1bb","observation_id":"7bd33008-9b59-40b8-a672-5271b09fe1fc","resolution":{"observed_at":"2026-06-30T21:05:04.023680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2606.09669","last_updated":"2026-06-08T15:51:51Z","snapshot_observed_at":"2026-08-02T20:17:41.727375Z","submitted_at":"2026-06-08T15:51:51Z","title":"SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T16:35:14.099586Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2606.09669"},"observation_digest":"sha256:6c7c112322e6119f6a2dccbbc6030f8e05fdaf830a98d5ec88bc1c64af6f5414","observation_id":"a0fa33ef-b1e2-44be-a90e-0a4a59c37316","resolution":{"observed_at":"2026-07-03T01:27:30.599891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":"2402.15116","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-03T09:07:48.049036Z","title":"Large multimodal agents: A survey","venue":null,"work_id":"5f1eddc5-e861-484d-a204-926b2bfd8ecc","year":2024},"citing_paper":{"arxiv_id":"2606.11702","last_updated":"2026-06-10T06:26:52Z","snapshot_observed_at":"2026-08-06T19:37:03.477588Z","submitted_at":"2026-06-10T06:26:52Z","title":"MedCTA: A Benchmark for Clinical Tool Agents","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T10:32:01.387453Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2606.11702"},"observation_digest":"sha256:4a6b9ce817fc03ab4eee5d92e5e92145ab8f80d70976de86b1dad6f4910ef596","observation_id":"a9dabc93-ea87-4add-8e3f-dd6e4fddb564","resolution":{"observed_at":"2026-07-03T09:07:48.050505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-12T09:30:41.159870Z","title":"Large multimodal agents: A survey.arXiv preprint arXiv:2402.15116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02590","last_updated":"2026-07-01T07:01:40Z","snapshot_observed_at":"2026-08-10T05:39:44.898424Z","submitted_at":"2026-07-01T07:01:40Z","title":"OmniPresent: Generating Coherent Presentation Suites from Scientific Papers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T09:30:41.159870Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2607.02590"},"observation_digest":"sha256:2a646427ce02963a2eaee34188320f0861aac772a56cdec07dd3ae27515214cb","observation_id":"e5284993-19f4-4b2c-bacb-8e9dfe4a1386","resolution":{"observed_at":"2026-07-12T09:30:41.159870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2402.15116 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":267,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:2a45bd10b465a3fcd648b42efa00b95ecc5aa070568fca8ecb7893232aea7506","observation_id":"c0f2ad5d-654e-4c16-a54b-43326daded55","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Large multi- modal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:dcf7a124d6f63241659b7eb510ae679e07338175e105eec5e06388104661d2ab","observation_id":"260ad4bc-e197-4cd7-86f6-40fdef60b238","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-01T20:54:17.402705Z","title":"Large multimodal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16488","last_updated":"2026-07-17T20:27:26Z","snapshot_observed_at":"2026-08-07T14:52:50.399447Z","submitted_at":"2026-07-17T20:27:26Z","title":"Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-01T20:54:17.402705Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2607.16488"},"observation_digest":"sha256:e32be42aa0730f1c6ebfc358c0caf07c698b66da541aa719281558210f80cf8f","observation_id":"ac34736e-a850-4fe9-aad1-ec334beab0a8","resolution":{"observed_at":"2026-08-01T20:54:17.402705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-08-01T18:12:42.349059Z","title":"Large multimodal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17391","last_updated":"2026-07-19T19:43:35Z","snapshot_observed_at":"2026-08-08T00:48:01.846366Z","submitted_at":"2026-07-19T19:43:35Z","title":"A Phased Development Framework Enabling Islanded Operation of Sustainable AI Data Centers With Onsite Grid-Following and Grid-Forming Energy Architectures","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:12:42.349059Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2607.17391"},"observation_digest":"sha256:fa74af403209c1ff392c5814abc6035a5cbf0b52a96a2a31a0e6a6e5e9680122","observation_id":"61a086dd-5d1e-4511-b9d7-4a0e8271556c","resolution":{"observed_at":"2026-08-01T18:12:42.349059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.15116/citation-record","integrity":"/paper/2402.15116/integrity","json":"/paper/2402.15116/citation-record.json","paper":"/paper/2402.15116"},"outbound":[],"paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2402.15116."}