{"as_of":"2026-08-07T12:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1bff73f6c1b07a8d3c0a6efcea0d37af358cdce20b2df6c0e87eb2e658e02da4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:36:15.716207Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T16:03:08.102407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-07T05:36:15.716207Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07575","last_updated":"2025-06-09T09:20:20Z","snapshot_observed_at":"2026-08-07T05:28:03.889420Z","submitted_at":"2025-06-09T09:20:20Z","title":"Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:15.716207Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2506.07575"},"observation_digest":"sha256:717376ac710640a57cd1fcf53b7a0509fcc627d72c349d0ca34ce1e3b884567c","observation_id":"7aaf53df-d37c-4d31-b5c1-7996665ae2f2","resolution":{"observed_at":"2026-08-07T05:36:15.716207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-06T23:49:47.733190Z","title":"arXiv preprint arXiv:2409.15310 (2024) 1, 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16112","last_updated":"2026-07-11T03:45:43Z","snapshot_observed_at":"2026-08-06T23:41:57.582831Z","submitted_at":"2025-06-19T08:02:53Z","title":"AutoV: Loss-Oriented Ranking for Visual Prompt Retrieval in LVLMs","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:47.733190Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2506.16112"},"observation_digest":"sha256:0c731c9a5cb121a380c2535332de180d35d760016f4684cb23436c13923b8d5a","observation_id":"ee4b47a9-2a6b-4935-b17b-3a2656142bf0","resolution":{"observed_at":"2026-08-06T23:49:47.733190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-06T14:36:55.827401Z","title":"Visual prompting in multimodallargelanguagemodels:Asurvey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18447","last_updated":"2025-07-24T14:33:06Z","snapshot_observed_at":"2026-08-06T19:31:11.014579Z","submitted_at":"2025-07-24T14:33:06Z","title":"PDB-Eval: An Evaluation of Large Multimodal Models for Description and Explanation of Personalized Driving Behavior","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:55.827401Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2507.18447"},"observation_digest":"sha256:0f69230dce48ed80d93391339265e47c6796e9a2221166c48b645868a89bd3dc","observation_id":"8f1ad2cc-cb70-4d95-a6eb-141ee985027d","resolution":{"observed_at":"2026-08-06T14:36:55.827401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:35:24.104443Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.104443Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:72b596b8f9968ef0c2e038ddaf6a8efd97abdf16713c52a8363572ee1faf644e","observation_id":"d7e906a8-9839-4d82-9328-c67c32ea5419","resolution":{"observed_at":"2026-08-05T23:35:24.104443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T21:01:26.976295Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10065","last_updated":"2025-08-13T08:05:47Z","snapshot_observed_at":"2026-08-06T04:20:22.305998Z","submitted_at":"2025-08-13T08:05:47Z","title":"Invisible Watermarks, Visible Gains: Steering Machine Unlearning with Bi-Level Watermarking Design","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T21:01:26.976295Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.10065"},"observation_digest":"sha256:799a2d8edc1c4a60636aa977959016a2fc3a4eb3fc200f66b5563673a89afc8e","observation_id":"3e86d794-ff2a-413c-b997-c1cb4c560696","resolution":{"observed_at":"2026-08-05T21:01:26.976295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:32:17.850843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-06T10:35:41.875223Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.850843Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:762d7d3365004acbe23a19ef9118c2b088209f95c1991179fb9e6993d6530d96","observation_id":"45f422a6-bf94-4aba-a52a-2f60719e77aa","resolution":{"observed_at":"2026-08-05T23:32:17.850843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2604.08846","last_updated":"2026-04-10T01:01:56Z","snapshot_observed_at":"2026-08-02T14:54:38.934183Z","submitted_at":"2026-04-10T01:01:56Z","title":"Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-10T18:04:05.157103Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.08846"},"observation_digest":"sha256:bf29ed1a599d9441381a42be44f16411ca18ed90d5a6e275b1bcff2112b246d0","observation_id":"be421962-57d0-4d6b-a57b-c015f11c8160","resolution":{"observed_at":"2026-05-11T05:35:57.458742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2604.10527","last_updated":"2026-04-12T08:43:28Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:43:28Z","title":"STORM: End-to-End Referring Multi-Object Tracking in Videos","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T16:25:31.777907Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.10527"},"observation_digest":"sha256:21659757b045daa4b17b7c44608f68a6129e7c45c1186c8e6e4d618bdf37c09e","observation_id":"6005aaec-6a6e-487f-9189-3de52d2a65b5","resolution":{"observed_at":"2026-05-11T08:56:00.442212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:33.464951Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:aef54bdf617430047a3cb3a1823cdd754d281a09f3be6e5d425721e04add7434","observation_id":"32c52558-2f0c-44c1-9586-f9c50a23884d","resolution":{"observed_at":"2026-05-10T06:56:47.420763Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-07-12T19:10:41.883296Z","title":"arXiv preprint arXiv:2409.15310 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.16993","last_updated":"2026-07-01T08:24:40Z","snapshot_observed_at":"2026-07-12T19:10:04.790544Z","submitted_at":"2026-04-18T13:41:46Z","title":"Rule-VLN: Bridging Perception and Compliance via Semantic Reasoning and Geometric Rectification","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T19:10:41.883296Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2604.16993"},"observation_digest":"sha256:129aa69c4fefe99699c694c1625632000da0003ea1a68f645bf6b3b71fcadf78","observation_id":"3f808a75-1b6c-497b-ab1a-dbc0d9006b24","resolution":{"observed_at":"2026-07-12T19:10:41.883296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:9c4023c72626108a13d2fc911f6b6e9a008b603741948fbc2bb537b0c929b178","observation_id":"c2e6a976-bb1d-443f-89b0-e8f8e9a0a29f","resolution":{"observed_at":"2026-05-10T23:15:49.439868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.08526","last_updated":"2026-05-08T22:17:54Z","snapshot_observed_at":"2026-08-02T11:50:00.146281Z","submitted_at":"2026-05-08T22:17:54Z","title":"Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T01:24:59.721212Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.08526"},"observation_digest":"sha256:ddc6f4423d914a4213360f92a8451ce3e38765093a1dce41ec7f380bb4cdc013","observation_id":"5a3cfb1b-a25e-4961-b5b8-646f10e721cf","resolution":{"observed_at":"2026-05-12T08:01:28.145905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.11169","last_updated":"2026-05-11T19:28:20Z","snapshot_observed_at":"2026-07-06T23:23:02.025664Z","submitted_at":"2026-05-11T19:28:20Z","title":"OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-13T02:24:42.530103Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.11169"},"observation_digest":"sha256:c080da079c18c26af59e6dbf54798f9b55a51b1cc66f4893a2628d17f9af3a4f","observation_id":"1a7e3a96-1854-41d2-bc00-f77617cb93cc","resolution":{"observed_at":"2026-05-13T02:27:07.225834Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":"2409.15310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual prompting in multimodal large language models: A survey","venue":null,"work_id":"4b695a69-bca3-47c2-896d-f6b2cb21948c","year":2024},"citing_paper":{"arxiv_id":"2605.15342","last_updated":"2026-05-14T19:12:20Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T19:12:20Z","title":"Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-19T16:02:53.887605Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2605.15342"},"observation_digest":"sha256:138a3cb65b0ffae146c25670480059993228a21c4c6215365cef870d2d29d2d6","observation_id":"9d51bcf7-f6d3-43cc-9d9d-296b3341e32c","resolution":{"observed_at":"2026-05-19T16:03:08.104159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-01T23:57:13.850939Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15193","last_updated":"2026-07-16T16:48:39Z","snapshot_observed_at":"2026-08-06T08:34:12.188692Z","submitted_at":"2026-07-16T16:48:39Z","title":"Plover: Steering GUI Agents through Plan-Centric Interaction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T23:57:13.850939Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2607.15193"},"observation_digest":"sha256:3d6d83179902c352a06191a6538e1b1d9d970d6680849b3630e423226791ba33","observation_id":"e0630495-5989-46a3-9cb4-bb265b6a0e85","resolution":{"observed_at":"2026-08-01T23:57:13.850939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-02T06:18:16.279690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16311","last_updated":"2026-07-14T16:45:02Z","snapshot_observed_at":"2026-08-02T06:18:04.185958Z","submitted_at":"2026-07-14T16:45:02Z","title":"Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T06:18:16.279690Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2607.16311"},"observation_digest":"sha256:a80dd1385e50bc8d1ea3ce3f0ba62a972880cc36eb971075c087413dace9d11d","observation_id":"c9cbef5a-a706-4849-baec-6e32fb03b999","resolution":{"observed_at":"2026-08-02T06:18:16.279690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.15310/citation-record","integrity":"/paper/2409.15310/integrity","json":"/paper/2409.15310/citation-record.json","paper":"/paper/2409.15310"},"outbound":[],"paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2409.15310."}