{"as_of":"2026-08-07T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41cce9d3bbbe7d08fdcf71d36d7e37a19dce8b18142cdc878c8fafd38bc62fbb","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:35:25.173917Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.05053/citation-record","integrity":"/paper/2508.05053/integrity","json":"/paper/2508.05053/citation-record.json","paper":"/paper/2508.05053"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:30.095565Z","title":null,"venue":null,"work_id":"d39a72f3-1995-41ac-845f-d31163c71091","year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.244853Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:498b663b6f40fe038008efae85ab86f57d763233cac2a7784d9129c0e9468550","observation_id":"82dbdc11-b18e-449e-8d1b-19383a72f44b","resolution":{"observed_at":"2026-08-05T23:35:30.309238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.664559Z","title":null,"venue":null,"work_id":"df8ce1d2-ab74-43b6-90f5-4ba66d8e4915","year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.285941Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:2f47f4c594e11c65bbf901ff6a1073fa713f384f3fbf0b49db80e0cfaf539d79","observation_id":"6d224883-9e8b-4f0a-b5c6-96fe499bbfe6","resolution":{"observed_at":"2026-08-05T23:35:29.902978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-05T23:35:20.389650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.389650Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0e20e47d360e4418bd19195bb6abdab6b460675c0cc863742e10d3edf5726e92","observation_id":"87a50d81-abf0-42b3-a340-a0dc3d45a918","resolution":{"observed_at":"2026-08-05T23:35:20.389650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:20.486664Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.486664Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:2b8fce1965e1e0b35eaf9db99ddfa26f307438aa3af30e4ea726a74fc8e38019","observation_id":"46efde8f-0e17-43bc-a7dd-f06f8e2f351b","resolution":{"observed_at":"2026-08-05T23:35:20.486664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.589078Z","title":null,"venue":null,"work_id":"02514ebf-813a-4c9d-a7ee-6f8e63614ae9","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.538611Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0470d3b42842bdc8c0585ef68b9c43662e0b0e0530429a4692ec39ca15b9eb96","observation_id":"5dc35908-269d-4e01-828b-bbed0b3b50bd","resolution":{"observed_at":"2026-08-05T23:35:29.658124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.418919Z","title":null,"venue":null,"work_id":"197bb508-b62b-4e1c-9629-f3cc80297774","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.610408Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:2e12f172e749479c5f86dc11b535b482487d2f416d056a39d173f494247a33b9","observation_id":"34233fc9-7d9a-46f6-a221-a72bce537185","resolution":{"observed_at":"2026-08-05T23:35:29.514661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-05T23:35:20.787317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.787317Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:9171f9ce4bad77235b1e5f6527a5ac53725d87be3204a21f0a7da30645caee80","observation_id":"9cc6d07a-e823-4d2d-915f-49635d2a9322","resolution":{"observed_at":"2026-08-05T23:35:20.787317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.260765Z","title":null,"venue":null,"work_id":"dee09474-a49d-4922-ad74-ce9577b62c51","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.897000Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:fa7b8138922d718c80f9a3fa8b6243c7e32f1a302aa6f22d458b01df9186ccb1","observation_id":"c95bb920-0913-41d8-a0e4-f9fdd81e7c75","resolution":{"observed_at":"2026-08-05T23:35:29.347631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.120639Z","title":null,"venue":null,"work_id":"6acff27b-8c03-4088-ba92-8b6181a1bc3e","year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.984880Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:d3d93a41291a43b11e666fbe0e9d986deff2af2afd4a86dde94f9f01aa0944fa","observation_id":"e62940b5-1f3d-4d2e-9891-8b34700bb39e","resolution":{"observed_at":"2026-08-05T23:35:29.168569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T23:35:21.080509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.080509Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:2a4531be39282d4b7c9f396c5583a8c7cddde5e44e5163f9db06b1173e2b708b","observation_id":"522f5dce-3315-47c8-be80-dc5bdc3b5c7c","resolution":{"observed_at":"2026-08-05T23:35:21.080509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.985498Z","title":null,"venue":null,"work_id":"445abde0-23a3-4d9c-bc96-dcf6470f069e","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.137744Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:aaf8f3fc737e476227fb251faaa0620754e9f347a686b2fd3491fba9e09a144c","observation_id":"01e4be79-5a70-4742-b9fb-ca8d11a41ed5","resolution":{"observed_at":"2026-08-05T23:35:29.064662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.864346Z","title":null,"venue":null,"work_id":"6cde79fb-0b11-4dee-b705-5397ce2f57ac","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.227566Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:f2dd36d2f60f3f3722e68d7a939ac5b08390c39ff9d2070043e02479fd77b9b4","observation_id":"09985699-a226-4ae7-8cbd-88012fdca6f5","resolution":{"observed_at":"2026-08-05T23:35:28.918534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-08-05T23:35:21.414530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.414530Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:d921131b6eabcfc5973181d8df67ce0b369bf8956d0b7e4fbe930234bedc172e","observation_id":"5f894236-9082-4dc2-b385-e47f7738b3c1","resolution":{"observed_at":"2026-08-05T23:35:21.414530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-07-06T17:53:06.519891Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-05T23:35:21.467830Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.467830Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:bad37ce245a1cf25e2c2478b486e7bcf964dd294e3cb9837a48b94de6a574c98","observation_id":"13065974-bb15-4c14-9943-db6377dce38b","resolution":{"observed_at":"2026-08-05T23:35:21.467830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.706092Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations","venue":null,"work_id":"6be97746-bf3e-4dd2-b182-cfa74bcc205a","year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.607416Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:36bd656018503ec71d3c0bfb25a0b900c9a391292a0f6e87a6d943be37db8bf3","observation_id":"07cfc3b5-6a7b-432d-8d83-b645631efede","resolution":{"observed_at":"2026-08-05T23:35:28.781940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.556614Z","title":null,"venue":null,"work_id":"d20e9971-0e92-432b-8c24-d057789e29c6","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.721552Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:b446fef2caafbba28015b5dd2febab2fcf27127a6077bfebea5d34c4b71f8ee5","observation_id":"2a59277a-367d-4c3e-bb88-aa449140ff51","resolution":{"observed_at":"2026-08-05T23:35:28.634216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.427347Z","title":null,"venue":null,"work_id":"31c4b655-3cdb-46c0-8238-adc4b283d9b6","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.832382Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:eb1a9595e82691fcb628dfa580de096e0101417a3bfa94853d22575d021914d9","observation_id":"18e3a403-11bf-4bc8-937d-6e45c0ed0cf4","resolution":{"observed_at":"2026-08-05T23:35:28.488916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.273609Z","title":null,"venue":null,"work_id":"b0484ec6-a1bd-4eba-bb7d-cf3722e0c410","year":2021},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.924530Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:8099c0121550edd6d4599ea438556d472e8a49b98fd86a10ac5e4633d2ad1187","observation_id":"b3c1ef78-9245-4a3b-a084-1da184c7d5d0","resolution":{"observed_at":"2026-08-05T23:35:28.326339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.138553Z","title":null,"venue":null,"work_id":"408386e5-8626-4551-bfea-1b8d3b6e345c","year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.026645Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:a730f98e492c3d33b3cc71488b0d46d915e11176bf57e330a1405af7962c0193","observation_id":"b8d4260d-ebac-41da-b355-ddfc5f0a9ced","resolution":{"observed_at":"2026-08-05T23:35:28.202919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.964625Z","title":null,"venue":null,"work_id":"eb07fdd4-d5bc-4d70-a690-894ac88e16fc","year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.100000Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:31f998c4fc8d9adcb35fbe2dfc34dd03f20b72ceb67d0e36f24726baa2eec0d4","observation_id":"79b932e2-8c9f-4d39-8cd7-3e43b5924196","resolution":{"observed_at":"2026-08-05T23:35:28.034220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T23:35:22.191685Z","title":"Goucher, Adam Perelman, and Aditya Ramesh et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.191685Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:5b015d60b4548af47cb0c1e7d91715dc499517576a1cfb87ccc0b39676e00da1","observation_id":"97d8ed9e-4f9b-4616-bdbd-9cca7b23be39","resolution":{"observed_at":"2026-08-05T23:35:22.191685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T23:35:22.298121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.298121Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:9bb1662a8a20218c020c2f6fb4670214243b9e00ee53afc0c434faf452412d40","observation_id":"89dde69a-4cec-442c-bcbc-ba97be1c9996","resolution":{"observed_at":"2026-08-05T23:35:22.298121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.809387Z","title":null,"venue":null,"work_id":"756f1c06-0f90-4ad5-9a15-aab448f010f7","year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.376901Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0df4a7af7ca271fc62c0b4abf1195ea18ddda4a7b43556112775fc1ea23f73b4","observation_id":"fb02c845-f51b-467c-bd88-4b6001ae67a0","resolution":{"observed_at":"2026-08-05T23:35:27.872777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T23:35:22.469669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.469669Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:b46c0c729bca823b1967e20a374dd1cb1f4d27a7a809e7c2fb26a8c4584f9d51","observation_id":"a4013ee6-a8b4-406c-8e8c-39713b6b4194","resolution":{"observed_at":"2026-08-05T23:35:22.469669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.658317Z","title":"Spiqa: A dataset for multimodal question answering on scientific papers","venue":null,"work_id":"8fd661af-20cd-40fc-9dc5-b13e1bcffea8","year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.611508Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:a3ff3dc104b7bcfba423071b48c69c1446a199e5b9c2de38d2ec438a2bc98e9b","observation_id":"4e83e174-5e44-459e-bdba-3d103f5173d7","resolution":{"observed_at":"2026-08-05T23:35:27.739681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-05T23:35:22.717154Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.717154Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:ea2d5044611c937b4725efd2a6ac7e62b427f664e4423f5d45b6e9e7e7e0006a","observation_id":"2f20d3f4-5a59-4989-8b0b-295849c0e625","resolution":{"observed_at":"2026-08-05T23:35:22.717154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-05T23:35:22.821052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.821052Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:1d2fc3eede2d5627b2cb28e81619bd15c223a91f9855b24620da7bc9ee57ad89","observation_id":"15dba7cd-b3ed-4867-80aa-c3808a26b4e3","resolution":{"observed_at":"2026-08-05T23:35:22.821052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.489367Z","title":null,"venue":null,"work_id":"a0cf4396-67bc-47bd-b796-cdf2bab3a2ab","year":2007},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.897960Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:e8270dd72fd98a9e59e6777ef4592b77dc55967c3891407857bfe0305b9d2846","observation_id":"56cce215-07d6-48b1-a750-d9c33ee9cb77","resolution":{"observed_at":"2026-08-05T23:35:27.584949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.349184Z","title":null,"venue":null,"work_id":"688dccc4-a95c-446b-bba4-451809aac987","year":1992},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.998680Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:3e6963640096a401e45a9835525754b34ab6426231ede4867b126f418d319c9d","observation_id":"3239c2b4-0e12-4edc-8b4a-4e98c52d680f","resolution":{"observed_at":"2026-08-05T23:35:27.409168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13534","last_updated":"2021-02-04T23:48:39Z","snapshot_observed_at":"2026-08-07T03:26:44.455151Z","submitted_at":"2020-11-27T03:05:59Z","title":"A Survey of Deep Learning Approaches for OCR and Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13534","snapshot_observed_at":"2026-08-05T23:35:23.100123Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.100123Z"},"links":{"cited_paper":"/paper/2011.13534","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:d70995b70058aff25af7f915394229f67103a7f41dac364ca46d914210fec8ed","observation_id":"715fac83-a4bd-49ed-a6ca-aad5898a213e","resolution":{"observed_at":"2026-08-05T23:35:23.100123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.200265Z","title":null,"venue":null,"work_id":"076a35a1-c39d-488c-85ee-628b5023e29f","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.210141Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:8d4ecae401e9583b267e5aa9cbfb44bea448d7f8fe4cc00069497b6eae8c1fd4","observation_id":"80365c97-d878-4b54-bace-776cfebe81fd","resolution":{"observed_at":"2026-08-05T23:35:27.264942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T23:35:23.347496Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.347496Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:5df0e5d72ba6a52424240e69fdff947cdb31246a0b4b794528770494f2888c6c","observation_id":"de30a918-02cf-4ffa-95cf-0086a95985ea","resolution":{"observed_at":"2026-08-05T23:35:23.347496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T23:35:23.442044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.442044Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:45b4fab88d19a6d7aeed3755be0fe5fca0a1567b06b06a2fde04287bc3b13163","observation_id":"bb4e2654-478f-4b5e-8dd1-146be7088218","resolution":{"observed_at":"2026-08-05T23:35:23.442044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.970093Z","title":null,"venue":null,"work_id":"6db3d27b-1d18-4c7e-86ba-16f7803bcac7","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.539460Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:24bebdd557c0addf9b76ef6db298b9e358fba8a98bfdd547cb3863146cc05c33","observation_id":"3932e7dc-6f99-4b4b-b003-d58628c713e2","resolution":{"observed_at":"2026-08-05T23:35:27.082133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.801663Z","title":null,"venue":null,"work_id":"b0279ed6-9ac7-43b6-b485-eebb96c77ae2","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.662824Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0a7ef7d74beb7992dd0e461fd92f751591a39059fcdc5bcdc102fa5c44b8ce48","observation_id":"5667cccb-486b-4a5c-8768-814baa7bfe19","resolution":{"observed_at":"2026-08-05T23:35:26.881051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T23:35:23.749223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.749223Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:d45e02a22e0a3ac5fccdd7ab8d92b1a77cddaf522b297225f7ad586c8e51697a","observation_id":"31faf26f-33e9-4cbc-b772-23fc3d3b49cf","resolution":{"observed_at":"2026-08-05T23:35:23.749223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:23.842456Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.842456Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:9fbc889f914cd453fabe22b6789de390d5f4c9e1aedd85563d9fa66c233e5656","observation_id":"fa7289b6-e2d6-4dcd-8973-d93dff57f0a2","resolution":{"observed_at":"2026-08-05T23:35:23.842456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07195","last_updated":"2019-08-05T09:20:50Z","snapshot_observed_at":"2026-08-02T15:58:38.617198Z","submitted_at":"2017-03-21T12:57:58Z","title":"GP-GAN: Towards Realistic High-Resolution Image Blending","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07195","snapshot_observed_at":"2026-08-05T23:35:23.935125Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.935125Z"},"links":{"cited_paper":"/paper/1703.07195","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:a82098717c959d9b7fe33ad723b8fbaa02ceec253185209e53b9fff36b3edc03","observation_id":"17ae7c1d-ea98-4c51-9236-c54e1d6a87bc","resolution":{"observed_at":"2026-08-05T23:35:23.935125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:35:24.104443Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.104443Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:72b596b8f9968ef0c2e038ddaf6a8efd97abdf16713c52a8363572ee1faf644e","observation_id":"d7e906a8-9839-4d82-9328-c67c32ea5419","resolution":{"observed_at":"2026-08-05T23:35:24.104443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.474680Z","title":null,"venue":null,"work_id":"3f48a98a-0723-431f-a181-2db0299dd596","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.203022Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:8fceaa66318d54c6e3d7f27510863a5cc714d8a69c1f89f8b0e9180508c7bccb","observation_id":"617c0b01-3c34-4b7d-882b-ed5ed3007145","resolution":{"observed_at":"2026-08-05T23:35:26.640637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T23:35:24.345477Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.345477Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:11ddb2dd343c36abe985e6622c3b8b2013e4fcd419c5f297419c2f0d92d350b6","observation_id":"67f6bfd6-7632-4801-9fc8-fadf8f7056cd","resolution":{"observed_at":"2026-08-05T23:35:24.345477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.083697Z","title":null,"venue":null,"work_id":"37e4553b-a0c7-402a-9688-8fd4aade519c","year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.483863Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:6959578886d2c3c930022998fd4bce3e9a6590c92012cd697ab784a2d01e3d57","observation_id":"118b3bff-0267-44b2-97e2-2dc878d34ee7","resolution":{"observed_at":"2026-08-05T23:35:26.300469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04356","last_updated":"2023-12-12T06:36:53Z","snapshot_observed_at":"2026-08-02T18:09:02.754027Z","submitted_at":"2023-06-07T11:39:56Z","title":"Fine-Grained Visual Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04356","snapshot_observed_at":"2026-08-05T23:35:24.630084Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.630084Z"},"links":{"cited_paper":"/paper/2306.04356","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:fb581e4b307a8db24af2f03de58223fc70086ff60f7f4d2bad1662cb2e403bc0","observation_id":"a86b2a0a-2453-4902-842a-d989ba82ebcf","resolution":{"observed_at":"2026-08-05T23:35:24.630084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-05T23:35:24.756157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.756157Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:78408c8ee99d9a62ef1c28c555e0a3240c73076c09c22ec256e22497933f6b5b","observation_id":"bdca3ade-8e0d-473f-b4b4-7df56c1fe871","resolution":{"observed_at":"2026-08-05T23:35:24.756157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00816","last_updated":"2024-08-14T07:26:08Z","snapshot_observed_at":"2026-07-06T17:38:17.853302Z","submitted_at":"2024-02-26T01:17:50Z","title":"Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00816","snapshot_observed_at":"2026-08-05T23:35:24.850312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.850312Z"},"links":{"cited_paper":"/paper/2403.00816","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:56fe45c3b13eed942b733c7c8527126a4fabb91774d5b42d766418144d0f80ab","observation_id":"62327dcb-40d3-49b5-9c7d-b367369e0bd4","resolution":{"observed_at":"2026-08-05T23:35:24.850312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.782009Z","title":null,"venue":null,"work_id":"16c436d7-451f-40dd-9410-824f28d9b7dd","year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.943908Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:fd2a22baae237a3bc5f7fcea124dc281f7dbbe786f67db561c62fff53ff2449e","observation_id":"e33a3e28-3024-4fd4-88ca-7e9f9149c5a0","resolution":{"observed_at":"2026-08-05T23:35:25.947300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.480450Z","title":null,"venue":null,"work_id":"98af6cbb-415b-44d4-8b5f-90c98602f224","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:25.029604Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:b6c2421276248690c9792fd5f1e8909df01d3b2851f54c2fe38c7eb967eb341d","observation_id":"c72d0b6d-19cb-43fd-94f6-eddb14b119ab","resolution":{"observed_at":"2026-08-05T23:35:25.628034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.090842Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:25.090842Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:f1c55bbbe99e8140680214886699f340e11bf498afc9f40c83039c8d04c172af","observation_id":"d5d1c8f2-7e0d-4368-bbf2-431acae88700","resolution":{"observed_at":"2026-08-05T23:35:25.090842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.173917Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:25.173917Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:b91db128d2e08446e81e85f3a33c973289f1de5daccaa993fe77f072e7ce78aa","observation_id":"aa444793-eac9-403d-afff-0415020a5266","resolution":{"observed_at":"2026-08-05T23:35:25.173917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T03:28:05.663325Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2508.05053."}