{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8186edb514e6492f80f84adddfc0884a219ac6af23a28096015525d485444fa","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T11:54:01.224588Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:01:25.702271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T10:15:44.347614Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"cited_work":{"arxiv_id":"2605.05668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05668","snapshot_observed_at":"2026-07-01T10:15:44.347614Z","title":"Large Vision-Language Models Get Lost in Attention","venue":"cs.AI","work_id":"47def292-b993-4ecc-a79d-cd80126a6bb6","year":2026},"citing_paper":{"arxiv_id":"2605.15615","last_updated":"2026-05-15T04:54:08Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T04:54:08Z","title":"Neutral-Reference Prompting for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T19:15:54.152498Z"},"links":{"cited_paper":"/paper/2605.05668","citing_paper":"/paper/2605.15615"},"observation_digest":"sha256:ee27606d0bb7cebfa928822fb8be6dfa42c1edd6e2698db3f94f8c6242524f18","observation_id":"041da2f2-47f5-4c30-a270-ef1644f2b887","resolution":{"observed_at":"2026-05-20T19:18:54.588613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"cited_work":{"arxiv_id":"2605.05668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05668","snapshot_observed_at":"2026-07-01T10:15:44.347614Z","title":"Large Vision-Language Models Get Lost in Attention","venue":"cs.AI","work_id":"47def292-b993-4ecc-a79d-cd80126a6bb6","year":2026},"citing_paper":{"arxiv_id":"2605.30912","last_updated":"2026-05-29T06:50:46Z","snapshot_observed_at":"2026-07-31T18:48:52.783115Z","submitted_at":"2026-05-29T06:50:46Z","title":"Attend to Evidence: Evidence-Anchored Spatial Attention Supervision for Multimodal RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T23:19:33.846938Z"},"links":{"cited_paper":"/paper/2605.05668","citing_paper":"/paper/2605.30912"},"observation_digest":"sha256:8efcf319294695dc0ff2bf720a05842567383201c79bc933b1ad18a2e7f793cd","observation_id":"2932d443-7ca2-4eb8-91e9-9d3ae65cfb9b","resolution":{"observed_at":"2026-06-28T23:22:46.859174Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"cited_work":{"arxiv_id":"2605.05668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.05668","snapshot_observed_at":"2026-07-01T10:15:44.347614Z","title":"Large Vision-Language Models Get Lost in Attention","venue":"cs.AI","work_id":"47def292-b993-4ecc-a79d-cd80126a6bb6","year":2026},"citing_paper":{"arxiv_id":"2606.31903","last_updated":"2026-06-30T16:08:29Z","snapshot_observed_at":"2026-07-07T00:05:31.888697Z","submitted_at":"2026-06-30T16:08:29Z","title":"Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T05:43:49.728271Z"},"links":{"cited_paper":"/paper/2605.05668","citing_paper":"/paper/2606.31903"},"observation_digest":"sha256:1e82a812ca0679f10611ae4f2b8feeb637160481d68270500490bac2904d40f0","observation_id":"93f6a3f6-8b13-40e2-91c3-439bbea38df3","resolution":{"observed_at":"2026-07-01T10:15:44.348814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05668","snapshot_observed_at":"2026-07-14T05:37:19.632869Z","title":"arXiv preprint arXiv:2605.05668 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-02T07:01:12.417571Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-14T05:37:19.632869Z"},"links":{"cited_paper":"/paper/2605.05668","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:e7a1c59ec1e545a5a684e7b2be5ef6092caca85b29b55a2f55f0a22791710e19","observation_id":"8464f449-14a3-48b5-a720-e099a9d89376","resolution":{"observed_at":"2026-07-14T05:37:19.632869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05668","snapshot_observed_at":"2026-08-02T07:01:25.702271Z","title":"arXiv preprint arXiv:2605.05668 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-02T07:01:12.417571Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T07:01:25.702271Z"},"links":{"cited_paper":"/paper/2605.05668","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:699739205acd7cc16a7c49871a7305713a4efed9c0d42d0d65a752bf8354e64b","observation_id":"96c465d8-e87e-435d-b505-406ff384edd9","resolution":{"observed_at":"2026-08-02T07:01:25.702271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.05668/citation-record","integrity":"/paper/2605.05668/integrity","json":"/paper/2605.05668/citation-record.json","paper":"/paper/2605.05668"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T19:57:34.236379Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"a1fd09f1-b62b-4aca-a5ef-dd2b50ad08b5","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:ba75c615a455aba7b3de865fe53cb1a38a51c3cb4fa462da19e843279d7d8796","observation_id":"5874dbd3-6fa2-4ab2-83ae-de89d9b1da6e","resolution":{"observed_at":"2026-05-26T13:52:25.934517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.114328Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"1031f0f0-cd67-4170-83ad-9a088b363c67","year":2021},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e24e5be1d76053413095e0dc0b90a39642d7ec3acd6a7c42c223666bdd9a419e","observation_id":"c0ec3bbb-9608-4d08-a253-fdfdebdfcc4e","resolution":{"observed_at":"2026-05-26T13:52:25.937823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:55:43.223902Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"55760e3f-9273-4ed6-a5a2-5d16712e135c","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:dbdf1b349848ac7480581eea8b1efd2d2649b41dadf5874f6cda4fcda68b32fe","observation_id":"69136ca9-0807-45b1-825c-86e280710a07","resolution":{"observed_at":"2026-05-26T13:52:25.941486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.747462Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"99465f33-3e19-4fa9-8062-a629551b3315","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:58b5fea65259cf2bd95a58da4835f4ec8b12d3cf50a601c81c68fdced035acf9","observation_id":"5e1ec3b3-c21f-43d7-b27a-496e7ee41ecd","resolution":{"observed_at":"2026-05-26T13:52:25.948213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.122266Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"f2a4f68e-48af-40c6-90d4-76b155136aa5","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:16ea6abc49b1f82daaa71c0e0db55f90b7212a43456cff1482f28ae9c2854a2b","observation_id":"95886555-ebb2-452d-a5c9-b79562755ed6","resolution":{"observed_at":"2026-05-26T13:52:25.921835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:2274ae8350b1f53934f410c5c7085bab5a964151256b083d79120d7ffa77c174","observation_id":"35c37ec2-5df4-4903-8871-6bc5616b4314","resolution":{"observed_at":"2026-05-11T19:26:10.249262Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:37.666062Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"1265447d-0324-4d07-abba-34fa29d172da","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:b3f4f138ebb6d2ddba65478b69e3345b2299a11b9e7b9b163eed556100fc8d96","observation_id":"d38caf90-1c26-41ab-9394-aea7b9e46726","resolution":{"observed_at":"2026-05-26T13:52:25.825619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:52:49.835609Z","title":"Transformer Circuits Thread , volume=","venue":null,"work_id":"7f50c7b0-2033-4bbf-9a3b-e5a12b1d2504","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:12115e2dc74fa012b81649bb8336b00e0793ad1643e822a1b85799e8b86b93bc","observation_id":"62476e59-8514-4586-b93b-6f24fd814602","resolution":{"observed_at":"2026-05-26T13:52:25.829619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":"2209.11895","doi":"10.1145/3411763.3451760","metadata_source":"pith","pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-context Learning and Induction Heads","venue":"cs.LG","work_id":"db2b0911-2758-4a2a-99dc-15b14b91bd5e","year":2022},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:0df55e4df7069d632e209060dcab7d12ec2e9d8eab0809f66f72e5756365276c","observation_id":"a5980628-4d64-483c-bbdf-bcbafbbb06e3","resolution":{"observed_at":"2026-05-11T19:26:10.254921Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:10.795052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:52:40.529973Z","title":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"be14d58e-a731-463c-9741-5c11489ead96","year":2021},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:bc4bee60381d5f5f59d1c587b0780b80bf462eef84261803ad85360e6f255145","observation_id":"53856dd7-4ad9-4cee-982c-f07ce21fe98e","resolution":{"observed_at":"2026-05-26T13:52:25.818409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"d2f23103-d18b-40dc-bd84-3348f7c8f9f3","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:7ad9a51ed15766cf9fee0c8930595ceaabedff6e0003a95e4dbbf203047d00e8","observation_id":"e063775c-5aa3-4d83-bed0-678e4bbd5274","resolution":{"observed_at":"2026-05-26T13:52:25.931017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10186","last_updated":"2019-05-08T18:05:56Z","snapshot_observed_at":"2026-07-06T07:35:40.542174Z","submitted_at":"2019-02-26T19:59:15Z","title":"Attention is not Explanation","version":3},"cited_work":{"arxiv_id":"1902.10186","doi":"10.48550/arxiv.1902.10186","metadata_source":"pith","pith_arxiv_id":"1902.10186","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention is not Explanation","venue":"cs.CL","work_id":"dae37f2b-32da-4f0a-9478-5e06e96fa213","year":2019},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/1902.10186","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:dbb7c37c5e9d1284df0309bc77905d9722a1f5a93cc5300084409545e8741b7e","observation_id":"faf566b2-a17b-4c86-b456-91f8422ae026","resolution":{"observed_at":"2026-05-11T19:26:10.049196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.03731","last_updated":"2019-06-09T22:46:12Z","snapshot_observed_at":"2026-07-06T07:59:06.176354Z","submitted_at":"2019-06-09T22:46:12Z","title":"Is Attention Interpretable?","version":1},"cited_work":{"arxiv_id":"1906.03731","doi":"10.48550/arxiv.1906.03731","metadata_source":"pith","pith_arxiv_id":"1906.03731","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Is Attention Interpretable?","venue":"cs.CL","work_id":"d4f61bc3-cc04-4259-b5a7-33533967a29c","year":2019},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/1906.03731","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:0784af07c0e69df37e0c628b02f386c085416c014bbfb83da7c1a2521860b3fc","observation_id":"8995c1fc-aae9-4456-a8a2-78f6869d8565","resolution":{"observed_at":"2026-05-11T19:26:10.265219Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"dcefe14b-f108-430f-85fe-2a8b698e18f1","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:d3a4aa941f751da7f1c31e34ddb4c083e2813eb98b8466e1cf5ae7b1d561c929","observation_id":"1b64469a-0452-4fdd-9dc3-126027866f77","resolution":{"observed_at":"2026-05-26T13:52:25.951654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-01T16:50:50.645857Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":"2502.02013","doi":"10.48550/arxiv.2502.02013","metadata_source":"pith","pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","venue":"cs.LG","work_id":"7b4ac06a-e804-4f0a-8305-c45f2735afb5","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:127e0e9d1ccc8aedb334f1fcba7865731bfe0c7006ec8103c72697dec7d754bb","observation_id":"059b7852-da1f-4841-986f-df280b06a196","resolution":{"observed_at":"2026-05-15T16:30:37.615120Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13708","last_updated":"2025-02-24T13:31:08Z","snapshot_observed_at":"2026-07-06T19:35:26.421419Z","submitted_at":"2024-10-17T16:08:06Z","title":"On the Role of Attention Heads in Large Language Model Safety","version":2},"cited_work":{"arxiv_id":"2410.13708","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.13708","snapshot_observed_at":"2026-07-01T17:35:51.334325Z","title":"On the role of attention heads in large language model safety","venue":null,"work_id":"82e768ee-7fa3-4142-9ad9-36edebb57f37","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2410.13708","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:ed69ba99bc1e68a5f86133131e96c64e3fcfcfa100ab7f3b6ac0c64f476848c3","observation_id":"cc737df7-85e7-4416-ab3a-9c04ae0c2912","resolution":{"observed_at":"2026-05-11T19:26:10.092015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.15807","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The atlas of in-context learning: How attention heads shape in-context retrieval augmentation","venue":null,"work_id":"affdda88-a76e-4cbd-a7f0-ca6742338468","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:a1802fb9be189567ba2a96be367a3cecefa19bb58f94c2094f73bb914f435ee5","observation_id":"ee429dfc-1c89-46a0-9718-0521a8dcc4e2","resolution":{"observed_at":"2026-05-11T19:26:10.212145Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T09:35:39.274123Z","title":"arXiv preprint arXiv:2505.13737 , year=","venue":null,"work_id":"9bc19527-4ba2-42c7-91e8-07be89a8b006","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:d7ea85f2ea02961c0dc92e619a3a443e2c036756264c26140930c495b2f9ff2b","observation_id":"8573ee90-7223-4e22-a47b-bff9bb59007c","resolution":{"observed_at":"2026-05-11T19:26:10.224922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"55d71ea9-71b7-48f0-a7d9-724e2112274a","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:966fb920569cc5e23b958f765c8f99e9adfe7d40b2a01d6b9498543cc28b404c","observation_id":"2b32abe6-7a5c-49f9-9010-6754f4faa88b","resolution":{"observed_at":"2026-05-26T13:52:25.814547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"e81ff072-235c-46e0-ac6c-295dbb65b5bd","year":2019},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:55fb067ade476630a8c849291f7eec20938e23edb10263cff6a728dc182d53a8","observation_id":"e1848fd5-c362-4845-b254-6389a309252d","resolution":{"observed_at":"2026-05-26T13:52:25.821713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.01070","last_updated":"2018-07-08T21:42:31Z","snapshot_observed_at":"2026-07-06T06:37:07.054351Z","submitted_at":"2018-05-03T00:46:56Z","title":"What you can cram into a single vector: Probing sentence embeddings for linguistic properties","version":2},"cited_work":{"arxiv_id":"1805.01070","doi":"10.5281/zenodo.20361433","metadata_source":"pith","pith_arxiv_id":"1805.01070","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What you can cram into a single vector: Probing sentence embeddings for linguistic properties","venue":"cs.CL","work_id":"5c1ed2eb-ac9f-405f-82ed-5f9d302ae26c","year":2018},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/1805.01070","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:229ff42c5c3322161002611accff632b5bc34eebafa91ecb275613b80ef2ba62","observation_id":"98459c57-a0a2-4e59-bc59-ba4d30c679ba","resolution":{"observed_at":"2026-05-11T19:26:10.231206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T18:52:49.797613Z","title":null,"venue":null,"work_id":"6cf7052b-574d-4c0d-b651-d35057477ad7","year":2019},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:029e6dc290cf2decb99234adfbfba4083a4710734a16249110897f121da13517","observation_id":"a50ac0d0-b55e-4637-9e85-f1dc3e74fa31","resolution":{"observed_at":"2026-05-26T13:52:25.832774Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"cited_work":{"arxiv_id":"2303.08112","doi":"10.48550/arxiv.2303.08112","metadata_source":"pith","pith_arxiv_id":"2303.08112","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","venue":"cs.LG","work_id":"a127314f-7424-488f-b6d7-8214650c420f","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2303.08112","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:3eeef2b94ca13017f883c787c56714ee5582baced6b9489d0be6c7b11b579bea","observation_id":"869e285f-ade9-4909-b04b-55561ec773e2","resolution":{"observed_at":"2026-05-12T16:54:37.831311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:41.570848+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:41.570848+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:06:58.141461Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"45bf6068-2b01-466a-96da-dc3bd3edf3a2","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e3399668dbf67b994326df9b4b273d6015f83bd60c3c1e54d002c71defd04c25","observation_id":"02250f89-e70a-466b-a63f-79b471885148","resolution":{"observed_at":"2026-05-26T13:52:25.894952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04626","last_updated":"2019-09-05T14:11:27Z","snapshot_observed_at":"2026-07-06T08:14:07.617152Z","submitted_at":"2019-08-13T13:15:04Z","title":"Attention is not not Explanation","version":2},"cited_work":{"arxiv_id":"1908.04626","doi":"10.48550/arxiv.1908.04626","metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04626","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Wiegreffe, Y","venue":null,"work_id":"b752019e-b418-48fe-a0e8-6b6a46f30993","year":2019},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/1908.04626","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:037ce77c0b6a729adcc017ebdb6b7837f7965c89aea826a5c9a83caad248c87a","observation_id":"a18a5d08-e78a-4d76-ac78-c0397fe9774c","resolution":{"observed_at":"2026-05-11T19:26:10.260259Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Entropy , volume=","venue":null,"work_id":"2afbb69c-b68b-4253-9d9c-1cdc4a3f4204","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:cc8206a9a9d8bb894c6c86c045c6038c627a74666791c4689c7e7e1023b42fdb","observation_id":"b295bd63-3412-41dd-8125-43564fd2a9bd","resolution":{"observed_at":"2026-05-26T13:52:25.875560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-07-06T20:47:04.984599Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2503.03321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-07-04T03:19:31.045973Z","title":"See what you are told: Visual attention sink in large multimodal models","venue":null,"work_id":"e2353a49-e7c6-4ef7-9033-fbaaa4fc0e08","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:ae7704ba3caf70e745d843d535930a6975a6a86b278cd3cc6335b5385a262e3a","observation_id":"4566a0c8-e827-4395-bf5d-cb8ec66cd7a8","resolution":{"observed_at":"2026-05-11T19:26:10.066217Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21523","last_updated":"2025-06-20T08:41:41Z","snapshot_observed_at":"2026-08-07T14:44:18.138977Z","submitted_at":"2025-05-23T05:08:40Z","title":"More Thinking, Less Seeing? Assessing Amplified Hallucination in Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":"2505.21523","doi":"10.48550/arxiv.2505.21523","metadata_source":"pith","pith_arxiv_id":"2505.21523","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances in Neural Information Processing Systems , year =","venue":"cs.CL","work_id":"bb9acd95-b27a-4709-9dfa-75f62a65c716","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2505.21523","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:9d583e60bb756e95f66ca8aa3b98fca043a7d6e3ce88cde6ea3db3b4e06e95a3","observation_id":"66284184-9f59-437d-b3e7-cc5eb0d9b949","resolution":{"observed_at":"2026-05-11T19:26:10.200461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00535","last_updated":"2024-03-15T02:03:21Z","snapshot_observed_at":"2026-08-06T09:09:36.400979Z","submitted_at":"2023-10-01T01:21:35Z","title":"JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention","version":3},"cited_work":{"arxiv_id":"2310.00535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00535","snapshot_observed_at":"2026-06-29T14:33:30.605763Z","title":"Joma: Demys- tifying multilayer transformers via joint dynamics of mlp and attention","venue":null,"work_id":"6770e214-8101-4e59-98dc-74670c48e483","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2310.00535","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:ca0523470634b0ba7aeca3c29774106b84526c7ebae483e8cc62d722d0e4af57","observation_id":"0cc31f25-924d-4549-86fc-deeefac5c370","resolution":{"observed_at":"2026-05-11T19:26:10.189531Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: EACL 2024 , pages=","venue":null,"work_id":"7911f5db-cc9d-49bc-ae10-ab0bf0c70ed4","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e056e0053dcc0cda0e4cc4bb31921d4a0f1f120fc9330cb5aaae3e65aaef7a5c","observation_id":"53ffb285-ca53-494d-a9a5-2a96f7ffa0c9","resolution":{"observed_at":"2026-05-26T13:52:25.810187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer Circuits Thread , volume=","venue":null,"work_id":"bcccb029-991b-4ffd-babe-7a542262b811","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e69f1dbc8a3c20276dd45e0de545916c860ee60ec87dc4026e263c354624f90f","observation_id":"a482cf70-10cb-4360-9530-2a8890957c9a","resolution":{"observed_at":"2026-05-26T13:52:25.798965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":"2309.08600","doi":"10.1145/1390156.1390191","metadata_source":"pith","pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","venue":"cs.LG","work_id":"51960d72-c69f-4db8-8efd-e90e8b4d9524","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:45054687fc7c3bc62708fb8569526827d0f4e6bbce542c5ae58430a36d934323","observation_id":"1c663a01-8f6c-49c3-a04c-07649353b506","resolution":{"observed_at":"2026-05-11T19:26:10.142203Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:19.66582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:19.66582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17588","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interpreting attention heads for image-to-text information flow in large vision-language models","venue":null,"work_id":"8c35cac1-cba9-4bbf-85da-726213d4b19a","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:3458c9e736505ce68a9c0093df265cc83e4164b6391d5d4f1a4b231e40853c0b","observation_id":"b72b1a2e-e3e0-4cee-b8ed-0bffd4d89d67","resolution":{"observed_at":"2026-05-11T19:26:10.163074Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"691d7cfd-1995-4629-b0d4-3b75b94ef93f","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:1152c5459a8c12a7edca550cb01e9d33e5b48689aae45a5decac775b7b36d321","observation_id":"5c047616-2eeb-4cfb-8c61-1e59ee10b3ad","resolution":{"observed_at":"2026-05-26T13:52:25.802373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"28f2dba4-02cd-4568-b6f9-fe7e12ac4ddf","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:2972e75d5d664af8cdea31f7935477fc3f2ebd995701cff41fd1a89c1cc388da","observation_id":"fbf202cd-feb8-4368-8757-4ff4fa8cea35","resolution":{"observed_at":"2026-05-26T13:52:25.806186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.16570","doi":"10.48550/arxiv.2502.16570","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audenaert, K","venue":"arXiv (Cornell University)","work_id":"a43db906-defa-46a6-85bd-8335a6e5b9dd","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:20634706180ce2e2076bdf07a19f46231caf1d778937cb3a94d9b7aa35f51823","observation_id":"416363e4-a177-452b-9b2f-3fc84d4a6b27","resolution":{"observed_at":"2026-05-11T19:26:10.123957Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":"7cde2bf9-a779-475f-b0c5-7d4eb774837e","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:3b8c60e51098c347fd72b7ff14c42f45b801ad7680af7abd35acebcf3a5d1948","observation_id":"582439f8-2f8d-4a1e-a512-31cf8eae82ec","resolution":{"observed_at":"2026-05-26T13:52:25.789265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"4cd8c3ed-122f-4831-9e4d-db04794f294f","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:972eb7f028e31f0ab889ee90d2c567427abeb3fa3a12347345b32a8b4bbd8808","observation_id":"68192cf2-fa02-4f75-9eb4-565d652fa5c9","resolution":{"observed_at":"2026-05-26T13:52:25.795941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.03418","last_updated":"2025-02-02T05:37:06Z","snapshot_observed_at":"2026-08-07T16:00:31.742235Z","submitted_at":"2021-08-07T10:35:32Z","title":"Information Bottleneck Approach to Spatial Attention Learning","version":2},"cited_work":{"arxiv_id":"2108.03418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.03418","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2108.03418 , year=","venue":null,"work_id":"9e9ccb0d-3e0d-4db0-9fd6-5e9e6e1a7471","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2108.03418","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:45274f9d31e7e5a8eb378670748923d43ec05a6bf18ffe35de59e6871d8b2554","observation_id":"8786df24-8881-4072-a91a-9dd9282d2ff1","resolution":{"observed_at":"2026-05-11T19:26:10.054290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2013 , publisher=","venue":null,"work_id":"ef52eaf6-b45c-48ea-b704-1012057429c0","year":2013},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:72f7ff202bc5ede224079f95a72a69ba97447f4ac7b4ddc68b1f1be4cf8f8e28","observation_id":"7b8bde65-68ad-452d-937f-b81d0b44536b","resolution":{"observed_at":"2026-05-26T13:52:25.786288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:30:43.835230Z","title":"Psychometrika , volume=","venue":null,"work_id":"81851cea-7c1a-4cfe-909a-a36c58d0513c","year":1936},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:f76c30a93994e2edc55581b6753b5ae98d8fb89f04b5cb750a11044f45540a61","observation_id":"be60ccc8-a21d-4fc5-b356-39a8aa97636b","resolution":{"observed_at":"2026-05-26T13:52:25.778919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:54.232361Z","title":"IEEE transactions on pattern analysis and machine intelligence , volume=","venue":null,"work_id":"083c1550-b7c9-4d81-90f0-67038f2d75c7","year":2013},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:5c88aaaa005e219622c86516dcfe0e66d01ff47991b7c9d9fbc5457678786ee5","observation_id":"3b09be8d-effd-4cff-b471-ef6ec74b0257","resolution":{"observed_at":"2026-05-26T13:52:25.782738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2007 15th European signal processing conference , pages=","venue":null,"work_id":"01229472-f9ec-4525-a134-4ddee473bf48","year":2007},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:ef234a81bde32c718dceac4cab16df09b97ea4dc4a079397cc3293513c67c9fa","observation_id":"e5c836f6-a265-4b1d-a2cf-cbda0874fcdc","resolution":{"observed_at":"2026-05-26T13:52:25.792425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE Transactions on Information Theory , volume=","venue":null,"work_id":"894ecbbb-7c36-416c-9e4b-ab07f475a6e9","year":2014},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:f24e34d1e8e9e085a81d0283bd010666e8d22da09c820f790d3a86fde2aceb2f","observation_id":"7b5bee18-34de-4438-8c5f-64ad2e85a134","resolution":{"observed_at":"2026-05-26T13:52:25.872204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08164","last_updated":"2023-07-27T18:26:45Z","snapshot_observed_at":"2026-08-06T18:44:25.708968Z","submitted_at":"2023-01-19T16:56:21Z","title":"DiME: Maximizing Mutual Information by a Difference of Matrix-Based Entropies","version":3},"cited_work":{"arxiv_id":"2301.08164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.08164","snapshot_observed_at":"2026-07-08T07:34:43.110807Z","title":"arXiv preprint arXiv:2301.08164 , year=","venue":"cs.LG","work_id":"2645d62b-e608-4019-b93e-c8fe50ba552d","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2301.08164","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:f10928c5634b23cb4e7f741f22423847ef54e07a59ebd07dc831fdef13aca445","observation_id":"c1941ddb-a261-4aa2-97f5-48a9766bb1fa","resolution":{"observed_at":"2026-05-11T19:26:10.243588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T22:54:10.366246Z","title":"2000 , publisher=","venue":null,"work_id":"9d756909-648e-4375-8353-ac13e6e2d136","year":2000},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:43b7b8dfac82ef150d72543c5f83a9c11fa523ee2b6ddc4516c2c902c177e9f9","observation_id":"0e529cbc-50ef-4366-902d-a38a2320e034","resolution":{"observed_at":"2026-05-26T13:52:25.702582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SIAM Journal on Optimization , volume =","venue":null,"work_id":"966b00d1-2842-4cf1-a0ac-0cfce0d5df9a","year":2013},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:9f60c2578acb8455182f4fe6775994468db3a5cfed9824eeb6525296260a1317","observation_id":"0c8915c3-1413-49e0-9a25-05ed61ef3148","resolution":{"observed_at":"2026-05-26T13:52:25.760880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:36:25.498798Z","title":null,"venue":null,"work_id":"cbf6a5ee-db05-4028-b4e6-f2d33b45507c","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:2d8059b6b7d316ed6a932bb5f6c16dd79c4808b53b90890760cc0467cc1e73b7","observation_id":"00d19844-b119-4a6d-a77b-1c16d6e3f391","resolution":{"observed_at":"2026-05-26T13:52:25.764482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T02:41:49.887281Z","title":"Qwen2.5-VL , url =","venue":null,"work_id":"75820642-4784-4cff-9b09-aabb650e9f45","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:19c4a41d064453b7e46d8f331a5314c75dd3b098fd5b9c1e068ecaa2804e30e3","observation_id":"3b96c35b-2379-4378-b233-d154bf5d80f5","resolution":{"observed_at":"2026-05-26T13:52:25.768562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"cited_work":{"arxiv_id":"2505.15436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15436","snapshot_observed_at":"2026-07-08T23:55:43.041447Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","venue":"cs.CV","work_id":"c157db40-f1a3-4bf3-b004-55183727b771","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2505.15436","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:f3965529c57590423ca7cf0e60965b3c5d0b1cb6edacefb1811c13f53744b43c","observation_id":"068429b2-b2cc-4f67-aa7a-ad5a16f3cd40","resolution":{"observed_at":"2026-05-17T05:35:13.359401Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.13169","doi":"10.48550/arxiv.2504.13169","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.13169 , year=","venue":"ArXiv.org","work_id":"2edd3aa6-846e-40f7-8cf0-bf9ea693e345","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:efc647145e0234d94ca4badc61111d1d751c1d3b6d444e65189a8300702bcbb8","observation_id":"b0b33b45-c771-4775-bfdb-bdf3d1f2a3a3","resolution":{"observed_at":"2026-05-11T19:26:10.135954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , eprint =","venue":null,"work_id":"333d6b14-aadd-498f-9a8d-ffc91e4f200e","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:7f7e4a29bf25cee0b14b2c52eedf062c8a7b20c197573b54c27d0b17bf3d9898","observation_id":"b89aab72-9ed6-4827-9fa9-b98d581fbfde","resolution":{"observed_at":"2026-05-26T13:52:25.732377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18129","last_updated":"2026-04-16T06:56:57Z","snapshot_observed_at":"2026-07-06T21:29:26.614513Z","submitted_at":"2025-05-23T17:41:14Z","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2505.18129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.18129","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One RL to See Them All: Visual Triple Unified Reinforcement Learning","venue":"cs.CV","work_id":"a6ef804b-0440-48f6-8877-81523ce7a7ec","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2505.18129","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:13cee0ea8fac62a841545f34c48b319d3866e36901d4a62c7680c4b13dcffbd2","observation_id":"2d660488-8df8-493c-b415-64407d051e5d","resolution":{"observed_at":"2026-05-11T19:26:10.205409Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"43f10e7a-ce3b-43e7-9333-40b8d932868c","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:460b7a4f2ed5f5c71c9608c67a5119d81ee8e43d8b6d5ccfb176159df2130650","observation_id":"3a1acca7-8ab1-482a-b535-af5f2fc2878c","resolution":{"observed_at":"2026-05-26T13:52:25.750439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T14:52:36.576509Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"994b398d-ad39-47c0-83a0-1f5e95fe8b8f","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:8255a498477e8e855bb8369d0b18ee95dc96c1a1c1f1bffdb80aa9d4b20bef51","observation_id":"b489444c-9990-467b-ad5b-d1839a80b7c3","resolution":{"observed_at":"2026-05-26T13:52:25.743639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:16:16.357374Z","title":"2024 , eprint=","venue":null,"work_id":"03076031-5b7d-4563-9dd7-21b7b28bf714","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:9e9a15a18e19422085e2bd466e85d34ca2cd789078a9de73ae3887453cd8fbbf","observation_id":"4e174427-276f-4403-a7dc-185accbf5c0b","resolution":{"observed_at":"2026-05-26T13:52:25.747403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:20e13f326b07e13aa8a1e0c2c182da1472121683e97b9edc3b4f7867ba8ef665","observation_id":"201d3591-14c6-4433-bd73-8b72a85ee21c","resolution":{"observed_at":"2026-05-11T19:26:10.128001Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T20:52:55.287956Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , url=","venue":null,"work_id":"e71d9099-0256-41d4-aa32-5c68d9b02eb8","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:33683c3692d90391a33f199547ae4432749723c396f03f30f8894a8de29b605b","observation_id":"88827a89-69bc-4140-8d0e-df0bc41c67b9","resolution":{"observed_at":"2026-05-26T13:52:25.757711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , address =","venue":null,"work_id":"e3758070-907f-4ecd-af6b-c4e2e1baab51","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:be02561afa288d70e18ad9910f2cf26ff97a00d734fceba14aff8808b7b6d7bb","observation_id":"3e58b132-cb45-4261-a6ff-cf5b3f4b1ecc","resolution":{"observed_at":"2026-05-26T13:52:25.753594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"0788e527-65d5-49a4-97d5-5c10ee7d74b7","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:eda3790949a8d73617f8a039b382dcbde49906c5fe13fa0716a143054589490c","observation_id":"e5a27a54-120d-4d86-93d5-f11fd28dca30","resolution":{"observed_at":"2026-05-26T13:52:25.740607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , note =","venue":null,"work_id":"6b3c47a8-71e4-4a5f-8abe-1ddfda018080","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:5c9b2f0b9d33f7446a769f277867a4c31ddaa4e6aedc06c155fd53bb9088a5f4","observation_id":"5387310c-4297-4e22-8ad6-78466a78c815","resolution":{"observed_at":"2026-05-26T13:52:25.737734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5a3e44a8-e038-4607-9b91-d80ff184d76f","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e20f8d15d11271e5d6c821a238727c1655931e33c73dc7be841901b079321742","observation_id":"35fb147b-bbc6-4a9b-865f-8ffeef1582d9","resolution":{"observed_at":"2026-05-26T13:52:25.735348Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"61a8f407-2bb6-48f1-9830-dc5712a6d1dd","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:7f71b29fa5a6e3ac771756db149b57a7ebeedab5d8090e086f99f22f1c9c53ba","observation_id":"6de9c8d1-a24e-4ab3-8d4a-51407cc339f2","resolution":{"observed_at":"2026-05-26T13:52:25.839251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:3d846d102080937d6ca1013a298272ea78a7b9bc978981cc2a7fe25e8ea559e2","observation_id":"ae25341f-7933-40f2-b1e8-8a8e3996bf99","resolution":{"observed_at":"2026-05-11T19:26:10.101788Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:06:50.994475Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"4c2b279a-b55b-43e4-aba9-fcf6abc67ef0","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:44d663c57e8cb170f8e20d9210a4ee7ce340e5eb2eb36e300d953fb08644f7de","observation_id":"d930e8e3-ff68-42d4-9052-34bb2f705894","resolution":{"observed_at":"2026-05-26T13:52:25.721632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:b3412b9737a18708b57281af07dd83d71390fb5bb573aabdd4de90b2a3386de4","observation_id":"a2eef8cc-ba56-442e-93e0-eb4c4cc9eb7f","resolution":{"observed_at":"2026-05-11T19:26:10.193278Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12233","last_updated":"2024-02-19T15:42:54Z","snapshot_observed_at":"2026-07-06T17:32:19.965690Z","submitted_at":"2024-02-19T15:42:54Z","title":"Empirical Study on Updating Key-Value Memories in Transformer Feed-forward Layers","version":1},"cited_work":{"arxiv_id":"2402.12233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.12233","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2402.12233 , year=","venue":null,"work_id":"6cf756c0-e947-4845-a624-2c0525f87e6a","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2402.12233","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:67052f504d0cab03708a61aa474fa460b00be0572c6b11a49fa919fb2e98f36c","observation_id":"60539a78-41af-4516-b11e-075c43b1aac0","resolution":{"observed_at":"2026-05-11T19:26:10.270566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"07c17032-ec53-4224-ae76-f4d395a73931","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:0709884eb5e6956f8080edf42f737dc266213863a2c4c2bd4c3055ed4ce28994","observation_id":"5993c2d1-ee84-4ba1-81d0-70fdae14862a","resolution":{"observed_at":"2026-05-26T13:52:25.850886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"29c45afc-4b8b-4676-b20d-a06b4555ea03","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:846c8b2c1c498b525e1fd2dfc794c652d92682c3a1c6521ab90f986102224f6e","observation_id":"d667b1c1-b3f7-433f-b04b-10ad27b3eb1b","resolution":{"observed_at":"2026-05-26T13:52:25.729140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11501","last_updated":"2025-05-29T09:18:35Z","snapshot_observed_at":"2026-08-07T05:22:45.710943Z","submitted_at":"2025-02-17T07:05:36Z","title":"Token Pruning in Multimodal Large Language Models: Are We Solving the Right Problem?","version":2},"cited_work":{"arxiv_id":"2502.11501","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11501","snapshot_observed_at":"2026-07-04T07:59:40.278596Z","title":"arXiv preprint arXiv:2502.11501 , year=","venue":null,"work_id":"e464475a-9870-43b1-8060-a9866dce6505","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2502.11501","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:d067bfd3e5653fc28c2c980360a31ecf421466f731ac9c995ae80aeb6b6f6cbc","observation_id":"a5d929e3-9f52-43a3-a9b2-05d1577c64ae","resolution":{"observed_at":"2026-05-11T19:26:10.080049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:33:53.667699Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":"c9e852df-fd5d-4c02-8f60-78e4f614d3f4","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:95e6711872b726d6d7948f6a79ecb1f20c5e761b216c5be9ac2ba7186a78a0cb","observation_id":"4f5c6dd2-36da-40b3-a1bf-a61ed64292af","resolution":{"observed_at":"2026-05-26T13:52:25.712121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.21518","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:42:26.071499Z","title":"arXiv preprint arXiv:2510.21518 , year=","venue":null,"work_id":"5f3341a7-b84c-416c-939b-22d3afad9b2b","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:ae3c5aa5b930926772bccb710aa367dcfd3f316af0e1a584f664b3536b1d751b","observation_id":"912cd2c2-2b7a-4ebb-9ca7-916f73994568","resolution":{"observed_at":"2026-05-11T19:26:10.075678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":"8054e547-7082-4471-a0e7-c3e0183c3942","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:cd34e221a292e6492554df9cb4f41ae6b9f78a3b605d16c44c2c9dceecbc6e94","observation_id":"ecc35f15-70b4-4455-8d19-fa734d3cbdba","resolution":{"observed_at":"2026-05-26T13:52:25.715039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18048","last_updated":"2024-02-28T04:56:21Z","snapshot_observed_at":"2026-08-04T05:17:17.897641Z","submitted_at":"2024-02-28T04:56:21Z","title":"Characterizing Truthfulness in Large Language Model Generations with Local Intrinsic Dimension","version":1},"cited_work":{"arxiv_id":"2402.18048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.18048","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Characterizing truthfulness in large language model generations with local intrinsic dimension.arXiv preprint arXiv:2402.18048","venue":null,"work_id":"1265b775-1264-4f16-b798-23479da51adb","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2402.18048","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:1f85a95bcefc1e50d45883e03957e1cbb83f0970ca3634aa8194d8ecdada1cba","observation_id":"635985ab-d5ac-4a52-86d2-2c5fcd355c6a","resolution":{"observed_at":"2026-05-11T19:26:10.184826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15812","last_updated":"2025-03-02T12:28:24Z","snapshot_observed_at":"2026-07-06T18:35:22.425271Z","submitted_at":"2024-06-22T10:36:04Z","title":"Intrinsic Dimension Correlation: uncovering nonlinear connections in multimodal representations","version":2},"cited_work":{"arxiv_id":"2406.15812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.15812","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2406.15812 , year=","venue":null,"work_id":"01ca5d4f-b8fa-4a23-9df4-e3aaac44d777","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2406.15812","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:a3c739f3fa5af2a3d3f015c6d4abeebc9813cfea9de24e7e09378373081aef01","observation_id":"a7996abb-467e-476c-9d6c-b2d086734f16","resolution":{"observed_at":"2026-05-11T19:26:10.150605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-second International Conference on Machine Learning","venue":null,"work_id":"850a3797-dfc9-4a57-8384-ea709fe5ff87","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:3e73e4348968e70c86ed73e6ce0a7c8eb9c29bb0a03e7c8593d0c5dafc36bde2","observation_id":"6f00ac41-e549-4122-a7fc-3f2c6c5782db","resolution":{"observed_at":"2026-05-26T13:52:25.708875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forty-second International Conference on Machine Learning","venue":null,"work_id":"ba7170d8-4d42-456f-955a-b7973590f105","year":2025},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:eff4b47630d3040f413006d5b32e9c2796133ee160982b69bc105e5b3277eebd","observation_id":"1eb70753-24ce-431f-a34b-ec06fc5a0e49","resolution":{"observed_at":"2026-05-26T13:52:25.718168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:08:01.568147Z","title":"Neurocomputing , volume=","venue":null,"work_id":"0cfd4ae7-837c-4c4f-bf6d-afc10f5a8ed1","year":2024},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:fc7e1af90701ca27306261fe0fb2f07ca02c0feb6e56d2c3c843b9d3c87f6c64","observation_id":"d63fac20-b46f-46b1-9877-a7256ccc21d8","resolution":{"observed_at":"2026-05-26T13:52:25.861266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft COCO: Common Objects in Context , booktitle =","venue":null,"work_id":"b9159ff1-a443-46bf-9328-2232abd90fe2","year":2014},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:57d6a5b4e56b9e3962109b826b9c32dfa39e562bb4d5c2bfc7f119159333354c","observation_id":"3d4ac313-d8bb-4bf5-8623-7661961cc025","resolution":{"observed_at":"2026-05-26T13:52:25.705691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.11986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T08:33:15.417241Z","title":"Lost in embeddings: Information loss in vision-language models","venue":null,"work_id":"c99eaa68-4d66-4198-950d-044e907ffa81","year":2014},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:95ffc803e5ef88975382bbc06093e16b37e3dda2104229326f672a7fcb7d2279","observation_id":"6c377550-8827-4dc7-b79b-dab140750c4e","resolution":{"observed_at":"2026-05-11T19:26:10.177589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:10:44.718897Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"1b7058b4-ca1e-4e67-967c-0af5f4d8caea","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:796d0bc14c1e8ebe5ad4463df299512ab11a0dacdbf940da53e6d64e0a8ec653","observation_id":"18d20210-6506-470c-993e-8ef6ab7ba764","resolution":{"observed_at":"2026-05-26T13:52:25.911527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/cvf conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"6634ad7c-7c68-474d-9183-593fd7912179","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:bd6cbe578f056713d1b9cd4b7f35b06a150eacb99cdef7352c97ef9884058076","observation_id":"db8789d8-9a56-4ceb-ac7f-8ebf9a68d692","resolution":{"observed_at":"2026-05-26T13:52:25.696101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e098b42e98fb7c306fe440f8bddbb867072e9763afe236024cb3e3ecfd23e83d","observation_id":"89e85854-9e2f-4a16-8249-a43253fd8e4d","resolution":{"observed_at":"2026-05-11T19:26:10.087311Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"5d2f4e94-3656-42da-a179-55874b9e61b3","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:f6147d5ef0611332df2c135809a84a8e12645c66b79fbf87ca4e1206ec1eea61","observation_id":"989e81c3-98d2-487b-882d-8b6f8a2bdf41","resolution":{"observed_at":"2026-05-26T13:52:25.699628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European conference on computer vision , pages=","venue":null,"work_id":"7139f0e1-e2fc-498c-aa8b-8b8f18914bdf","year":2022},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:f7c9238167c59976a7e77f69ef5965589cb36f482b6a9182d80c8ae2baec3aef","observation_id":"74919e17-09df-484e-8232-213e2d76e562","resolution":{"observed_at":"2026-05-26T13:52:25.725215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.604503Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5a531bea-f0ed-4a69-b5d1-8b51e8974e5a","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:a1ddf82afafd0749bda962d31e64036a574324fea61b1863efacb20dec147e30","observation_id":"861aa146-28df-4eeb-a40c-f0c255f10a4e","resolution":{"observed_at":"2026-05-26T13:52:25.775530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"0e1512b5-5327-474c-84cd-095956a17b2c","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:da0c6f6070c44fcefb60fd01d0afe6d5786462692ae4d5e3c5e88d6b63012153","observation_id":"190f78a1-64fd-4c96-b180-65b8048bd918","resolution":{"observed_at":"2026-05-26T13:52:25.835778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"c6c58a65-ce5f-4907-8bff-b3218936b321","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:20e4f39a8db04ab4343f7658d338d081d317530d279d51a0d65ce5c575f063b3","observation_id":"4a7c1da0-d9a6-48c7-af51-432ad6f89c8e","resolution":{"observed_at":"2026-05-26T13:52:25.924869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"96ee0538-13ad-455b-acc4-ae89bb0b0dcc","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:c485d2e407098612127313ca53f3e9433647ccc7258395388e3fb57e21e4103a","observation_id":"3b5ff55d-546f-48b7-b430-d2b787eee422","resolution":{"observed_at":"2026-05-26T13:52:25.915062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"24658033-fc1a-4b8e-a5a3-36aafeac0a50","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:12736d45c5094d652404a9aa18bee14f2ec9ec9eeb9115de3c01d09f1ad836be","observation_id":"de248ec5-5dcb-465e-a4ce-603797241e82","resolution":{"observed_at":"2026-05-26T13:52:25.904816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 international conference on document analysis and recognition (ICDAR) , pages=","venue":null,"work_id":"c53c35d3-1791-4921-8d13-d4f9569af1d0","year":2019},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:d0808abfd227617751dd7b2506481f62a4c1a8eda140760605cdd1b3402ebf75","observation_id":"3bb661be-b375-479f-8ec9-11b986d45457","resolution":{"observed_at":"2026-05-26T13:52:25.908069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"df24e8e2-1014-464b-a122-cd1257d90670","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:b31b67706a871f61781bdb85601b534d8837e29021a8e42e57c27082dae208bc","observation_id":"81a5c754-9d88-4a9e-b8ea-a0eb599dce08","resolution":{"observed_at":"2026-05-26T13:52:25.918280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF winter conference on applications of computer vision , pages=","venue":null,"work_id":"4d76c18b-0648-4707-bb20-f5a803c01353","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:52fa910ee3549de313835e5bcd03ae30fb132aff2a8079347d352f02b969dab5","observation_id":"bca0cddb-f28c-4606-b0d5-7739454cf8e2","resolution":{"observed_at":"2026-05-26T13:52:25.927772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":"16114599-1da4-44e2-b1f2-b2d20f2d9f9e","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:a4726400b008f365cb9b1c9b9f7ac09a3f1a1e67c7b31d241b9a87b6cd4b4e65","observation_id":"b898e084-f28e-41b2-a8bd-a7a276d22f88","resolution":{"observed_at":"2026-05-26T13:52:25.944629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the association for computational linguistics: ACL 2022 , pages=","venue":null,"work_id":"3924e316-73c5-4413-a06d-cf1b52fd46af","year":2022},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:a07e90de4968dd8244c41fc21784cd556eda872e54cca08f31e2b81a1d18acf2","observation_id":"b8de3f03-d4b1-433d-8177-a1d4fda22277","resolution":{"observed_at":"2026-05-26T13:52:25.901680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":"2404.19205","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-07-04T21:00:09.470383Z","title":"arXiv preprint arXiv:2404.19205 , year =","venue":null,"work_id":"6158fe16-6333-4da2-ab5d-d0d3ee6ee6da","year":2026},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:dbb942e97347b8ab22cec38bd3b46c4b9a7bb98adabf7660ea11ff66d16d2505","observation_id":"337392d0-cd18-4361-8da3-3c078145457c","resolution":{"observed_at":"2026-05-11T19:26:10.158675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European conference on computer vision , pages=","venue":null,"work_id":"ed0aec9c-baee-4b51-a1fa-218a8e34cbf4","year":2016},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:e0252136e85a14861d187d9c79f90c75e7864227aa731ffe441bd072ece5794d","observation_id":"19cfb20e-dd59-4195-9f13-628dc819a40c","resolution":{"observed_at":"2026-05-26T13:52:25.891445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , year=","venue":null,"work_id":"3ff91f4d-5708-4bfc-b1d8-f6a8f9073fd0","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:6bbcec202459e76e2f36d4a8366eaeb57b7d63cf714cdb3866240e182e7a7ce9","observation_id":"09b73168-6da8-44ac-b4b9-191051aee032","resolution":{"observed_at":"2026-05-26T13:52:25.881827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pattern Recognition , volume=","venue":null,"work_id":"b80140a2-07f7-4759-9c98-57a29b525ccc","year":2013},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:0bfdba503844cb3f5364f9ef1a78d6934ce921c8c9cc11cb70a241402d8096f0","observation_id":"f8fd19c9-641b-4e45-be0a-d40216b67aac","resolution":{"observed_at":"2026-05-26T13:52:25.771786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International radio consultative committee international telecommunication union, Switzerland, CCIR Rep , year=","venue":null,"work_id":"21c9e497-d075-4429-8c31-e6485d0565ba","year":null},"citing_paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-08T11:54:01.224588Z"},"links":{"citing_paper":"/paper/2605.05668"},"observation_digest":"sha256:cbf3daf66817e4b1a713f7bf73bf61fdba2402a5205beec6a6ed6b6157db9396","observation_id":"6d1d8e82-7c52-4633-a306-9b10674a8cdc","resolution":{"observed_at":"2026-05-26T13:52:25.878524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.05668","last_updated":"2026-05-07T04:45:52Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:18:17.333660Z","submitted_at":"2026-05-07T04:45:52Z","title":"Large Vision-Language Models Get Lost in Attention"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":22,"parse_uncertain":0,"unresolved":4,"verified_exact":11,"verified_fuzzy":63},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 5 inbound Pith citation observations for arXiv:2605.05668."}