{"as_of":"2026-08-16T14:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb5327ae29b404552cc0b6c55044913dbf59a414df0a20d18532f4be6b591e85","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:06:49.290784Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.05626/citation-record","integrity":"/paper/2505.05626/integrity","json":"/paper/2505.05626/citation-record.json","paper":"/paper/2505.05626"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.688399Z","title":null,"venue":null,"work_id":"4de1a259-4681-43e3-9610-b608f06eb622","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.185329Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:2bba832123cc9ed1466b05ffff7b02bed4a1a00db78cfb3d2b92ce97d6df202f","observation_id":"3dace842-e939-43af-b761-3563d2ff32e4","resolution":{"observed_at":"2026-08-15T23:06:49.692845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.675405Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":"ad5bc2ec-d709-4622-9cd1-22ba76adeb45","year":2023},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.190221Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:cd831ddaf0ff026f17a4d5a6b6300f3d58582f0803fbc20854bd28b2da670686","observation_id":"0d8090c1-07b4-4f97-ad1d-4b078e715398","resolution":{"observed_at":"2026-08-15T23:06:49.679539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-15T23:06:49.194642Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.194642Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:d044fbe0385217598d0866cb8228c6f4fc7d4059ad2ef8883c6ac11bd2d20205","observation_id":"c9a3fce8-87bf-422a-ba77-fa9d7cacfb40","resolution":{"observed_at":"2026-08-15T23:06:49.194642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14142","last_updated":"2022-11-17T16:20:21Z","snapshot_observed_at":"2026-08-15T17:06:40.311739Z","submitted_at":"2022-10-25T16:42:03Z","title":"From colouring-in to pointillism: revisiting semantic segmentation supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14142","snapshot_observed_at":"2026-08-15T23:06:49.199068Z","title":"From colouring-in to pointillism: revisiting semantic segmentation supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.199068Z"},"links":{"cited_paper":"/paper/2210.14142","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:8b3c4f6c0d3753776cfe7e070a57e5e63274d4ba9fd24aa4a91c66b3b58fcfd1","observation_id":"83cb824a-d8a7-444d-adf8-035a30653275","resolution":{"observed_at":"2026-08-15T23:06:49.199068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14402","last_updated":"2024-11-21T18:31:25Z","snapshot_observed_at":"2026-08-16T12:57:42.983932Z","submitted_at":"2024-11-21T18:31:25Z","title":"Multimodal Autoregressive Pre-training of Large Vision Encoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14402","snapshot_observed_at":"2026-08-15T23:06:49.204156Z","title":"Mul- timodal autoregressive pre-training of large vision encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.204156Z"},"links":{"cited_paper":"/paper/2411.14402","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:1aa8fa9a67344d47ef37217ce1b6c5cab051eb6366354e875ff2e4c934595307","observation_id":"c231a48e-3a5c-4215-a6d1-6c23b9219b01","resolution":{"observed_at":"2026-08-15T23:06:49.204156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T23:06:49.208740Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.208740Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:07a02d2ada278710f0e5b74ae04e444c384d625880447fd0d9e298e96d3bf814","observation_id":"c9d423cd-3234-4f39-bc5c-59a7505f519c","resolution":{"observed_at":"2026-08-15T23:06:49.208740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.662523Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"23eef57b-56cd-48a0-8155-913036ff6437","year":2020},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.214294Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:b28566b9d9a6fe41c2d3d38cc50bb661f105b1f5eeb73360600f53c226ea1613","observation_id":"2ce9a543-525d-4b16-b5f1-56ab96fb1fc6","resolution":{"observed_at":"2026-08-15T23:06:49.666781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.649447Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"7d499e87-9a6e-48cc-aefb-30fb0c1aa527","year":1956},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.218511Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:f60d31f15de6be2587e391fadb6091ce8a352ae00322a9aa4162aae3a53d4e68","observation_id":"e565e41f-649b-4594-8d4e-23f0bb47a7f3","resolution":{"observed_at":"2026-08-15T23:06:49.654002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04996","last_updated":"2025-05-08T01:53:55Z","snapshot_observed_at":"2026-08-14T02:18:08.215462Z","submitted_at":"2024-11-07T18:59:06Z","title":"Mixture-of-Transformers: A Sparse and Scalable Architecture for Multi-Modal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04996","snapshot_observed_at":"2026-08-15T23:06:49.222650Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.222650Z"},"links":{"cited_paper":"/paper/2411.04996","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:88318bb2f3fad8523b686dd8f879f51ad5cac4016fceb76b2b653e6455f2b7b8","observation_id":"058f94bb-38e4-4873-8a6f-cdc5645d5cc8","resolution":{"observed_at":"2026-08-15T23:06:49.222650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.637016Z","title":"Visual instruction tuning","venue":null,"work_id":"b49bfd48-6240-4ce2-ab62-a84737227ace","year":2023},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.226922Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:2e0d5edf07206b3627ffa8b8581b25eb26e1ba49e984c9a99d72f69281e87fdf","observation_id":"b9807f5c-88de-4f85-9435-c86598a4344e","resolution":{"observed_at":"2026-08-15T23:06:49.640996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.230819Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.230819Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:777843fd046bc764a30fef839e2b041619a7e46aeada31988e6ab2cb13fc12bf","observation_id":"ba66a892-f2be-4524-a828-e81cf705a085","resolution":{"observed_at":"2026-08-15T23:06:49.230819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.614643Z","title":"Vision language models are blind","venue":null,"work_id":"4a0c2df1-ae0a-467a-a3d2-4d32ddacd982","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.234940Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:cdedb75ae76d2dc378443540253593848ac96b5bba73a15e57b880649e1421d6","observation_id":"6fc286c2-30da-43c5-af8c-a801e47ba9f7","resolution":{"observed_at":"2026-08-15T23:06:49.619327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.600560Z","title":"Am-radio: Agglomerative vision foundation model reduce all domains into one","venue":null,"work_id":"e5352377-b10c-4a57-9f94-ff237f3bb492","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.238981Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:bfbcb49274f53958988eb4ed436cffc928f207c24a3d648ca737d2e761641292","observation_id":"a3d89823-2811-4467-8393-ecaefd6298ee","resolution":{"observed_at":"2026-08-15T23:06:49.605236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.586646Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":"d6a788a3-47c3-49f8-bce2-7c8c19735990","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.242786Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:0287eec056eab418d6fcd0b39b17fd30a27a3cabf93cee5dbcf5c9db23c34df5","observation_id":"3999e065-746f-4cf2-9d14-73ee2e0163bb","resolution":{"observed_at":"2026-08-15T23:06:49.591033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.573716Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders, 2025","venue":null,"work_id":"1deb5ee5-1af9-495a-9f9c-8fd8fd3ca467","year":2025},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.246827Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:2577fd664d2a38d4a31c8b457a70c6847c1459d6bd0a3cf7be3389d5d7698284","observation_id":"013f002a-5d4e-4f4c-ae2d-b02673928a89","resolution":{"observed_at":"2026-08-15T23:06:49.578106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.561210Z","title":"An empirical analysis on spatial reason- ing capabilities of large multimodal models","venue":null,"work_id":"364b1c1b-41e6-4013-851a-3fb55f410d9e","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.250843Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:1ddc1da638ebd281b0dfeacf8267084e423c7c55cc854a661e8880cf0cad4a3e","observation_id":"d6876a80-5e66-4a3c-89eb-4126c3eeee25","resolution":{"observed_at":"2026-08-15T23:06:49.565288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.254574Z","title":"Sparkle: Mastering basic spatial capabilities in vision language models elicits gen- eralization to composite spatial reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.254574Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:4acb7db7c0d676b4ca8f0a31a86344d0f3e7d8c76b040fc477049d4de7834dea","observation_id":"9efa1615-e701-4c5e-8364-7242022bc0b6","resolution":{"observed_at":"2026-08-15T23:06:49.254574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.548032Z","title":"Cambrian-1: A fully open, vision-centric explo- ration of multimodal llms","venue":null,"work_id":"e6a5485c-32c2-4b92-81f1-f676305371ab","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.258487Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:343360911f12d0cf9e5f5ba19fe5fdaf250b2269db71f732ba771eed1a26c6e9","observation_id":"18a6c9d6-e108-462e-a853-f4af6e022a58","resolution":{"observed_at":"2026-08-15T23:06:49.552250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.262424Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.262424Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:f7da9e910897483818c0308323136744d55453f5efbd7172026f06ac04915045","observation_id":"dbca669c-abaa-4d6c-8a43-a6df314ccbcb","resolution":{"observed_at":"2026-08-15T23:06:49.262424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.525987Z","title":"Is a picture worth a thousand words? delving into spatial reasoning for vi- sion language models","venue":null,"work_id":"f05cf9d0-8c0a-4a75-843f-311e4f036847","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.266213Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:85ca855d183daa585a06b9a92472ddad8a4bb1ee3e78fb4bc07ced7f12f67cd8","observation_id":"b5c0014b-a35e-438f-8a7d-38f912c2dc6b","resolution":{"observed_at":"2026-08-15T23:06:49.530294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.512224Z","title":"Cogvlm: Visual expert for pretrained lan- guage models","venue":null,"work_id":"b985f8a0-0adc-450c-9447-ed7a315bcc65","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.270221Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:1150187af591ebe2c5c77d7be5a4a51048941474cb4264838382516cdb08b02d","observation_id":"2ab09e69-0a89-4155-980e-9eb6e2ac21cc","resolution":{"observed_at":"2026-08-15T23:06:49.516505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-16T14:24:48.404762Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-15T23:06:49.274106Z","title":"Mm-llms: Recent ad- vances in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.274106Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:1cd427651ea39979a70c5ea5b7250ecb523959142d2131ce3e4a5a9040eda1b7","observation_id":"d4faa040-7b49-45a5-bd45-318db2895f37","resolution":{"observed_at":"2026-08-15T23:06:49.274106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.498924Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"6b6ae6c3-5f8f-4e36-9736-5ea0897ce616","year":2024},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.278600Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:4168b202eddd36920de45116648ba5ce49567e1a765cee71ba08dd16666cad31","observation_id":"d865d26b-9e31-4d0f-be5e-ab97492a1744","resolution":{"observed_at":"2026-08-15T23:06:49.503755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07973","last_updated":"2024-04-11T17:56:05Z","snapshot_observed_at":"2026-08-16T14:01:39.123151Z","submitted_at":"2024-04-11T17:56:05Z","title":"Ferret-v2: An Improved Baseline for Referring and Grounding with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07973","snapshot_observed_at":"2026-08-15T23:06:49.282590Z","title":"Ferret- v2: An improved baseline for referring and grounding with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.282590Z"},"links":{"cited_paper":"/paper/2404.07973","citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:746af3292c886a125120aaa37a402adb2dc5aa7ab471e288b88b9a6959ead599","observation_id":"1401d02a-b2a4-4778-9fd6-99ef7e1098a0","resolution":{"observed_at":"2026-08-15T23:06:49.282590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.471889Z","title":null,"venue":null,"work_id":"f08cacfd-42e7-40b0-a411-6417f8d8898e","year":null},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.290784Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:0fe9118589bc758ec5bd7284c1926a62969fb075d255adeef4aa162635746341","observation_id":"bd48bbfe-147f-4335-808d-61f7fae9aff1","resolution":{"observed_at":"2026-08-15T23:06:49.476853Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:06:49.485748Z","title":null,"venue":null,"work_id":"e3dec9b7-2416-462a-abe4-90b745ffcc45","year":null},"citing_paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T23:06:49.286769Z"},"links":{"citing_paper":"/paper/2505.05626"},"observation_digest":"sha256:d7b571d4770195439370dccbca635cee8e69cace48f5e6549106a9a621349bb8","observation_id":"f920a5cb-03e8-4ee9-a0ea-a7d27d415fdb","resolution":{"observed_at":"2026-08-15T23:06:49.490235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.05626","last_updated":"2025-07-02T07:30:12Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:58:32.509953Z","submitted_at":"2025-05-08T20:04:27Z","title":"Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2505.05626."}