{"as_of":"2026-08-08T01:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dcd8e29ec7e9312715a5aabddb197b0b05578d6ed475d577652c9c90f088dbb6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:41.212978Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:8049d8decdebc0670fab94a1190a3766b7021dac6b95e8c293bdf1ac7a87ffff","observation_id":"761d635e-cc0e-4563-abd0-2d153a7b3767","resolution":{"observed_at":"2026-05-13T22:21:15.804400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T13:21:41.212978Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23828","last_updated":"2025-05-28T07:44:10Z","snapshot_observed_at":"2026-08-07T13:13:42.422712Z","submitted_at":"2025-05-28T07:44:10Z","title":"Spa-VLM: Stealthy Poisoning Attacks on RAG-based VLM","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:41.212978Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2505.23828"},"observation_digest":"sha256:516e9bd680279779e7451aa5bfcf478d524e1438b1a843a46bdcfdeba39c230d","observation_id":"33163676-9942-43da-96e7-7883f6a5b377","resolution":{"observed_at":"2026-08-07T13:21:41.212978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T12:42:26.469919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-07T21:48:31.035838Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:26.469919Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:273baffd7fa62d772508bf018d167a5edc81a65ff47c9842aedfc4947246cb7d","observation_id":"6141965c-c4e6-409f-9782-80e21e49fed8","resolution":{"observed_at":"2026-08-07T12:42:26.469919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-07T13:18:47.669708Z","title":"EV A-CLIP-18B: scaling CLIP to 18 billion parameters.CoRR, abs/2402.04252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-07T13:09:47.854060Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:47.669708Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:4062585af9b6418ef755bfb7860b0374e71ac038083ebce67f1ede4e10dccbdc","observation_id":"4ac52ac6-a3b7-487b-a43c-42578b84fa9e","resolution":{"observed_at":"2026-08-07T13:18:47.669708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T23:20:52.199619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01042","last_updated":"2026-07-13T08:14:05Z","snapshot_observed_at":"2026-08-06T23:24:25.104389Z","submitted_at":"2025-06-23T09:58:35Z","title":"Can Argus Judge Them All? Comparing VLMs Across Domains","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:20:52.199619Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.01042"},"observation_digest":"sha256:222dc7d7a30c9e6de2b8fad9b920998aeb9a534e0517a1957e0e9f4406e57ed7","observation_id":"b287334b-6846-47e4-9a02-02e8a143c3d6","resolution":{"observed_at":"2026-08-06T23:20:52.199619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T21:06:26.749785Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-07T00:29:04.154876Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.749785Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:de8ef6223674f4fb70497477cf3ce96238767d5cc01d147f3b853d1be82a88d5","observation_id":"4d1c2b4e-a74b-4f70-8c1c-f0b2b2932a61","resolution":{"observed_at":"2026-08-06T21:06:26.749785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T17:55:45.406624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-06T19:46:33.050466Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.406624Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:6df54a6e613f4796c06d9ed55f67e08e8591302b3e1db3a60bb168a79afd3041","observation_id":"1e092c2f-2333-4d1d-849b-1b18121ed4e0","resolution":{"observed_at":"2026-08-06T17:55:45.406624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T13:59:44.047838Z","title":"EV A-CLIP-18B: scaling CLIP to 18 billion parameters.arXiv preprint arXiv:2402.04252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00177","last_updated":"2025-08-29T18:24:38Z","snapshot_observed_at":"2026-08-05T13:59:37.413174Z","submitted_at":"2025-08-29T18:24:38Z","title":"Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T13:59:44.047838Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2509.00177"},"observation_digest":"sha256:867425b6540b2c89ae03417080cb3a0fc9be8f836f1cceec0a643cb6d9977db9","observation_id":"5006196a-e851-43d4-b838-bb79c4440a6c","resolution":{"observed_at":"2026-08-05T13:59:44.047838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2509.24943","last_updated":"2026-05-06T06:07:38Z","snapshot_observed_at":"2026-07-06T22:31:05.409865Z","submitted_at":"2025-09-29T15:42:55Z","title":"Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-18T12:40:19.544260Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2509.24943"},"observation_digest":"sha256:4fb15d7e24ddb00e2c61488136d224b0052d9430bfb02202e1aed1af101aee0d","observation_id":"a5a8c8bd-7223-4a3f-a987-fd10e00d65c9","resolution":{"observed_at":"2026-05-18T12:41:22.579211Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2601.13856","last_updated":"2026-04-07T08:27:33Z","snapshot_observed_at":"2026-08-02T10:24:44.268835Z","submitted_at":"2026-01-20T11:08:33Z","title":"QKVQA: Question-Focused Filtering for Knowledge-based VQA","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T12:53:59.668663Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2601.13856"},"observation_digest":"sha256:72a8c0eb9267719011f3cbd5baae93f64d6a4101c30735c36e8dfb74b3cdea9c","observation_id":"c74decde-c081-47ff-baf8-5c04afc10656","resolution":{"observed_at":"2026-05-16T12:57:54.033143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-03T04:20:57.341823Z","title":"Eva-clip-18b: Scaling clip to 18 billion parameters.arXiv:2402.04252, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-06T07:33:30.943423Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:57.341823Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:0544939ef203ef00e2a686c8adfa5daee029201984c031d5e22087d987f0fe91","observation_id":"24b1a7b5-fabe-48c9-99c0-5ccc3d4e1fe9","resolution":{"observed_at":"2026-08-03T04:20:57.341823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2603.11689","last_updated":"2026-07-01T08:11:59Z","snapshot_observed_at":"2026-07-14T22:43:17.174240Z","submitted_at":"2026-03-12T08:56:14Z","title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T11:09:51.816554Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2603.11689"},"observation_digest":"sha256:2daf2dbc5b570321c4a6e5f89a55ae49953c4baefc0dc2e7c6d5590f35052922","observation_id":"210dbf3f-69e6-41c3-ba71-1ed8a84f9b3b","resolution":{"observed_at":"2026-05-21T11:10:02.006151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-07-14T22:43:59.727378Z","title":"arXiv preprint arXiv:2402.04252 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11689","last_updated":"2026-07-01T08:11:59Z","snapshot_observed_at":"2026-07-14T22:43:17.174240Z","submitted_at":"2026-03-12T08:56:14Z","title":"Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-14T22:43:59.727378Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2603.11689"},"observation_digest":"sha256:34b64e74aea73be71febc085a5aebeb6a416ea8e2d2969d1d7a376f63d97ac58","observation_id":"a43f5ecc-af12-4c0e-b663-17de2f84e7cd","resolution":{"observed_at":"2026-07-14T22:43:59.727378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.03231","last_updated":"2026-04-03T17:59:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T17:59:51Z","title":"CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T20:28:30.864143Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.03231"},"observation_digest":"sha256:c180a5228c5a25421e3c3ba7389b918eb18302689a865e212ce80266683da0b5","observation_id":"ab31082e-b61d-4101-a65d-f26a4078c97f","resolution":{"observed_at":"2026-05-13T20:33:14.532847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.04969","last_updated":"2026-07-12T03:10:04Z","snapshot_observed_at":"2026-08-02T05:19:18.740150Z","submitted_at":"2026-04-04T07:14:01Z","title":"MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T17:12:38.618233Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.04969"},"observation_digest":"sha256:92126b8f9cfb10a01e69b3d346911d8c7cb294491f7bb091ee239203c46f039e","observation_id":"e9dd7262-0e5a-42be-91d3-07b0c2fb289d","resolution":{"observed_at":"2026-05-13T17:13:00.915838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-07-14T19:54:25.294067Z","title":"arXiv preprint arXiv:2402.04252 (2024), https://arxiv.org/abs/2508.05318 MG2-RAG: Multi-Granularity Graph for MM-RAG 21","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04969","last_updated":"2026-07-12T03:10:04Z","snapshot_observed_at":"2026-08-02T05:19:18.740150Z","submitted_at":"2026-04-04T07:14:01Z","title":"MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-14T19:54:25.294067Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.04969"},"observation_digest":"sha256:8f3782138e794b0b2bb77676c1f3baeb214c0729e9f83ab933ebf162666fa1db","observation_id":"58593182-a8bb-40e1-84b2-f315e94771f7","resolution":{"observed_at":"2026-07-14T19:54:25.294067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.12033","last_updated":"2026-04-13T20:22:22Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:22:22Z","title":"Benchmarking Deflection and Hallucination in Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:28:26.268341Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.12033"},"observation_digest":"sha256:17f910f3de2af617619f8602d3130d0f44c2947e3ef03a47823a45809637b907","observation_id":"3f1319da-4fef-4b53-9cca-409ce23938c0","resolution":{"observed_at":"2026-05-11T10:31:00.678352Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.12391","last_updated":"2026-04-14T07:26:23Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:26:23Z","title":"Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T16:16:51.109113Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.12391"},"observation_digest":"sha256:0d58c54c473f7d48226c051d408c0ec3bb429edf53c6bb83c414b613199739cd","observation_id":"1e3b25e8-7e0a-4d90-8e9a-b9b75bd515fe","resolution":{"observed_at":"2026-05-11T09:05:58.682843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.20760","last_updated":"2026-04-22T16:48:43Z","snapshot_observed_at":"2026-08-04T10:29:14.353844Z","submitted_at":"2026-04-22T16:48:43Z","title":"Exploring High-Order Self-Similarity for Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T00:59:03.890135Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.20760"},"observation_digest":"sha256:7bf2df0809831b6e0dcc51d96bea162ddcfb5f7c2825d4ab6ff60afeef1085d7","observation_id":"f31a42a9-3475-4e02-aa22-a9e3b35373a2","resolution":{"observed_at":"2026-05-10T00:59:49.461872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2604.21444","last_updated":"2026-04-23T09:04:32Z","snapshot_observed_at":"2026-08-06T20:54:24.378597Z","submitted_at":"2026-04-23T09:04:32Z","title":"HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T21:55:35.699057Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2604.21444"},"observation_digest":"sha256:914a7559653b166494d0c906bea022e672cffefdff180cbe304f28ec14460958","observation_id":"5ec127f8-c038-4205-9379-8c004079cb78","resolution":{"observed_at":"2026-05-11T14:26:02.222190Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.20104","last_updated":"2026-06-18T11:25:16Z","snapshot_observed_at":"2026-08-02T12:07:11.942278Z","submitted_at":"2026-06-18T11:25:16Z","title":"Sensorimotor World Models: Perception for Action via Inverse Dynamics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T18:21:51.580903Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.20104"},"observation_digest":"sha256:38ca23874f32aece4b3ddb77a8d2c38b5f161218e4bc5874f212351a448595ff","observation_id":"1219347e-580a-4b29-802e-2749de453990","resolution":{"observed_at":"2026-07-04T03:09:30.299865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:0fe2a0076a16c8688712d2df87e4d82955d803b0e153fc5c40b77e66650a3d9f","observation_id":"f7e01b75-078c-4ca5-8725-73c52626a467","resolution":{"observed_at":"2026-07-04T05:49:36.655493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.23881","last_updated":"2026-06-22T19:27:00Z","snapshot_observed_at":"2026-08-03T12:04:36.736234Z","submitted_at":"2026-06-22T19:27:00Z","title":"Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T08:12:14.829556Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.23881"},"observation_digest":"sha256:89306f4c72d20bedd1f91be56c239e1cd3ce8a35ec131cd82dfa5d61e4ad6e59","observation_id":"7bafcb59-91f1-40f5-bec6-abf94911e215","resolution":{"observed_at":"2026-07-04T10:59:46.881141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2606.26794","last_updated":"2026-06-25T09:27:54Z","snapshot_observed_at":"2026-08-03T16:40:37.506200Z","submitted_at":"2026-06-25T09:27:54Z","title":"ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-26T05:03:15.044146Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2606.26794"},"observation_digest":"sha256:498bc604dea88134284b62e840df3d9406154e346a9ac112f5007fa4fc118f40","observation_id":"3c2d5fa3-575a-4d5f-a188-1c1710b824b6","resolution":{"observed_at":"2026-07-04T13:39:50.784830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2402.04252","doi":"10.48550/arxiv.2402.04252","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2402.04252 (2023) 32 Leong, et al","venue":"arXiv (Cornell University)","work_id":"46cb9433-2fa4-4f5c-93d8-106868c12440","year":2024},"citing_paper":{"arxiv_id":"2607.00159","last_updated":"2026-06-30T20:35:30Z","snapshot_observed_at":"2026-07-07T00:05:49.557137Z","submitted_at":"2026-06-30T20:35:30Z","title":"Identifying and Resolving Pitfalls of Knowledge-Based VQA Benchmarks: Auditing, Repairing, and Augmenting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-02T19:13:44.015782Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2607.00159"},"observation_digest":"sha256:6437a5ccb2cd5c9d3d688e07fc83764ca0383ee11512d6f376a0fd13da62eb1d","observation_id":"38118793-1777-41f9-b8f6-6a1acc7ce684","resolution":{"observed_at":"2026-07-02T19:17:17.749685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T00:31:17.047603Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T01:12:47.135396Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:17.047603Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:783deedbe0d6a45b65e48c9c2cb32d0c51fb9b3bc8a282997fcd8c8bcfec81c3","observation_id":"851cac4c-9e90-4435-b87d-30ba397117c2","resolution":{"observed_at":"2026-08-06T00:31:17.047603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04252","snapshot_observed_at":"2026-08-06T04:19:52.837353Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-08T01:12:47.135396Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:52.837353Z"},"links":{"cited_paper":"/paper/2402.04252","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:e5cd7db65d2fbe795c66e5be9372989bb25f5b83cfd0f86d4f7b2f8bffeef055","observation_id":"353c7071-a8c2-4dbc-9acf-c8a45a9ce76c","resolution":{"observed_at":"2026-08-06T04:19:52.837353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.04252/citation-record","integrity":"/paper/2402.04252/integrity","json":"/paper/2402.04252/citation-record.json","paper":"/paper/2402.04252"},"outbound":[],"paper":{"arxiv_id":"2402.04252","last_updated":"2024-02-06T18:59:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:48Z","title":"EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2402.04252."}