{"as_of":"2026-08-08T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f34ab28c45ab7d3f8c8912f851dec7e96c13d42a2cafcd106654b9d9bf78caaf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:55:50.072148Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":13,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:78e455bfcb90552ed30c1cd05ef39cab919a1bd7f8f8ab7bc2c9043c75056af6","observation_id":"10fc5fcb-2c2c-449c-bf9d-7a35a5b434e0","resolution":{"observed_at":"2026-05-16T04:09:36.158828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T13:10:19.972353Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2407.07726"},"observation_digest":"sha256:1730159135631ce23d3084dbe930d1f51246e7f09f4da41deefecb25b2186ae9","observation_id":"5dfdbce2-9602-4248-8841-61d285c8c824","resolution":{"observed_at":"2026-05-11T13:10:21.058584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:4794d238b7dff00289a0ec26e3549762ed0b6140f3a78d6a6b66833433bb2bac","observation_id":"452d07d0-b83c-43a4-a3bf-d1f59e28ffea","resolution":{"observed_at":"2026-05-10T21:07:32.169541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T15:21:03.895366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15435","last_updated":"2025-05-21T12:18:02Z","snapshot_observed_at":"2026-08-07T15:15:34.671409Z","submitted_at":"2025-05-21T12:18:02Z","title":"TimeCausality: Evaluating the Causal Ability in Time Dimension for Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:21:03.895366Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.15435"},"observation_digest":"sha256:dc51a249c226a5c83c30e261df9eab59ecf0d75f163b2a2e9dcf90642a1252ed","observation_id":"2c8162b7-1d8f-42ab-954f-5ad194dd303f","resolution":{"observed_at":"2026-08-07T15:21:03.895366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-07T13:40:20.145924Z","title":"Efficient multimodal learning from data-centric perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-07T21:47:39.640757Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:20.145924Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:8a3486a8bc29d0e62b0250057913c0218ebe18774d3704819e484963136d7db7","observation_id":"68ae5757-6f11-422c-a62d-ccb59f4426d7","resolution":{"observed_at":"2026-08-07T13:40:20.145924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-06T21:19:44.920866Z","title":"Efficient multi- modal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-07T23:46:04.736988Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:44.920866Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:5b07a8f988ae1005796b9b7ba36d473fc860091250c9233cdf88d1b07b9cea78","observation_id":"97b4e0f1-3f29-4140-b356-8d4085e4f5d3","resolution":{"observed_at":"2026-08-06T21:19:44.920866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-06T13:22:45.165347Z","title":"arXiv preprint arXiv:2402.11530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20749","last_updated":"2025-07-28T11:57:52Z","snapshot_observed_at":"2026-08-07T22:24:55.642367Z","submitted_at":"2025-07-28T11:57:52Z","title":"Investigating Structural Pruning and Recovery Techniques for Compressing Multimodal Large Language Models: An Empirical Study","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:22:45.165347Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2507.20749"},"observation_digest":"sha256:37f441451d3538747fafffbe39f9009dd39beaacd0e19f2ae44ef131be3ff7d8","observation_id":"e6e16ed1-ea5d-45d0-a58b-b8b29de3acce","resolution":{"observed_at":"2026-08-06T13:22:45.165347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T14:49:35.876386Z","title":"Efficient multimodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20869","last_updated":"2025-08-28T15:00:51Z","snapshot_observed_at":"2026-08-07T08:43:46.033186Z","submitted_at":"2025-08-28T15:00:51Z","title":"OLMoASR: Open Models and Data for Training Robust Speech Recognition Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:49:35.876386Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2508.20869"},"observation_digest":"sha256:324d23d300b3d7be57267ac970977cc4f9d1514f75d76601bbfefba377586ddc","observation_id":"b3ce6c97-49e4-41d6-96eb-d9643dce6b3b","resolution":{"observed_at":"2026-08-05T14:49:35.876386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T23:35:18.894715Z","title":"Efficientmultimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-07T05:11:19.374607Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.894715Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:66acaf4eadd5c85d1cb31ab9ca87025fc0d9041968fc7208867e7d7b47125147","observation_id":"f088ccac-837a-4e8c-bd5f-478b8ee0fe35","resolution":{"observed_at":"2026-08-03T23:35:18.894715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T04:20:53.053118Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05275","last_updated":"2026-07-01T09:38:37Z","snapshot_observed_at":"2026-08-06T07:33:30.943423Z","submitted_at":"2026-02-05T04:01:01Z","title":"Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T04:20:53.053118Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.05275"},"observation_digest":"sha256:6bed912b8c776ca92a5e9fc30753467927cb1227ee637f0f2e370eebefbc85ef","observation_id":"82da0299-3d75-4c2d-ab49-b347be8f59b6","resolution":{"observed_at":"2026-08-03T04:20:53.053118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2602.07026","last_updated":"2026-06-05T02:27:27Z","snapshot_observed_at":"2026-08-08T04:43:15.472097Z","submitted_at":"2026-02-02T13:59:39Z","title":"Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:29.924860Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.07026"},"observation_digest":"sha256:c865b147513bf751db5c0979b1bbec3e8e5da4a329d5d1d2fe09b47b95d1471d","observation_id":"453a9f6f-2842-496c-8795-b92fff2e9f58","resolution":{"observed_at":"2026-05-16T08:17:36.117667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T05:34:27.393703Z","title":"Efficient multimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.07026","last_updated":"2026-06-05T02:27:27Z","snapshot_observed_at":"2026-08-08T04:43:15.472097Z","submitted_at":"2026-02-02T13:59:39Z","title":"Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T05:34:27.393703Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2602.07026"},"observation_digest":"sha256:447ec58ee305e600ebc9fc72ef96a5a2484e2962f8eb13b01e7d76db2c83a897","observation_id":"53763547-4478-4476-bde3-62e380ba8eca","resolution":{"observed_at":"2026-08-03T05:34:27.393703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-07-13T09:18:06.363249Z","title":"arXiv preprint arXiv:2402.11530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.05648","last_updated":"2026-06-19T12:00:19Z","snapshot_observed_at":"2026-07-13T09:18:01.987479Z","submitted_at":"2026-04-07T09:53:48Z","title":"Leaderless Collective Motion in Affine Formation Control over the Complex Plane","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T09:18:06.363249Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2604.05648"},"observation_digest":"sha256:3b635efd9aeb75e805d715e4fa936ae47d5db3659048bdbb2bcf7eedef250a1c","observation_id":"5f13addc-ae1c-4578-a725-6069109847f4","resolution":{"observed_at":"2026-07-13T09:18:06.363249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2604.05649","last_updated":"2026-04-07T09:54:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-07T09:54:10Z","title":"Analogical Reasoning as a Doctor: A Foundation Model for Gastrointestinal Endoscopy Diagnosis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:47.592716Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2604.05649"},"observation_digest":"sha256:dbbbca94d6353507a6f1e4875418adae50a298e94ee5a8664094b208441ad540","observation_id":"079bb065-94a4-430c-97a7-a60729d7dc27","resolution":{"observed_at":"2026-05-10T22:15:51.452284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2604.24380","last_updated":"2026-04-27T12:10:44Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:10:44Z","title":"Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T03:47:38.100037Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2604.24380"},"observation_digest":"sha256:ab181497abda71540d897c94dd5c27abaddc95ff2d82a52d15787311f3da36a5","observation_id":"e7156161-bfb2-415a-a446-535bd84dbd21","resolution":{"observed_at":"2026-05-11T21:56:14.224287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.07825","last_updated":"2026-05-08T14:53:24Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:53:24Z","title":"Anisotropic Modality Align","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:04.686087Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.07825"},"observation_digest":"sha256:ffde67283fe97e9ba4c7cfbc3bc85272f2d10004f0b5532a002a38e59bf81784","observation_id":"bb565ed3-7b21-4339-a475-b697be2ce694","resolution":{"observed_at":"2026-05-11T03:55:56.270268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.10641","last_updated":"2026-05-11T14:28:44Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:28:44Z","title":"LLaVA-CKD: Bottom-Up Cascaded Knowledge Distillation for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T05:10:56.991368Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.10641"},"observation_digest":"sha256:94dc4e773ceb4d65866c426afc34b888aade2c7251b530c1cc5d5942de146d69","observation_id":"94ba5713-8354-48f0-8240-1361bc146040","resolution":{"observed_at":"2026-05-12T05:31:25.660081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.21300","last_updated":"2026-05-20T15:29:20Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T15:29:20Z","title":"Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T05:07:12.965100Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.21300"},"observation_digest":"sha256:3d8caf9f22b0be6176ae96e02b8022e2a5ff051411aeb60208d60f8cf9e77858","observation_id":"7fa6a991-7251-46d8-b2d6-952b5690e897","resolution":{"observed_at":"2026-05-21T05:09:38.521871Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.21300","last_updated":"2026-05-20T15:29:20Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T15:29:20Z","title":"Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T05:07:12.965100Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.21300"},"observation_digest":"sha256:8d2df5a370cea3b0967e6abfbab306c655c6767ec60d0163cc7203bb35cd6ff7","observation_id":"ca881d48-ae33-4ddb-9937-4b00bb06aebe","resolution":{"observed_at":"2026-05-21T05:09:38.228602Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2605.25813","last_updated":"2026-05-25T13:08:20Z","snapshot_observed_at":"2026-08-02T22:10:19.505273Z","submitted_at":"2026-05-25T13:08:20Z","title":"Extending Embodied Question Answering from Perception to Decision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T21:30:40.182958Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2605.25813"},"observation_digest":"sha256:0cd1e40c5c276341a7abc162073059e675e9d6a23efda074175161de42a8c031","observation_id":"252bcedb-73af-4ce7-9495-d38b11e74add","resolution":{"observed_at":"2026-06-29T21:33:59.009876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2606.11853","last_updated":"2026-06-10T09:30:25Z","snapshot_observed_at":"2026-08-02T20:07:37.622537Z","submitted_at":"2026-06-10T09:30:25Z","title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:11.440915Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2606.11853"},"observation_digest":"sha256:f4a64995fcbed764ce7c9fad9a21704051b4ee15963935440c8110199f10f0e4","observation_id":"a4f72ba6-9734-4009-a020-ac34093c6fbe","resolution":{"observed_at":"2026-07-03T09:07:48.414077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2606.12294","last_updated":"2026-06-10T16:32:30Z","snapshot_observed_at":"2026-08-08T09:11:59.913765Z","submitted_at":"2026-06-10T16:32:30Z","title":"Bridging the Modality Gap in Forensic Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:06:22.362644Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2606.12294"},"observation_digest":"sha256:c3dad2cbc93b789f660edc8082a455065a2304891704ea6cfbba268a9616d797","observation_id":"7d997c3f-dce5-4477-9ff6-d92ba060c17d","resolution":{"observed_at":"2026-07-03T10:17:57.986808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":"2402.11530","doi":"10.48550/arxiv.2402.11530","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient multimodal learning from data-centric perspective.CoRR, abs/2402.11530","venue":"arXiv (Cornell University)","work_id":"5e4314c6-608b-412c-9458-bc55aa52650d","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:bd6b327ac493c4c517ad4a2eedeaaeca294819883db088d3cf59849ac4b882ad","observation_id":"7f43068c-9afa-42d8-9621-b03a69f8ea93","resolution":{"observed_at":"2026-07-04T06:39:37.477800Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T05:22:57.677126+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-01T14:39:52.576159Z","title":"arXiv preprint arXiv:2402.11530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18709","last_updated":"2026-07-22T05:33:17Z","snapshot_observed_at":"2026-08-04T15:25:40.989347Z","submitted_at":"2026-07-21T05:05:01Z","title":"RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation","version":2},"reference_index":278,"source":"arxiv_source","source_observed_at":"2026-08-01T14:39:52.576159Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2607.18709"},"observation_digest":"sha256:e155930557d2e9d9df3a0d2bbed02d752659f49387263a482b08d5a04d835504","observation_id":"6edb94b7-7acc-4fc2-b394-41b60f279ce5","resolution":{"observed_at":"2026-08-01T14:39:52.576159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-01T16:07:55.017604Z","title":"arXiv preprint arXiv:2402.11530 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26432","last_updated":"2026-07-29T03:19:12Z","snapshot_observed_at":"2026-08-04T05:04:33.779354Z","submitted_at":"2026-07-29T03:19:12Z","title":"FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:55.017604Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2607.26432"},"observation_digest":"sha256:3656d51d4c577d121fb9cbeeadf495fc919a237ec675e33a667dc85b8d061476","observation_id":"1373dba2-dee2-4b26-8797-591687a27972","resolution":{"observed_at":"2026-08-01T16:07:55.017604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-08T00:55:50.072148Z","title":"Efficient multi- modal learning from data-centric perspective.arXiv preprint arXiv:2402.11530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03112","last_updated":"2026-08-04T04:32:48Z","snapshot_observed_at":"2026-08-08T00:50:14.056001Z","submitted_at":"2026-08-04T04:32:48Z","title":"Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T00:55:50.072148Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2608.03112"},"observation_digest":"sha256:702c65d828bf1ed84af6578afab164d6ce33de35bf6ab4d4445fa3a61cc18334","observation_id":"7e115841-d1f7-4f52-aae3-970b7392d232","resolution":{"observed_at":"2026-08-08T00:55:50.072148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.11530/citation-record","integrity":"/paper/2402.11530/integrity","json":"/paper/2402.11530/citation-record.json","paper":"/paper/2402.11530"},"outbound":[],"paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:31:45.847395Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2402.11530."}