{"as_of":"2026-08-11T12:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32f38ad5d6f2a8c29026395b68032be8b66ef936474ccd1d0d29450278ac62f3","coverage":[{"denominator":179,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:23:49.412830Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":917,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:55:10.312257Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":29,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T01:29:30.032408Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2403.14624"},"observation_digest":"sha256:9ee4b70fed3fe8896df22847beb9141147a2668754a3fd509ae08e87f4f93f0f","observation_id":"0570e303-6a28-46cf-ac4e-364240baf1ae","resolution":{"observed_at":"2026-05-17T01:29:30.202749Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:34087d465e707aa0763cc9237fd725c1277605e593e5e582bf5244dc9875b804","observation_id":"6f7651f1-27ca-4e49-83b1-cbe48b54ede8","resolution":{"observed_at":"2026-05-11T12:33:33.927578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:2da9db03ee3ea099a5b115cc754d18bdce9bf6d70d8e9c48f8b15f01160f0795","observation_id":"2c152a20-a77a-413d-abf3-ce299d96e22f","resolution":{"observed_at":"2026-05-14T19:55:26.585070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:09a2d0f9a2a182a81ca2a98fc7218a274bf8ef8be70057f777c564af1df4b502","observation_id":"eba91837-dbc0-4889-be20-f007cefdde2a","resolution":{"observed_at":"2026-05-11T02:44:53.537663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:474ac5085f3a238b8355bff47f86d3b324952284c54671f0933a2a76f606bc7b","observation_id":"ac23ea09-a587-4b6e-b33f-5b690a3ffe08","resolution":{"observed_at":"2026-05-19T11:55:30.182459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:ad99963aeb135868ae82c019cff778d894ff4d667840cab086a1804658c8a77a","observation_id":"2680417b-f22a-4d16-9b97-a82fac67b69f","resolution":{"observed_at":"2026-05-17T03:51:25.534046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:bda95d484c9df32744aedf1871c3a32ec1ad55259988c99d502d58b4d1ce7b90","observation_id":"d3264127-4082-440d-b911-47e4aef871af","resolution":{"observed_at":"2026-05-14T00:51:48.352594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:d0f702fced195c59513993c1f874bbc485219c57163ec7d1372ade79b81bb911","observation_id":"0a1fa6ab-bb1e-4d10-8053-2d0f6c1ab2e4","resolution":{"observed_at":"2026-05-15T01:55:12.646452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T10:56:06.418360Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2409.18869"},"observation_digest":"sha256:3a201210d563a33b62afa66762e707754b448db7fc8501e06db31f3a67b80eb9","observation_id":"e462826b-9284-47bd-a9c0-47d812daf8d6","resolution":{"observed_at":"2026-05-11T10:56:08.485056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":158,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:e1e1b5e5935f29a917cdfa70c9b72c4c70f5009853728906eb68672aab237cc9","observation_id":"42b2e88a-7121-4d11-826f-031c99e0148b","resolution":{"observed_at":"2026-05-10T23:20:33.148644Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T23:53:29.862702Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2410.07073"},"observation_digest":"sha256:5c1847b9e06c82caea75ce9574fb60ba8413f6c5a13478326c5373ac0c024e40","observation_id":"0d29a7cc-cbba-45a5-890d-5e6d3fea689f","resolution":{"observed_at":"2026-05-14T23:53:29.895469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-10T05:52:50.722724Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T15:37:25.781240Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2410.10594"},"observation_digest":"sha256:f27ab9bfda8a98339efc41eeceb0a5aead1bd78a6ec984f340e415d6abcaf80b","observation_id":"c06c2da2-63ee-4f38-9835-722a7a36d9ad","resolution":{"observed_at":"2026-05-16T15:37:25.899474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:4b88445e36261d15e25098514b37a06a1930b6cf9be201da8a8a54066e02f2e5","observation_id":"0fa72a6b-fc80-4bf0-bf2b-61ff6ea989ba","resolution":{"observed_at":"2026-05-15T22:09:16.134516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:e878ebcc9aab15dff0d3954f4ecbae72871c49f8af224dc367d6f5489afdd37a","observation_id":"514efd96-2704-4416-b953-0debf9d077a6","resolution":{"observed_at":"2026-05-16T13:53:33.665517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:655957c61eb2e5e632b50cf1fe6b7f61c057c959d7a44e3b93717bd376cdec74","observation_id":"18dd4ca0-d149-44c2-b463-214f2f9c2526","resolution":{"observed_at":"2026-05-16T09:16:17.549123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-18T04:09:41.494136Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.04454"},"observation_digest":"sha256:c81c28369ea0db1f7bab18445e36b97c84dfe83de8eedd4599543efc91636f9f","observation_id":"1ea11bc5-4b4f-455c-9579-39a22dbbaec1","resolution":{"observed_at":"2026-05-18T04:09:41.686056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T07:42:22.478647Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.04468"},"observation_digest":"sha256:30a39eff380eb05ae2cbdc6cf2612843390b15dce3955514dc556442cc7df9cf","observation_id":"de0a1d31-fe8c-4354-aea6-046e16d7fbde","resolution":{"observed_at":"2026-05-23T07:42:43.116592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a1b61787954be010ef6b7f483f31ffec7f71267b9dba15573ce6c67cfeb34eb7","observation_id":"151592b6-8e8e-4e49-8135-ac20532f0abd","resolution":{"observed_at":"2026-05-10T13:23:58.058774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:4e04428b7b815d42e2b411c25011d430e5e61be121fc87544bd76779a0cf7f45","observation_id":"2415b5c5-f4d0-4c83-9154-f9deeb18a3b5","resolution":{"observed_at":"2026-05-11T10:09:23.568350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":296,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:59875a27abb906e3b063586f6d91ca9fe215dfb67014e56dda05853caa2a29ed","observation_id":"136d2089-23bd-4ed7-bdfe-6060310f1c1f","resolution":{"observed_at":"2026-05-17T07:51:13.406086Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:27:43.919941Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.14171"},"observation_digest":"sha256:f293b9b5bce93399a3797f1387b119e90a81b7c1f6b5f1cbb492042ef63793f3","observation_id":"93469cd3-eb59-4e3c-8195-0cb0d796480e","resolution":{"observed_at":"2026-05-22T09:27:44.077838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T11:55:10.312257Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14835","last_updated":"2024-12-19T13:25:39Z","snapshot_observed_at":"2026-08-11T11:50:02.877069Z","submitted_at":"2024-12-19T13:25:39Z","title":"Progressive Multimodal Reasoning via Active Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:55:10.312257Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.14835"},"observation_digest":"sha256:dc3e1429f1791b1f53a12faae9c1a026e78552e0be81bab1a6f9a405a1b0aadb","observation_id":"c27ac01b-8481-4ccd-a77b-7a572bde8ea8","resolution":{"observed_at":"2026-08-11T11:55:10.312257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T11:36:35.279293Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15190","last_updated":"2025-04-07T06:19:02Z","snapshot_observed_at":"2026-08-11T11:31:07.662347Z","submitted_at":"2024-12-19T18:57:13Z","title":"EarthDial: Turning Multi-sensory Earth Observations to Interactive Dialogues","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:36:35.279293Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.15190"},"observation_digest":"sha256:3d179faaabaa287e27b43a79e7cbf308c2ad7c323247f452ddc041681f0dbbed","observation_id":"d6ea7ed6-1071-4b89-96a8-992875141e06","resolution":{"observed_at":"2026-08-11T11:36:35.279293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T11:18:32.014466Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15652","last_updated":"2024-12-20T08:07:11Z","snapshot_observed_at":"2026-08-11T11:11:22.635467Z","submitted_at":"2024-12-20T08:07:11Z","title":"Error-driven Data-efficient Large Multimodal Model Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:32.014466Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.15652"},"observation_digest":"sha256:8a5ab9811d23b9508cab649471bc61693e8e987fbfdb66ad7e74f4c682168e17","observation_id":"9e03463c-dc7a-4dfc-9543-94655fca8ffc","resolution":{"observed_at":"2026-08-11T11:18:32.014466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T10:49:52.135759Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16117","last_updated":"2024-12-20T18:01:58Z","snapshot_observed_at":"2026-08-11T10:44:28.484830Z","submitted_at":"2024-12-20T18:01:58Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T10:49:52.135759Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.16117"},"observation_digest":"sha256:a73f99fb47281f9a42045a11bc10c24cda289c967cbb047ac72568d90e728082","observation_id":"7366d366-22a8-42ed-b489-fff6b0b1a64c","resolution":{"observed_at":"2026-08-11T10:49:52.135759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T10:43:08.145499Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-11T10:36:51.031254Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.145499Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:cd738525f855183d9ced1ba3d9ef5e993ff64612e34098ff810443d0ea6f84fd","observation_id":"be2a0fa4-5fcd-42d2-8c89-e5a8607e13d9","resolution":{"observed_at":"2026-08-11T10:43:08.145499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T10:41:37.764851Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16418","last_updated":"2024-12-21T00:46:56Z","snapshot_observed_at":"2026-08-11T10:34:08.262867Z","submitted_at":"2024-12-21T00:46:56Z","title":"Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:41:37.764851Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.16418"},"observation_digest":"sha256:bf9b9d2af8fa9c36d9a96bad8132fae76f3c2c2187cf9f50cd5c6289b5c83769","observation_id":"d7f22d14-e1ba-485c-a2d6-23804eac654f","resolution":{"observed_at":"2026-08-11T10:41:37.764851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:47:12.224469Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T00:39:56.306346Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.224469Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:6c064e8172bde056fd1caa529e3a1bd489807d66e68b8c8d429526eea86b55c2","observation_id":"f8bebfc0-b866-4763-aef4-58a647a6b53c","resolution":{"observed_at":"2026-08-11T00:47:12.224469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:21:07.835018Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19504","last_updated":"2025-04-22T06:30:24Z","snapshot_observed_at":"2026-08-11T00:34:52.188071Z","submitted_at":"2024-12-27T07:44:05Z","title":"Hear the Scene: Audio-Enhanced Text Spotting","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:07.835018Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19504"},"observation_digest":"sha256:c916666c8aaa99faa7f50626b31d1a351ce3045e299e553724009c85abb38b0d","observation_id":"463dba09-af75-409e-a9ab-143d5bb24204","resolution":{"observed_at":"2026-08-11T00:21:07.835018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:21:52.195975Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-11T03:00:45.351376Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.195975Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:1dc96feb1b8d709fd428ef0fb56bf78f9decae9b696374838519e026d728221b","observation_id":"00ee3d80-6cce-4d23-a9b5-4a1f09edcb9d","resolution":{"observed_at":"2026-08-11T00:21:52.195975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T00:06:12.278164Z","title":"Llava-onevision: Easy vi- sual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19712","last_updated":"2024-12-27T16:13:08Z","snapshot_observed_at":"2026-08-11T01:14:15.709661Z","submitted_at":"2024-12-27T16:13:08Z","title":"From Elements to Design: A Layered Approach for Automatic Graphic Design Composition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T00:06:12.278164Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.19712"},"observation_digest":"sha256:94a96c78aa5d2df8607f37200e9ed1028ea83437e84766bff7ce01decf002671","observation_id":"94026a25-586b-472d-9aca-2226bc1caefe","resolution":{"observed_at":"2026-08-11T00:06:12.278164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:8ea21a76c3bdc69c77e94ed736c278c3d03626429279158d107b513dbafe5686","observation_id":"661e7cc0-3ca7-438a-a978-04ee1868d002","resolution":{"observed_at":"2026-05-17T20:33:26.804574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T22:55:53.996989Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00569","last_updated":"2025-04-12T02:05:56Z","snapshot_observed_at":"2026-08-11T06:18:08.575362Z","submitted_at":"2024-12-31T17:54:29Z","title":"Probing Visual Language Priors in VLMs","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:55:53.996989Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.00569"},"observation_digest":"sha256:1a2bb8f2506d3a6bc02c1376e70ea40458ba501b178c76c2bc29275f7d5c5325","observation_id":"707e2774-c404-43ff-8072-de78d6e6b17f","resolution":{"observed_at":"2026-08-10T22:55:53.996989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:4bbb88724b2cfefdbe4d6b6073b3b7a354f79d9bd80c7b70d10aefda64da093a","observation_id":"06e36acb-10d6-4385-93c0-b600a5db02d5","resolution":{"observed_at":"2026-05-18T04:02:43.422956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T22:57:40.040203Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-11T01:33:05.827241Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:40.040203Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.00584"},"observation_digest":"sha256:1d34b39cdf6b8860bafb1f90758d5176a67740110fb8e94d74166194829e23a6","observation_id":"6a1c409b-61bf-48f0-8294-2bdf2f324a5f","resolution":{"observed_at":"2026-08-10T22:57:40.040203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T22:52:30.214027Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00599","last_updated":"2025-03-25T08:10:15Z","snapshot_observed_at":"2026-08-10T22:44:44.746913Z","submitted_at":"2024-12-31T18:56:46Z","title":"VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:30.214027Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.00599"},"observation_digest":"sha256:998ed7e6b34d8f2d18083fb24759cbc96735b2f814b5cc6d0b9b9e5c905ef680","observation_id":"4a727e5f-c7b7-400c-9958-13972947ccbc","resolution":{"observed_at":"2026-08-10T22:52:30.214027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T22:36:03.762120Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01282","last_updated":"2025-01-02T14:42:37Z","snapshot_observed_at":"2026-08-10T22:56:28.015864Z","submitted_at":"2025-01-02T14:42:37Z","title":"CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:36:03.762120Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.01282"},"observation_digest":"sha256:7a25e42cf4d918d89b0eb7067a08e7cbc4cd101adbca1c46b0664aa9edaae9b2","observation_id":"ced4e771-125b-4515-b76e-0d3ba48b78d7","resolution":{"observed_at":"2026-08-10T22:36:03.762120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T22:32:55.384987Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-10T22:25:36.091919Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:55.384987Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.01428"},"observation_digest":"sha256:eba5d01e0b0336d6746139a6a69d610bb69bf1efae0feb62d41dee95d9a4d93c","observation_id":"70559f8a-0c0f-4998-ae61-7b3f90067184","resolution":{"observed_at":"2026-08-10T22:32:55.384987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T22:27:56.346349Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01645","last_updated":"2025-05-13T06:38:44Z","snapshot_observed_at":"2026-08-10T23:44:47.423609Z","submitted_at":"2025-01-03T05:32:37Z","title":"HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:56.346349Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.01645"},"observation_digest":"sha256:10ec31baa8dea94e44de5a4337a2b08bfab118f49f419a44ceeea8c1cd9ddf1c","observation_id":"e24928e3-7f57-46d1-a256-8ad9b5f43bf1","resolution":{"observed_at":"2026-08-10T22:27:56.346349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:a7b67cd0fd6753a13b6e66d6631efec3162753d13f2f997649e5f281c9499cc4","observation_id":"095f3798-dbbe-4038-ae20-9cd4c6adc80e","resolution":{"observed_at":"2026-05-17T21:08:19.699963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T23:09:25.036482Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-08-10T23:44:53.833723Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:09:25.036482Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.01986"},"observation_digest":"sha256:a1f9db53a36d0564f09f4f5ce05561b59a3e463cdc4be8895993ea2a90eda1a0","observation_id":"245ac6f4-058b-4f12-9fe3-b532b4b7107b","resolution":{"observed_at":"2026-08-10T23:09:25.036482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:1939cc843bd18281ba6e899a58cfa0a1b76347bb719ba5cce3463781fbd4fbe8","observation_id":"7700c7d5-726f-4f78-8fbc-28b2963c9066","resolution":{"observed_at":"2026-05-23T05:45:28.337895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:e22da14120fd86498081e0d89fcfa042cddac651a982f09d5a1a015424601970","observation_id":"86a06654-be6c-4862-9611-717fdea28d43","resolution":{"observed_at":"2026-05-16T11:39:22.495677Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:34:35.139694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T09:47:15.811386Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.139694Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:60e70f43cbb7bc0e755a44537f42b44dd06002d64db73de0f94bebd4ad20e430","observation_id":"ee277cb2-d287-40fa-b6ce-2d5dba39fffc","resolution":{"observed_at":"2026-08-10T21:34:35.139694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:33:21.154696Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04575","last_updated":"2025-01-08T15:45:21Z","snapshot_observed_at":"2026-08-10T21:27:03.875743Z","submitted_at":"2025-01-08T15:45:21Z","title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T21:33:21.154696Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04575"},"observation_digest":"sha256:d9cd06d9a491255f93fb41a587f21a5584a9ef2e19d41ec943fd8783b673afdc","observation_id":"aa2e30a8-481b-46af-81f2-23513e7f024c","resolution":{"observed_at":"2026-08-10T21:33:21.154696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:31:15.962372Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-11T01:32:03.608835Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:15.962372Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:29e164fc9ad4214e4defdd3cb85cc4a10ba8c4a8f136b3f9ced703eeac69653f","observation_id":"19835f3a-e59f-45cf-b729-4f0f20fd8f72","resolution":{"observed_at":"2026-08-10T21:31:15.962372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:30:36.324818Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04671","last_updated":"2025-04-08T17:09:59Z","snapshot_observed_at":"2026-08-10T21:33:14.090489Z","submitted_at":"2025-01-08T18:31:16Z","title":"Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:30:36.324818Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.04671"},"observation_digest":"sha256:37601dd38cba53a87105493c2b70a63defeb42bbb1de9c3d6a60b5de2643791c","observation_id":"7bb1aab0-1a22-477b-876e-037b4f056aca","resolution":{"observed_at":"2026-08-10T21:30:36.324818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:23:57.915886Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-10T21:17:52.245219Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:57.915886Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.05037"},"observation_digest":"sha256:3944e2b628ea5313c8fa916db2565e1cec7dddf82a3ba82762f65fd3b9ab6115","observation_id":"8af571e2-811a-4dea-b0dd-c08022b6a2b7","resolution":{"observed_at":"2026-08-10T21:23:57.915886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:08634f117cbe761ea6e7114cfaec2ab38708a2cbd95c5a7d1380e41ab8d86864","observation_id":"94eb469f-ed67-42d2-87c5-e0d1e6ff5edd","resolution":{"observed_at":"2026-05-23T06:02:37.460440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:18:59.596503Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-10T21:11:43.711209Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:59.596503Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.05444"},"observation_digest":"sha256:4e932c2b20ed67024c1ef777d32ccc40d2da6142c176f30e8a5bb94a2db201ca","observation_id":"6b3e57b4-b5e3-4591-917b-d272259502de","resolution":{"observed_at":"2026-08-10T21:18:59.596503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:10:40.574358Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-08-11T03:06:16.794850Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:40.574358Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.05767"},"observation_digest":"sha256:b2fb0d872715a231d2e84e0871741a6847149a8b7b73051cc1b71165956c590e","observation_id":"a808c9b6-1b81-496f-8207-a2cd1df8271f","resolution":{"observed_at":"2026-08-10T21:10:40.574358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:10:19.001752Z","title":"Aligning large multi-modal model with robust instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-10T21:04:00.512365Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.001752Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:6f98e3dd90acb8eb840e79f240ad7db6e94b9a19f519ec8ba801575d468d1efb","observation_id":"7fdb3330-8930-43c6-945b-ef2c112488e4","resolution":{"observed_at":"2026-08-10T21:10:19.001752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T21:01:56.804272Z","title":"LLaV A-OneVision: Easy Visual Task Transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06655","last_updated":"2025-01-11T22:38:41Z","snapshot_observed_at":"2026-08-10T20:53:33.075545Z","submitted_at":"2025-01-11T22:38:41Z","title":"Personalized Preference Fine-tuning of Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:01:56.804272Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.06655"},"observation_digest":"sha256:6476a23b4a061cdd0eac4622c57b7eaac90b240cb5281cd503fc3373b0c5218d","observation_id":"88d7ab99-7b94-4b1d-b854-299054cfac5a","resolution":{"observed_at":"2026-08-10T21:01:56.804272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T20:33:54.026558Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07978","last_updated":"2025-01-14T09:52:56Z","snapshot_observed_at":"2026-08-11T08:54:41.859500Z","submitted_at":"2025-01-14T09:52:56Z","title":"Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:33:54.026558Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.07978"},"observation_digest":"sha256:17b064a2e5bae661c3019a3d3d1e1548ab8777099d3d11704f3c6d4fdd7f3a60","observation_id":"7cff97f2-83c7-460b-8ba4-38f3988fdfee","resolution":{"observed_at":"2026-08-10T20:33:54.026558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T20:15:04.592076Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09167","last_updated":"2025-01-15T21:36:19Z","snapshot_observed_at":"2026-08-10T20:07:53.408400Z","submitted_at":"2025-01-15T21:36:19Z","title":"Embodied Scene Understanding for Vision Language Models via MetaVQA","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:04.592076Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.09167"},"observation_digest":"sha256:0bcfe75087b9cdcbac1bed8eaac815f5e4180017906cc943cdcf2e30a3142d44","observation_id":"138298ac-2959-49fd-afe0-2437fa49bdf8","resolution":{"observed_at":"2026-08-10T20:15:04.592076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T20:03:12.840613Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-08-10T19:55:29.245089Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:03:12.840613Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.09502"},"observation_digest":"sha256:40ca34fde8702446cd7fe137bb1eb2ac4ede7b7fa844ee9ecb29f939771222a3","observation_id":"822b496c-ab5a-4bb3-b965-eeaea77617c3","resolution":{"observed_at":"2026-08-10T20:03:12.840613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T19:29:39.783689Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10105","last_updated":"2025-03-08T13:55:48Z","snapshot_observed_at":"2026-08-11T00:27:34.812297Z","submitted_at":"2025-01-17T10:45:22Z","title":"Universal Actions for Enhanced Embodied Foundation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T19:29:39.783689Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.10105"},"observation_digest":"sha256:3172bbde91b5fbe1d7ea3a9021cffd28fcd0939b5974fab0bd612d3d86def5db","observation_id":"5c9a4e94-fe01-4c2f-9b26-57de76e9657b","resolution":{"observed_at":"2026-08-10T19:29:39.783689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T19:18:49.272790Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10318","last_updated":"2025-01-17T17:41:47Z","snapshot_observed_at":"2026-08-10T22:13:33.341211Z","submitted_at":"2025-01-17T17:41:47Z","title":"HiMix: Reducing Computational Complexity in Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T19:18:49.272790Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.10318"},"observation_digest":"sha256:a4d4e799c8b7581a3c11584dac292802093220e9ade23cf387de2e005797f1cf","observation_id":"7b034409-e9db-4e28-9444-bbfdec447f22","resolution":{"observed_at":"2026-08-10T19:18:49.272790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T02:52:20.643070Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.12386"},"observation_digest":"sha256:eb4e5437855130871932cc02073c5e453eb9405051c7aca427b19b60dd8e4ba4","observation_id":"d67c6540-880e-4403-8880-9d79099455cb","resolution":{"observed_at":"2026-05-17T02:52:20.731060Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:783c6d78c0dde20212a29ebc1d08db308ea7a04cf599112705611ad89093b1f2","observation_id":"ad5bddca-0af7-47e9-b6d5-f44aa79fa8b4","resolution":{"observed_at":"2026-05-11T01:19:59.859900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:56:37.552702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13536","last_updated":"2025-01-23T10:35:22Z","snapshot_observed_at":"2026-08-10T15:49:26.456054Z","submitted_at":"2025-01-23T10:35:22Z","title":"ReasVQA: Advancing VideoQA with Imperfect Reasoning Process","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T15:56:37.552702Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13536"},"observation_digest":"sha256:784f4e80ef2d74ef5c87c4dd456627dbf34ccdc91f4c4a96499a26bd5a9c5273","observation_id":"bfd974dc-4d90-4fbd-adb7-e120ae28f162","resolution":{"observed_at":"2026-08-10T15:56:37.552702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:7f60daf2461947a1dd659b0ad6d886c278a325065184d50f448229444cdb9992","observation_id":"bc0b2524-7f91-4dc2-ba18-60771d57269b","resolution":{"observed_at":"2026-05-14T00:32:41.237653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:32:55.434519Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13893","last_updated":"2025-01-23T18:08:57Z","snapshot_observed_at":"2026-08-11T01:33:02.229377Z","submitted_at":"2025-01-23T18:08:57Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:55.434519Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13893"},"observation_digest":"sha256:6d05bd1da468b38f707f429ad3ba9eb8fbe6acd265610fe75d28cd5fa967ecfa","observation_id":"2e3060e2-e581-4b3f-9f95-c8b9535aecbd","resolution":{"observed_at":"2026-08-10T15:32:55.434519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:35:30.158917Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.158917Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:99298f54617e37fd2c181f8456c57e3bf1f56770902f1b6e86151c048de59600","observation_id":"6d969358-0c24-4406-bef4-d42986ae8cd2","resolution":{"observed_at":"2026-08-10T15:35:30.158917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:31:35.597651Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-08-11T01:43:21.457790Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T15:31:35.597651Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13920"},"observation_digest":"sha256:310025c3eb04941a030dc71a7c31e419474e85f54082312d62a7271abe5166aa","observation_id":"1e7fa420-0d1b-4873-b353-6313d8aa430e","resolution":{"observed_at":"2026-08-10T15:31:35.597651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:32:46.324481Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T23:05:47.958732Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:32:46.324481Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13926"},"observation_digest":"sha256:786dbbbf6d4d2add0576bf8ac8bd9e7bc6fd9c488130c40fcd54b32885942f45","observation_id":"18e7c0ae-9925-4d1b-a088-169b569ebbf9","resolution":{"observed_at":"2026-08-10T15:32:46.324481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T18:27:55.282687Z","title":"In Euro- pean conference on computer vision, pages 235–251","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13953","last_updated":"2025-05-28T08:41:02Z","snapshot_observed_at":"2026-08-10T18:21:45.444848Z","submitted_at":"2025-01-20T08:09:42Z","title":"Redundancy Principles for MLLMs Benchmarks","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T18:27:55.282687Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.13953"},"observation_digest":"sha256:907880027514423aacc8190dfbe7aefabd66d9e7c094b6f65422d3f0e10219dd","observation_id":"792c9708-dcc9-4a30-8475-549b859867f3","resolution":{"observed_at":"2026-08-10T18:27:55.282687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:18:49.965049Z","title":"Llava- onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-10T17:27:56.139049Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.965049Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:68466903bc9987759cebb40a94e057247c17549e7011279d185d4a5a6abcbea4","observation_id":"140b4b66-190e-45ad-9a71-68564329d3f7","resolution":{"observed_at":"2026-08-10T15:18:49.965049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T14:58:25.810775Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14729","last_updated":"2025-08-13T09:10:30Z","snapshot_observed_at":"2026-08-10T14:48:56.693920Z","submitted_at":"2025-01-24T18:59:51Z","title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:58:25.810775Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.14729"},"observation_digest":"sha256:a4b299d3308fba3c145cfffd71b3ad57efcc232ee63b277a6916128171371947","observation_id":"6886b653-5f38-4ed7-9357-ef3f1153e04b","resolution":{"observed_at":"2026-08-10T14:58:25.810775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T18:04:33.879095Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:33.879095Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:d38eb796a6fc74ac35a25e402bb688403e0b15e540015d8ff5925838a94c6fcb","observation_id":"0809cf4c-adbe-43f7-94eb-a2ecc17b0674","resolution":{"observed_at":"2026-08-10T18:04:33.879095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T14:40:55.229080Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-10T14:34:53.812449Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:40:55.229080Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.15111"},"observation_digest":"sha256:ab5dbf390be158e07c7cb9d8f39b1f0e5d59e3cb12b068ab097197afca103f57","observation_id":"53d7b1d6-d0b3-41a9-8f8d-0ae6458b32f5","resolution":{"observed_at":"2026-08-10T14:40:55.229080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T13:38:27.692002Z","title":"Llava- onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16273","last_updated":"2025-01-30T16:44:45Z","snapshot_observed_at":"2026-08-11T03:52:19.976034Z","submitted_at":"2025-01-27T18:06:36Z","title":"Return of the Encoder: Maximizing Parameter Efficiency for SLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:27.692002Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.16273"},"observation_digest":"sha256:476d3a2df2cd2229fefd0181713d6a7fb65d107e60234b18615cac7214d8ac0f","observation_id":"8a0cea23-b7f3-4ccd-b990-e06dc059f830","resolution":{"observed_at":"2026-08-10T13:38:27.692002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T10:48:17.837710Z","title":"Llava- onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16786","last_updated":"2025-01-28T08:30:58Z","snapshot_observed_at":"2026-08-10T11:57:26.501507Z","submitted_at":"2025-01-28T08:30:58Z","title":"Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T10:48:17.837710Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.16786"},"observation_digest":"sha256:0c4ff9389129d950f04ba2051a95ad74b104a5c071cae945571ca1d8bb6cc61c","observation_id":"aab48173-787c-4e01-acf6-46778c48d019","resolution":{"observed_at":"2026-08-10T10:48:17.837710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T21:55:23.227783Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18954","last_updated":"2025-01-31T08:27:31Z","snapshot_observed_at":"2026-08-10T23:07:52.284721Z","submitted_at":"2025-01-31T08:27:31Z","title":"LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T21:55:23.227783Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.18954"},"observation_digest":"sha256:59c8199edbe835cc9ead90cd1bd4a38848c4c6eb0ab0875b707624560ed3f58a","observation_id":"76bde895-cbad-43ba-996f-a18531bfe81c","resolution":{"observed_at":"2026-08-09T21:55:23.227783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T21:39:21.712002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-10T12:01:17.734125Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.712002Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:d27f25f4708f88e615ebd93ce3f80200c05e3c2cb023aea52fd14307215789e7","observation_id":"a6dbdbe5-26c2-4a7e-8986-ed95ddb263f6","resolution":{"observed_at":"2026-08-09T21:39:21.712002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T21:10:05.898096Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19164","last_updated":"2025-02-21T04:25:31Z","snapshot_observed_at":"2026-08-10T17:27:55.522203Z","submitted_at":"2025-01-31T14:31:00Z","title":"Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T21:10:05.898096Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.19164"},"observation_digest":"sha256:e0918607e4c3356033de01af84e87154fb1cd9e6df7726d6a07f43f17da89820","observation_id":"3ef84a01-1a7c-4ad1-99c4-8492b79118c5","resolution":{"observed_at":"2026-08-09T21:10:05.898096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T20:17:40.320719Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00094","last_updated":"2025-02-04T18:05:23Z","snapshot_observed_at":"2026-08-09T20:12:12.264429Z","submitted_at":"2025-01-31T18:58:20Z","title":"AIN: The Arabic INclusive Large Multimodal Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T20:17:40.320719Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.00094"},"observation_digest":"sha256:9ea727bc59346e7ee46c730d4da355a6c798156f14d53a392e8a6beb0c40f82d","observation_id":"c2e222d3-8f4c-4324-a005-b9586adcc476","resolution":{"observed_at":"2026-08-09T20:17:40.320719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T17:12:16.442473Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00954","last_updated":"2025-05-27T19:23:41Z","snapshot_observed_at":"2026-08-10T01:18:02.316079Z","submitted_at":"2025-02-02T23:11:42Z","title":"Hypo3D: Exploring Hypothetical Reasoning in 3D","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T17:12:16.442473Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.00954"},"observation_digest":"sha256:c0f64de908b4dcaaf8420c778e288f0d74ff6dc0758c9d43e882d3913bade53e","observation_id":"20b3b639-bf3c-474b-8144-d1e2523c39ce","resolution":{"observed_at":"2026-08-09T17:12:16.442473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T15:26:18.852478Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01419","last_updated":"2025-06-04T06:43:40Z","snapshot_observed_at":"2026-08-10T00:12:09.977620Z","submitted_at":"2025-02-03T14:58:11Z","title":"Visual Attention Never Fades: Selective Progressive Attention ReCalibration for Detailed Image Captioning in Multimodal Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T15:26:18.852478Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.01419"},"observation_digest":"sha256:a45e40f80f4700f10f4dbadd61c435f2133103cc20b97a625e9d98165c99b9ce","observation_id":"6db63981-1b8b-49ee-8a9a-716399238624","resolution":{"observed_at":"2026-08-09T15:26:18.852478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T14:05:14.363667Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01906","last_updated":"2025-08-15T20:46:58Z","snapshot_observed_at":"2026-08-09T13:59:46.182896Z","submitted_at":"2025-02-04T00:46:11Z","title":"D-Attn: Decomposed Attention for Large Vision-and-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T14:05:14.363667Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.01906"},"observation_digest":"sha256:705177a56dbd13295c54480cf3b9bb0c169741c7b4c1acdf1780cd758ef9c1f1","observation_id":"9e54a25f-f822-42c6-aa14-b949d6a8f2cb","resolution":{"observed_at":"2026-08-09T14:05:14.363667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:5acbfd77c8c7760af1b04a53633d88cb51025587049cd7c9162d96886aa5bc28","observation_id":"3fd78b47-52aa-4346-917f-985d606fbd1e","resolution":{"observed_at":"2026-05-17T05:53:26.263650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T22:47:39.172390Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.172390Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:3fd52cf30b0900cd44d44c7caeab76659da182489729cfbd2ed88f025c11ece0","observation_id":"2ccad04d-6854-46c4-9f16-3d646fad8786","resolution":{"observed_at":"2026-08-08T22:47:39.172390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T06:01:13.273044Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-10T19:48:51.143556Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T06:01:13.273044Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.04371"},"observation_digest":"sha256:935547bf9f8355aaa89181923e97f51e7157562d15e9e0a6eb5b1c98c6481ff5","observation_id":"4ebe73cf-d0f2-4ead-8403-41637f201321","resolution":{"observed_at":"2026-08-09T06:01:13.273044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T19:32:31.861883Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-10T04:22:37.952837Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.861883Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:de202faefeac105e2dc3329505d96288c90e157aedf3f5db9e4bd17dfc820a78","observation_id":"9d9897c6-5d50-4db0-afda-4117e9e9b6bb","resolution":{"observed_at":"2026-08-08T19:32:31.861883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T14:25:55.715605Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.715605Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:76c2b4df868047962f0e769feb7f2312d2560a647badd57162050aeb8f17db8f","observation_id":"d68e8ec1-3498-43aa-bcbb-d638cf8dffe7","resolution":{"observed_at":"2026-08-08T14:25:55.715605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-09T10:21:04.392994Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06823","last_updated":"2025-02-05T09:06:02Z","snapshot_observed_at":"2026-08-10T09:23:17.385736Z","submitted_at":"2025-02-05T09:06:02Z","title":"CTR-Driven Advertising Image Generation with Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T10:21:04.392994Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.06823"},"observation_digest":"sha256:85d672eca149640e69be7e9b17c2a3749fe4895a79ff898f7a08ebe729b05b2b","observation_id":"66cc9f87-b8fd-41f8-a287-329117361fa8","resolution":{"observed_at":"2026-08-09T10:21:04.392994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T13:36:46.002032Z","title":"Available: https://arxiv.org/abs/2408.03326","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07183","last_updated":"2025-02-12T09:07:32Z","snapshot_observed_at":"2026-08-10T18:45:55.494187Z","submitted_at":"2025-02-11T02:14:49Z","title":"Space-Aware Instruction Tuning: Dataset and Benchmark for Guide Dog Robots Assisting the Visually Impaired","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T13:36:46.002032Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.07183"},"observation_digest":"sha256:4f8dcf3763f0ddd94a07ba1faf9b3a5ff02f68f2948fe833beb57ae2aab57e84","observation_id":"4788e605-f9db-45c5-ba01-a6e35624d98a","resolution":{"observed_at":"2026-08-08T13:36:46.002032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-08T04:58:33.074279Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08489","last_updated":"2025-02-13T17:33:24Z","snapshot_observed_at":"2026-08-10T11:23:02.731143Z","submitted_at":"2025-02-12T15:26:08Z","title":"Salamandra Technical Report","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-08-08T04:58:33.074279Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.08489"},"observation_digest":"sha256:3418f1a4737bc74d0a334b619032a9999f35c2cca2b131325e1b0c5a0360ef9f","observation_id":"20974f62-a450-491e-bb83-fa987735ae22","resolution":{"observed_at":"2026-08-08T04:58:33.074279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T21:57:23.526197Z","title":"Llava- onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09325","last_updated":"2025-02-13T13:38:17Z","snapshot_observed_at":"2026-08-10T12:01:18.239790Z","submitted_at":"2025-02-13T13:38:17Z","title":"A Benchmark for Crime Surveillance Video Analysis with Large Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:57:23.526197Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.09325"},"observation_digest":"sha256:fe8de1b46c69a95c12b101304266e7016df5b4658f0398350d1f8a3364e486cc","observation_id":"58cde45a-7803-4029-8cba-4a3418c7745b","resolution":{"observed_at":"2026-08-07T21:57:23.526197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T20:06:00.804050Z","title":"Llava-onevision: Easy visual task transfer, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-08-10T18:50:32.127116Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T20:06:00.804050Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.09927"},"observation_digest":"sha256:efd5ecc477c9b1070a6cf026ba5a7c7fba9614047ac48ffe2084fe27319ba83c","observation_id":"1f0f5200-02ce-46c2-a9b1-e48cbf77f46e","resolution":{"observed_at":"2026-08-07T20:06:00.804050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T18:23:49.932313Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10391","last_updated":"2025-02-14T18:59:51Z","snapshot_observed_at":"2026-08-08T01:24:46.892879Z","submitted_at":"2025-02-14T18:59:51Z","title":"MM-RLHF: The Next Step Forward in Multimodal LLM Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T18:23:49.932313Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.10391"},"observation_digest":"sha256:507680a53ea33eec32b5d63e7e35a3f0877f730a684785f41565c4af7a79c35b","observation_id":"664a80c7-ddfa-489f-a597-752f7529b8da","resolution":{"observed_at":"2026-08-07T18:23:49.932313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2502.13451","last_updated":"2026-05-09T11:40:06Z","snapshot_observed_at":"2026-08-02T06:35:33.765328Z","submitted_at":"2025-02-19T05:52:34Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-23T02:58:50.014240Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.13451"},"observation_digest":"sha256:23c55c3ed31a5c9c393199d55f5034ed73c92704aa9643aab2b7dd4036be713f","observation_id":"989e0b49-9604-4c3c-bfbd-75e55220e621","resolution":{"observed_at":"2026-05-23T03:02:27.127822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T19:45:18.892417Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:18.892417Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:e463d3e92cbc5ebe47b35dc43822a2818d73f23de0785cdb20cab845cc238b32","observation_id":"8ad6b221-ce0e-456f-8e74-0ce47edd838d","resolution":{"observed_at":"2026-08-07T19:45:18.892417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:bc9fb6b999c763f4662385d97f1834a2b5af903c55c4c54174475fedd2f15e1d","observation_id":"e19f28f0-ed57-49c5-90b5-9df326138136","resolution":{"observed_at":"2026-05-11T22:22:28.089575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:16.528682Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.01785"},"observation_digest":"sha256:43fa23cabf2dd13f80196645c9d68e1cbcafbd221ea734539c2e4ba5e0284da8","observation_id":"330e4fcc-fab3-4e27-bc4b-3d8af310f41e","resolution":{"observed_at":"2026-05-13T22:16:16.551067Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.02597","last_updated":"2026-05-15T01:15:57Z","snapshot_observed_at":"2026-08-03T04:26:47.170682Z","submitted_at":"2025-03-04T13:18:33Z","title":"Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T01:23:01.892612Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.02597"},"observation_digest":"sha256:675cdadf641fde5cb34b517026cdab0da9f4f363eddd0d60f94a4f69e0810580","observation_id":"3e32795d-619c-4477-a0c3-853d97f5530b","resolution":{"observed_at":"2026-05-23T01:25:16.427674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.05236","last_updated":"2026-02-25T13:17:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T08:36:05Z","title":"Unified Reward Model for Multimodal Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T00:44:30.558048Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.05236"},"observation_digest":"sha256:d6a799cf0cd91fb0f14cee789b1de8772ac6a748e83ada96490b5333b5ea4728","observation_id":"e63186cb-5e27-413b-aa9d-a0f6e46c4dd9","resolution":{"observed_at":"2026-05-14T00:44:30.899721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:ebfefe741ecd891e90fa7e27f2ebaaa600e537f496006ae6893c3ebd780deea0","observation_id":"37fcc567-e408-4830-b985-deb0766b5266","resolution":{"observed_at":"2026-05-23T00:22:18.751954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":275,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:e7f401f9437710e0824dc867565ea6bcbea5feac92312839a0411cb120f9f8b2","observation_id":"5f478673-d4e7-4e5c-a799-3f71b3291d25","resolution":{"observed_at":"2026-05-15T17:18:53.611634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2503.12844","last_updated":"2026-04-30T06:09:00Z","snapshot_observed_at":"2026-08-08T09:47:04.204560Z","submitted_at":"2025-03-17T05:43:40Z","title":"GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T23:49:53.830731Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2503.12844"},"observation_digest":"sha256:1dd5250bf8863c482f89000a49431475b762a6f5707384e323f2c27c1cdf10e4","observation_id":"31b893a0-eb22-432f-9f81-e3f62936c929","resolution":{"observed_at":"2026-05-22T23:52:17.035631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2408.03326/citation-record","integrity":"/paper/2408.03326/integrity","json":"/paper/2408.03326/citation-record.json","paper":"/paper/2408.03326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":"c078f71e-fd4b-4fa0-8ce8-8b5b507b0d72","year":2019},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2a15a052c854bad901b8cf1a28266493f8462e74aa52debcca4a8955fc4db883","observation_id":"80aaa1d5-a0d1-4057-b0fb-c768eb867b2d","resolution":{"observed_at":"2026-05-10T14:23:49.792224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":"187fb392-efda-41a0-b1b2-b5c7dde004bb","year":2019},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:596d1ba5ff8ae2ec239d609e47759c1500fb9f996c2b183291527a49426b3807","observation_id":"8299c215-5244-4383-ad68-54ec3ce42dac","resolution":{"observed_at":"2026-05-10T14:23:49.796285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude-3.5","venue":null,"work_id":"dba53abf-151d-48a6-860e-a7f4514f721e","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:3f66580a42813de685f2a8b27904baf9795413e36a074604ab2b900e087a136f","observation_id":"3980e647-3419-4456-88e6-1200d3f2b3f2","resolution":{"observed_at":"2026-05-10T14:23:49.797959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqa: Visual question answering","venue":null,"work_id":"850a33f0-cba0-4b82-aeda-7b42b5922edd","year":2015},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:b4f9b96c3e8ac148aa5dcdd42733262ea8676c7aabdba8105c05d1738271110c","observation_id":"49780143-6ee2-445d-9afd-48c018046913","resolution":{"observed_at":"2026-05-10T14:23:49.799980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"7c07adc2-39e2-4096-8ab1-a03aa74cb5f8","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2699abbf612b08822f9574dea66dabeb6032e15ea8b50c940318fcb43fa02ee9","observation_id":"939a577e-2304-43bd-a4e1-eb3fe5aba008","resolution":{"observed_at":"2026-05-10T14:23:49.801802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"792b12d2-871b-4ba3-80c2-b761f1567e9b","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:012fe0154b959c3d41343f3fbebeaa4e313bde972a4a26e782d0dc8b5fe3b595","observation_id":"fff6ee15-b520-4502-bea8-745273ed97a9","resolution":{"observed_at":"2026-05-10T14:23:49.803856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision datasets: A benchmark for vision-based industrial inspection","venue":null,"work_id":"d4d34b5e-6ae4-457e-9586-a7a8c2ebbadd","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:ce50303dfab264ffe6d7c62a4331effc9416be717328cf8146b25fa38e01bb22","observation_id":"09b9f03d-3afb-4f80-b33b-2b88bcce453f","resolution":{"observed_at":"2026-05-10T14:23:49.805810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":"10f2452a-2b13-4edc-9b04-f7daf75abc03","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:12eae689ff5c8425bdbf7ffb5331382cdcb814a3d07eb605c0714664920634fb","observation_id":"36401b18-0905-4bb6-a6b7-7c5f545b0bb7","resolution":{"observed_at":"2026-05-10T14:23:49.807667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual question answering on image sets","venue":null,"work_id":"fdf404b4-6c6b-436b-bdb8-03b4880edb55","year":2020},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:9b9eb3ca29396600cc97fe0b20e0a098794d564be662772aaee264b94ab0bf3b","observation_id":"4cc965fd-d81a-4718-b465-ca12e151f77f","resolution":{"observed_at":"2026-05-10T14:23:49.809561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:5382afd10728583877b264666a4ab796635f0dc87fde37d1d8db65cd9267efd8","observation_id":"9977947e-a56d-4700-b6e6-ed7d5c078497","resolution":{"observed_at":"2026-05-11T13:10:21.987351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"83435b51-5250-4f0c-a4d1-074060426721","year":2019},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:d1769feb524989154ae5269b7ad9d6061ad5bdec33d65af9f7bfa3a2ca663952","observation_id":"57fae0da-a23c-4282-8bc6-11e1d162d150","resolution":{"observed_at":"2026-05-10T14:23:49.811541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Giancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"60901875-8364-4044-a8c2-42db38e966c9","year":2020},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:f3b8cc22cd2f2284d48b4852fd7f29cfb1025591c9a2bd276f0615818103882e","observation_id":"b11632f6-694c-4c6d-84ad-1067a68c4a81","resolution":{"observed_at":"2026-05-10T14:23:49.813209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Textocr-gpt4v","venue":null,"work_id":"3baf8bc9-2cd4-40e7-9910-59f0b096a0b4","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2d108106a4bc6d921257b2038a1c3b2de08b12b986bf13f5dd760aae9fa90993","observation_id":"ba37d1e6-51c1-4e9d-a3ce-3614b774efa3","resolution":{"observed_at":"2026-05-10T14:23:49.814830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mapqa: A dataset for question answering on choropleth maps","venue":null,"work_id":"d871e585-4b51-48a1-ab26-a7450da085a4","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:8d1f66431f5f6d02693f611871ba935ad46e9e8417023f9b2d92ba7a53eb2c28","observation_id":"a19211ea-8f19-46ac-b957-f00b74c18c02","resolution":{"observed_at":"2026-05-10T14:23:49.816854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00590","last_updated":"2022-03-28T02:42:56Z","snapshot_observed_at":"2026-07-06T11:43:31.430346Z","submitted_at":"2021-09-01T19:43:59Z","title":"WebQA: Multihop and Multimodal QA","version":4},"cited_work":{"arxiv_id":"2109.00590","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.00590","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , volume =","venue":null,"work_id":"0b064355-1184-4343-a95b-fdfcc774f75d","year":2021},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2109.00590","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:06a63ae4c425f6c9151895815424e11441a04ef3ab41d6af0b7627fdfc12cb37","observation_id":"e467d038-9853-47e7-b9ba-17e74180245d","resolution":{"observed_at":"2026-05-10T14:23:49.561566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:66d0c0a304476ad50d86ba96390bfca6d54874d169950726acd2a0f3905c0fd8","observation_id":"19822b22-57b7-44b1-9d38-ca6665b1f39d","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unigeo: Unifying geometry logical reasoning via reformulating mathematical expression","venue":null,"work_id":"448fdd48-e78d-4e32-8a7c-80cba7864333","year":null},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:4427c60cfa7f807f52fdce4018332d4c995ca416d3403b39de422693232dfe28","observation_id":"62947ea0-eb12-401e-b3c2-43811352c8d0","resolution":{"observed_at":"2026-05-10T14:23:49.818695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xing, and Liang Lin","venue":null,"work_id":"963790b8-ab4e-4076-aa2b-48deca3b4716","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:1278b09324bfe1138cba7a934db7b5263b36bbc0db3b9a4519c77f0067ff4b6c","observation_id":"244068af-5d7e-4930-9116-5ed59e936f3d","resolution":{"observed_at":"2026-05-10T14:23:49.820565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:ac44354c04107751588e2a1553c59f777c23cab201c9387d1dc653fdb50262a4","observation_id":"8babf22d-2ce6-4233-9f01-2eb45017b6cb","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:b347573952d497775dde96e13a3f60eeab0ff5580cccac9928b0e3b2df258529","observation_id":"94c68049-8bc0-4ff0-94e3-41252d02cebd","resolution":{"observed_at":"2026-05-13T17:08:13.182567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2886db334dc4871998ce8a4c23df42c52e2967c7db74afc08d51e48ea53f5ccd","observation_id":"13c3cee9-ad9c-4bf5-9fc0-a5837391ad38","resolution":{"observed_at":"2026-05-10T14:23:49.613523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:ccccdbc00bb0d96d7b59ca6c316b510161b6aff34da31c57274422b090ed3bb8","observation_id":"447de910-863d-4632-9536-226cceb1fdb0","resolution":{"observed_at":"2026-05-13T22:46:10.650334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hitab: A hierarchical table dataset for question answering and natural language generation","venue":null,"work_id":"c676d0fd-0472-446a-9781-4608ac711555","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2f2102a19ab545cf6c5fc3c23db0b725094a4afee4e75bc3d51c537f8e1455c7","observation_id":"77253167-594a-4623-b5e2-128dcad032f3","resolution":{"observed_at":"2026-05-10T14:23:49.822561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-07-06T17:47:30.518562Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":"2403.13315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-07-02T23:57:28.214249Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","venue":null,"work_id":"926e9650-5c7c-424c-a1db-2f5573108252","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:641579b82826864ff23cff46eaf472d45cfb22c7e8015f12690d265ad6ce2de6","observation_id":"04b06fc2-0556-4778-b1ca-40832d375154","resolution":{"observed_at":"2026-05-10T14:23:49.519210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chang, Manolis Savva, Maciej Halber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"eb4a97fd-0bd3-4b42-94a7-70261824c778","year":2017},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:5635d2d82dafd9ef765172f71fa83fa5f27de0a56a46aabb4d798062e8e85dd2","observation_id":"f22179d7-39a8-4176-a85d-f58bcb331c17","resolution":{"observed_at":"2026-05-10T14:23:49.824389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"c4d8bc05-813e-47ec-931c-ef3dc8a3e0b5","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2838810ddf9b102e707be46a3e847741f2235a9ba01bcbcbd0457538911019cd","observation_id":"3e0c6430-5282-44e5-95a6-f0016fe55e8a","resolution":{"observed_at":"2026-05-10T14:23:49.826614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural naturalist: Generating fine-grained image comparisons","venue":null,"work_id":"88b5d259-d64b-450c-a7e4-f777cc0380e9","year":2019},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:6c5c443f356160d79c70ded0c026ee55fdb60eae8658718fda79d5d232bfe383","observation_id":"c22a8d7d-9323-48d2-8ec6-a634e3a95fd8","resolution":{"observed_at":"2026-05-10T14:23:49.828690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"3643aa51-a6c3-49bf-af14-11cfd771e534","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:23c16660e66e014560b865aa7364528be124fafbb81110a343f71e0ff3ed8bd5","observation_id":"db47c7bf-afaf-4fae-a598-b945cc5cf105","resolution":{"observed_at":"2026-05-10T14:23:49.830608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:dffe02459ad945ff9a8ede1b066adfba43290fca44909c0d45e5e73754cbabc1","observation_id":"3011ee19-4410-42db-93f3-0292ec3202c3","resolution":{"observed_at":"2026-05-11T01:58:42.298802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data","venue":null,"work_id":"4b99b425-5887-447a-8fe9-9d0da48b0b4e","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:77e980667c44f6af2c3b3ab68fc0295da74566980ec9a4072a3b4f4984e85cf3","observation_id":"0e6c63e6-ab24-49f0-85c4-c660d45bb2fe","resolution":{"observed_at":"2026-05-10T14:23:49.832521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:881a300d1ded01729f48ce40564b8a044622d3f92c6aa64e6a1a74e09460c01b","observation_id":"d256730f-a2e3-4983-90d8-0043a8ba6f24","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G-llava: Solving geometric problem with multi-modal large language model","venue":null,"work_id":"67e4e18d-1f48-46ba-94d6-1c67c54fa10b","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:02f764415134ff8558835070386af70207fa14c2928a8a519f1058ad8d26d78a","observation_id":"c8550678-7331-49be-a443-8f261fe114cf","resolution":{"observed_at":"2026-05-10T14:23:49.834308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4db577a-be14-4296-922c-49c0e19641b3","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:c43b3dc72f14069f75faaa2eb14cc15001a35e01279905cc22972be9b0fc855e","observation_id":"38e0cf1a-67e1-4c36-947d-c0b3eb208f91","resolution":{"observed_at":"2026-05-10T14:23:49.835940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sciverse","venue":null,"work_id":"61ef9092-f83d-4111-bb29-ecdf50af4985","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:6e0533c7fc7e4052e071a1ce3e1d6313de497619091a96e37b7985114f751c45","observation_id":"ef769a95-7c90-4816-89cb-1101658638a1","resolution":{"observed_at":"2026-05-10T14:23:49.837972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-10T23:05:27.308529Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:184b73628a345ff09febd8577db105f4a0fa5cd27556aa4868d2b589a5f23641","observation_id":"ee4d18be-d8a8-4d3a-8433-57f5ae56d34d","resolution":{"observed_at":"2026-05-10T14:23:49.552473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagine this! scripts to compositions to videos","venue":null,"work_id":"d5149f29-349b-44ff-a63d-bb5316c3333e","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:069aada995c68024d88a54b9f37f8ea82958cb7ae072aeb97b51bc06b7ff374a","observation_id":"3c03def1-69a2-4cb7-82f1-7faa39ef1274","resolution":{"observed_at":"2026-05-10T14:23:49.839916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"ebb69c44-4754-4301-aca4-dc89116559e4","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:d9be812d4d2e88aaa479579409aaa8d201227034f244cb15ec8a50fd33bcd821","observation_id":"2d47fe6a-6734-42ee-a1ba-b5c0909a299c","resolution":{"observed_at":"2026-05-10T14:23:49.842039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"2fc7c9ca-7462-43e3-a934-1f67a6d7a0b9","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:6b963b8dd5155f33787c1c4f01292a260b50a1e88420fd030ef744d75e982577","observation_id":"877bde4c-0fbc-4d83-b9a9-3416de912c39","resolution":{"observed_at":"2026-05-10T14:23:49.843897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image change captioning by learning from an auxiliary task","venue":null,"work_id":"caaa7706-06cc-4a35-9697-3fe7ca861c51","year":2021},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:590082be2321b320acc0b2744b41f3ef64e081afe994fd68b406ee610f81a5f6","observation_id":"9f16cc92-efff-4b33-8e86-5e857d6aca25","resolution":{"observed_at":"2026-05-10T14:23:49.845663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Huang, Francis Ferraro, Nasrin Mostafazadeh, Ishan Misra, Jacob Devlin, Aish- warya Agrawal, Ross Girshick, Xiaodong He, Pushmeet Kohli, Dhruv Batra, et al","venue":null,"work_id":"9b5ad0ce-dc8c-4cae-992c-e225d9f7a3ec","year":2016},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:710d7919ab9dc34e9f2c053599373a6be43c85a6e26887f00f1b3bf1fc4a1572","observation_id":"aecba392-37a3-4508-94c3-ce749f3a07ed","resolution":{"observed_at":"2026-05-10T14:23:49.847800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"03195555-38b6-4805-9d44-ad7f25057b82","year":2019},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:09a260a00be2683778dd3cb1756697923ef80d75dfab36579912297be86dc952","observation_id":"c8e012eb-f212-4ee1-b62d-4391ebfea9ec","resolution":{"observed_at":"2026-05-10T14:23:49.849676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":null,"work_id":"9fb65b38-66dc-4f13-a882-56bdb5cde1c5","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:111472eb356b1e6e411bbf72d78e56d89b09af07bc2428c1d17dc69a2f0af1d8","observation_id":"a8891752-b795-4f50-8f6d-f7041698b6de","resolution":{"observed_at":"2026-05-10T14:23:49.851798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lim, and Edward H","venue":null,"work_id":"4bd12fab-0db7-4aab-822b-297d0a2aa689","year":2015},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:850f0b0c21a048f1f537d3557eddad5b74b61c15ac8de2f67877321e8ea5c72a","observation_id":"009f1ef6-5956-4b13-bc90-5d9d2262356f","resolution":{"observed_at":"2026-05-10T14:23:49.853720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The amazing mysteries of the gutter: Drawing inferences between panels in comic book narratives","venue":null,"work_id":"7e1050e9-6f97-4430-8932-02e6da9706e9","year":2017},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:1e5c6d50dd380a58039fd84d6d3754a77257fe53f6e2038856972e2c4470360c","observation_id":"8a890935-c89e-4a05-a816-4319b646dab0","resolution":{"observed_at":"2026-05-10T14:23:49.855712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10584","last_updated":"2018-08-31T03:15:28Z","snapshot_observed_at":"2026-07-06T06:58:27.332918Z","submitted_at":"2018-08-31T03:15:28Z","title":"Learning to Describe Differences Between Pairs of Similar Images","version":1},"cited_work":{"arxiv_id":"1808.10584","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.10584","snapshot_observed_at":"2026-07-04T19:50:10.115809Z","title":"Learning to describe differences between pairs of similar images","venue":"cs.CL","work_id":"54c2b945-886d-4763-bea2-e7e8725922fd","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/1808.10584","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:663b2c18a59b9d2509fbde543378bed1e52c149515f261afae1a743d8c6dffba","observation_id":"edf95c37-ef1b-485f-934b-4277e539d0f2","resolution":{"observed_at":"2026-05-10T14:23:49.516058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to describe differences between pairs of similar images","venue":null,"work_id":"4eb0bacf-aa92-4602-8ba3-125c71232851","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:0bb0504897166fefd88195730fb578c133b2f64cab36bff0569d26ef061de62a","observation_id":"b187c262-76b1-44b1-9e40-22657ef7bd7b","resolution":{"observed_at":"2026-05-10T14:23:49.857718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2405.01483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-07-04T20:40:07.542575Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":"ca7dd196-dc3e-4e3c-af1e-c0b02fc0efed","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:eb4286cdc861f2a9bf732d416e76b076190293b4f739b1d8e437c7eecb2e44fe","observation_id":"7c9a2926-243f-46e2-999e-7107c13e8884","resolution":{"observed_at":"2026-05-10T14:23:49.546122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"64f5e21e-06af-4106-870e-e3d653bf6727","year":2017},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:8070e2172403936f936f25841c30e2e87fd5d27ff748be0c2e414e7cbf3ff102","observation_id":"1a8ea4f3-11bf-4324-ad5a-3532696c0aef","resolution":{"observed_at":"2026-05-10T14:23:49.859640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":"05d8e316-f9b0-4b39-84f4-4922ce2100fb","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:bda2422ddb366fcbf226d61b6330598c933c400ad96f883f76c2af76cbbb36d5","observation_id":"f24d1fd9-eea2-4afa-871c-acd1ac9ede1e","resolution":{"observed_at":"2026-05-10T14:23:49.861410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Figureqa: An annotated figure dataset for visual reasoning","venue":null,"work_id":"aa0a7577-8c5c-4f4a-a91c-ed17354f9c48","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:06046b8f6642787d14ca9fac75b1ffef736e975e382c19bc9db353cc9533147b","observation_id":"f52a5e4b-2ffe-4e2b-83fb-722adfdf2b32","resolution":{"observed_at":"2026-05-10T14:23:49.863246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"58809b9a-edfe-4bde-b350-e45a4c99686e","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:b1d7246ad4de392b3c66e096659688052403d1e1d24981e1172beaa7635b6306","observation_id":"a7731beb-ab5f-42e2-b610-b74dc1f08f26","resolution":{"observed_at":"2026-05-10T14:23:49.865179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12241","last_updated":"2023-12-19T15:25:39Z","snapshot_observed_at":"2026-08-07T13:16:45.623593Z","submitted_at":"2023-12-19T15:25:39Z","title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","version":1},"cited_work":{"arxiv_id":"2312.12241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12241","snapshot_observed_at":"2026-07-03T20:48:56.071888Z","title":"Kazemi, H","venue":null,"work_id":"a6a0af2b-e0d6-4234-9409-9f4eecda7ca5","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2312.12241","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:ed2bb5862a0e021b9a49287ec70f7763bb2d0161ded90220596e66f415ea9357","observation_id":"b56f4798-8e8e-43ea-8c81-c08d90c27881","resolution":{"observed_at":"2026-05-10T14:23:49.589748Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"8c45fa1f-5860-433a-87c7-26b73c5312a2","year":2016},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:c688d92f087ef85976bcd16403eb5265c4f2cf689923eb780c750c014ece091b","observation_id":"4e69fa9d-8692-4b84-9521-c652b6d6df8a","resolution":{"observed_at":"2026-05-10T14:23:49.866875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"f2943f46-81ed-4eec-81cc-b5d8faa5fbdb","year":2016},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2311fbb7961c284fb61c07a8d4a5f37bad350ec526ad062bdee887e40b7bf9dc","observation_id":"910b65a7-0897-43f4-8873-c8c33340a03e","resolution":{"observed_at":"2026-05-10T14:23:49.868762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"9c67c0e9-e395-4750-bece-272c3132e047","year":2017},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:51f1a52681444907d5a3bb24e9da060995e1d9df88da430c616f1d2f315faafa","observation_id":"729ca3a5-b14d-40fa-aac9-6f9a80b095d4","resolution":{"observed_at":"2026-05-10T14:23:49.871064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension","venue":null,"work_id":"f14b4114-d93a-4e14-8c16-3f8df0df299e","year":2017},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:b48661813e1291484aa0a95f5590b050dff2cbe048b7affc4ad2ad5d267e2b32","observation_id":"227e1777-e9f2-4c22-a978-4b7a29c8e5b3","resolution":{"observed_at":"2026-05-10T14:23:49.873260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":"8dace11b-ff88-4a23-8c29-c9e03c241055","year":2020},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:a7abf83a507c4ee1a2fc14d121454334ba8e178b219e63adea7b0ed9be1320ec","observation_id":"e21be52d-e899-4b21-a1fd-be0231c46d5b","resolution":{"observed_at":"2026-05-10T14:23:49.875174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"68e800cd-c2cd-4d94-80b9-0b5d949b8657","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:8342efb5a2f898e24a49e696638601bd23049a35971d03f2176108b1f4cef97f","observation_id":"54881f83-74b0-44a8-8905-1a6b3d11b93c","resolution":{"observed_at":"2026-05-10T14:23:49.877024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shamma, Michael S","venue":null,"work_id":"b3ea40a3-bb3b-4103-bf8b-c688f9dc31dd","year":null},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:9772d2785bf56d68bef700401a29892c4a46296551666609fea49dfaa56e1342","observation_id":"78f3114f-fe43-484b-8dc0-97e79c7e5058","resolution":{"observed_at":"2026-05-10T14:23:49.879063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image retrieval from contextual descriptions","venue":null,"work_id":"fb8003f3-225f-4aeb-bf88-40c8183aad09","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:3429fa3d06df6e1d8648cfc5e429a061fdf0b979400f8c8eb87932d9a2582e34","observation_id":"8bb47279-fe45-4ad2-bbcb-9caa9c469f91","resolution":{"observed_at":"2026-05-10T14:23:49.620840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt-4o: Comprehensive multimodal annotations with gpt-4o","venue":null,"work_id":"545c4029-deb6-49b5-9794-1de726f7c197","year":null},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:071d99d6d081c5f111f5d18308b5e258d4d02ed6c31c9fd406976967eadb0821","observation_id":"9a059159-be65-4fe1-b559-1a0c37a94e5b","resolution":{"observed_at":"2026-05-10T14:23:49.623045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A dataset of clinically generated visual questions and answers about radiology images","venue":null,"work_id":"ba04969a-eeed-488f-a231-10e8e1b259c6","year":2018},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:33a8e01038df96a6f72d3bcc17b2d8c82ef57bf06b4ab7bedf66bfb526c5fff3","observation_id":"00792893-240a-4162-a2bf-46c9319827f9","resolution":{"observed_at":"2026-05-10T14:23:49.625193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What matters when building vision-language models? Technical Report","venue":null,"work_id":"4bba02b7-4b14-48fb-9bb4-ae82f54cd812","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:8fc224dca9bfde0baff5832418f426ff9bc32315b38d5ca345717641ac7f05e7","observation_id":"dfac752f-7085-48e8-9d86-61e7ad93252d","resolution":{"observed_at":"2026-05-10T14:23:49.627614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: What else influences visual instruction tuning beyond data?, May 2024","venue":null,"work_id":"aa08edd5-7ff9-452d-ac49-dfcd38a21c4f","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:3627095e02c784ff878e024ba189149a679dd29d18b7e6805d3c8e69dd64b1a8","observation_id":"d02dd82a-a468-4742-8b8d-ce036e2b3e9a","resolution":{"observed_at":"2026-05-10T14:23:49.629811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, May 2024","venue":null,"work_id":"2798b64e-7ef9-4fb6-a33a-a0e9f4d32627","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:301babceb32e6b5be8d779a26ebe57fac4d21bb608a20d95f763db4e45f8d649","observation_id":"386fdd86-e05c-4908-8f51-5ee8d0da447e","resolution":{"observed_at":"2026-05-10T14:23:49.631785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":"15c4379b-17a7-44b8-93fd-973565571baf","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:e6d88f4fe01d782d3de15c24b5d0847df07d089844b4b4b9edb58dbfa6fd27ac","observation_id":"b6d57fb6-77cc-422a-add0-a0574805be89","resolution":{"observed_at":"2026-05-10T14:23:49.633881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal foundation models: From specialists to general-purpose assistants","venue":null,"work_id":"5bf43243-9399-4a41-bbdd-251aebeb6fcf","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:74fa102471b63b845c71102ccad99c69344c47b811c16700340cb8737ab2b379","observation_id":"50d201ca-dee2-4307-a605-7fef220c485d","resolution":{"observed_at":"2026-05-10T14:23:49.635892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Tackling multi-image, video, and 3d in large multimodal models, June 2024","venue":null,"work_id":"3bc7a2fd-49d7-4fd3-be06-8b072b5a8a3a","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:2a9aefa080bc80e79d0ff26b00bf4454278b0fb2f0f83451f821b7dd55d6887b","observation_id":"cc03fc8b-d50d-4277-a391-b08d86a5a1a4","resolution":{"observed_at":"2026-05-10T14:23:49.637755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning multimodal llms to follow zero-shot demonstrative instructions","venue":null,"work_id":"d6026528-785f-4698-a417-30d13e3d5c9d","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:3b09d4cb49330cfbc4a259a530ce64c77ce744a8ced208403abd67108078ff0e","observation_id":"c7f20297-8b3c-4512-af63-9b8c8d1e3fd2","resolution":{"observed_at":"2026-05-10T14:23:49.639766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-08-07T11:39:49.685292Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":"2308.04152","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empowering vision- language models to follow interleaved vision-language in- structions","venue":null,"work_id":"df862014-cf77-462a-b753-a6d33e56b7fd","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:5d9bf767be2611e13c93064c1926b7ced664f16c86f52ebae9258c9beb03c23a","observation_id":"af34bcc1-16cc-41c3-ac41-7e8054bfa2de","resolution":{"observed_at":"2026-05-10T14:23:49.618766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"9a5841e2-ccee-4e1e-9783-228498b014c3","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:03111bfd12e1f8abebb1a7c0ef736753d8cc3327d0784b4ecd6dde907aa4aec1","observation_id":"b2126fea-1174-459d-bbae-e5081aef274a","resolution":{"observed_at":"2026-05-10T14:23:49.641626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"e235a95c-f84a-41c4-a06c-3f243bd2d43f","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:b67c5dd0de1df5ed52a527d1d6a443a36d27c438409bd09c2e0f4958f278a28d","observation_id":"87379fcf-b02c-4021-ab2e-7cc62491152f","resolution":{"observed_at":"2026-05-10T14:23:49.643354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":"e86bbe98-ad0e-4e16-a45e-d69a31f8a86f","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:35f4e37a69de21e99f57e36260db5ea8e191073da4ec8d313214043a88462a5a","observation_id":"2db2e25c-e584-4d85-a25a-ba409ac6c683","resolution":{"observed_at":"2026-05-10T14:23:49.645698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Storygan: A sequential conditional gan for story visualization","venue":null,"work_id":"a1b5bad4-f7c4-4006-910b-ff10e9aaa3cd","year":null},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:16b30309256e8031e096bbc0dff6d00b3ba356580dbc5cda1565de2a4d19cd93","observation_id":"27c83f54-934c-476c-ba70-a69c5ea1e487","resolution":{"observed_at":"2026-05-10T14:23:49.647707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning","venue":null,"work_id":"8c01212d-c2cd-4bd4-a2d4-bcd472f4b506","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:28e889d83299f15336ce9837a1381602a36651778daa5ebc1917791e29f5989f","observation_id":"c8f15db4-19d6-4d83-a753-40dcc3c4c9ee","resolution":{"observed_at":"2026-05-10T14:23:49.649751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":"2311.10122","doi":"10.48550/arxiv.2311.10122","metadata_source":"pith","pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","venue":"cs.CV","work_id":"e2121c51-a55e-476a-af81-7ba6970fe6cf","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:1f1c04f105eed535beab945a841866a9433471ffd99b57669d86abb41cf887dd","observation_id":"f349e4c0-686b-4786-adaa-53a8edddfd56","resolution":{"observed_at":"2026-05-14T18:08:01.613687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"8aa445a0-f898-4c7d-8975-0c03805b2eeb","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:d9873299b40f1c65f06404174ff1bd8904add35b943a706562740dd559fb362a","observation_id":"b219c21d-97bb-4821-80fc-731976455243","resolution":{"observed_at":"2026-05-10T14:23:49.651418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":"2ad6b721-f310-4225-ab51-44bd559c5304","year":2015},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:916ebdaef02e64e2f377666844d00e6af90052fe33483090d8ddb01d5169bf29","observation_id":"4a79c2c9-be72-4508-8a9e-932f30570a87","resolution":{"observed_at":"2026-05-10T14:23:49.653459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual spatial reasoning","venue":null,"work_id":"8dadb6a7-a30a-410f-af79-196b3c28411c","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:bfb67fdec0810ebf0abace1ea7001c53b09b60d5483f782e24b65c17de50d6c3","observation_id":"f21353e8-6e08-4dd1-875e-7d26ac3e8eae","resolution":{"observed_at":"2026-05-10T14:23:49.655462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":"2306.14565","doi":"10.48550/arxiv.2306.14565","metadata_source":"pith","pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","venue":"cs.CV","work_id":"ba8e8164-e47f-42d6-83ad-696cb57ee79a","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:4f0693af6c744986542c473ba028fad155af85a6ada536d9d770d60cb786069c","observation_id":"0cec71d8-58ef-48e2-81f2-a141b92d1efc","resolution":{"observed_at":"2026-05-14T17:34:57.031001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"8cd8efd4-eb1b-4c7a-ad08-a193d4b25583","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:ef4f566670ebe723f6ae1ad0d91415c30ba4fa7a763b0ff96e04a3b861e0953d","observation_id":"90ed9301-76ee-44d2-942d-a7e524a229ce","resolution":{"observed_at":"2026-05-10T14:23:49.657619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"5c4d0a40-fd4e-4843-92fe-67bccce42fae","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:982028573a448aa3b446be43c2f9ccac4c3d0e9cd7c41ffe30a0a1d68dcc5332","observation_id":"296a0492-df03-4f34-83d4-1409f908b7af","resolution":{"observed_at":"2026-05-10T14:23:49.659664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"97df1f37-9b7a-47a8-b6c0-6050eb6dd9ef","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:bb1e6668020cb78a05871cc628a8f14872bf0410284173ce2f58fb658dc61904","observation_id":"df059886-a620-40c8-809c-44d9f22f6ddc","resolution":{"observed_at":"2026-05-10T14:23:49.661437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What large language models bring to text-rich vqa?","venue":null,"work_id":"ac4d95bb-d6ed-43e0-9f12-2503ede650e3","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:3580719829cdc7680a19b7ab22036b891ce194e0abb1e92d0b10bf61e1a3e6fc","observation_id":"3a933ec1-7f26-4d31-9304-f0cb90657c0b","resolution":{"observed_at":"2026-05-10T14:23:49.663255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07306","last_updated":"2023-11-13T12:52:29Z","snapshot_observed_at":"2026-08-03T21:40:55.534458Z","submitted_at":"2023-11-13T12:52:29Z","title":"What Large Language Models Bring to Text-rich VQA?","version":1},"cited_work":{"arxiv_id":"2311.07306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.07306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InInternational conference on ma- chine learning, pages 19730–19742","venue":null,"work_id":"a827a89f-1277-4fce-9434-0a9b3fecb38c","year":2025},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2311.07306","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:4bab4a7ea8a25d145acf65f60e016959e444b848aa3fbf75b4e0e0e59a3a6b68","observation_id":"d7382f9a-093c-4f1b-b359-133d9c7af79c","resolution":{"observed_at":"2026-05-10T14:23:49.604786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmbench: Is your multi-modal model an all-around player? Technical Report","venue":null,"work_id":"c56e4331-5b0b-459d-8b48-efe898c8b4aa","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:aac7bb9518efbb9095cd70ca31a08fa53e0f63ec2cabdf48372af5320cda0ad0","observation_id":"679b2922-8129-4a51-a545-9f4b041ca91c","resolution":{"observed_at":"2026-05-10T14:23:49.665085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video detail caption","venue":null,"work_id":"93d52d18-e42e-4270-93cd-7160a1f0f491","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:07ea5e6c096dd66331223fdf6e27c3d6f66cfbe58a505996091563ad86da4c46","observation_id":"6ad57d36-1cb8-4920-9b89-03599fb5c899","resolution":{"observed_at":"2026-05-10T14:23:49.666813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The flan collection: Designing data and methods for effective instruction tuning","venue":null,"work_id":"b124d649-421b-4b11-a3eb-69f53c79bc5e","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:fe60d183c1d4d3c0af7ce58be8b1edb4fb26e3cabd6b28c6b815620f67235e05","observation_id":"15c7f4b3-7a98-457c-b8fb-1726088e38ae","resolution":{"observed_at":"2026-05-10T14:23:49.668564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":"4d65ccbf-1793-43b8-870a-849786f94632","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:780b5894855167c3542165e581a90cd2fa10f8ef1c8cd483e9bafa9d7537bf60","observation_id":"8a071b03-c99c-40c0-892a-fbdcfbee4807","resolution":{"observed_at":"2026-05-10T14:23:49.670487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:7f855ed9ee2e9c9a7f0df50034b4da79ce18920b3be90c0d97eaac4a781ac06b","observation_id":"46eb10de-5d99-40f8-9b91-ed5e2b195334","resolution":{"observed_at":"2026-05-11T01:30:15.750849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"190f0d5c-e9f6-4d84-a705-3c3ebd6a019b","year":2021},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:17424e2e226c04cb3ac7611135f3c967a8a6dc64a28007145da32260ec9869b6","observation_id":"e30d940b-ceaf-4804-a7d7-704711b348f8","resolution":{"observed_at":"2026-05-10T14:23:49.672505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"d31eb732-a3cc-453c-a037-5a6a4d4f6ed1","year":2021},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:30abaceb9b90d26bf2de0cd6cce2b137be924a65fbd135f185ec871a3cf5ac2f","observation_id":"8d34a9a0-7931-44fc-ade0-5176bdd9e566","resolution":{"observed_at":"2026-05-10T14:23:49.674472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"36a8c621-7ba6-4b7e-b537-16a6ddac9de6","year":2022},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:4213fac6c0e0991d782feaf15793782f62f0a974973a910dd59e6f47750c7a38","observation_id":"0ef779fb-b910-4310-95b4-699b47a8e80c","resolution":{"observed_at":"2026-05-10T14:23:49.676605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":"e15101b0-8e8b-4f43-aeeb-ac364cf7a650","year":null},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:1c9146e53788c582c785b330c8275083f47572cf0f28cabc4fe9e8ccc8e38899","observation_id":"4039bad7-b895-4c21-9fd6-4e39e408e529","resolution":{"observed_at":"2026-05-10T14:23:49.678897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":null,"work_id":"f9bd6ebf-617d-4f7a-99e9-380fce602fac","year":2021},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:8276093719b9ad92a2fba75c1ea974f30083d283f91aaad8a617fea87e9ad404","observation_id":"79454796-eea8-4dbc-b54d-4353a6dd42a8","resolution":{"observed_at":"2026-05-10T14:23:49.680874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:ac9e298b57fe2643ddda7d3bf5ad0b97525347031a9d3d32df6d85930974f498","observation_id":"ea453277-00f1-42d0-a90c-d7d711bff62d","resolution":{"observed_at":"2026-05-15T03:36:18.685087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"299d7371-7505-49af-b408-2889e322bd32","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:20a500f14dc839cb93d4a3c4eb0627f8c9de6235c51557a48d7cab23362cda69","observation_id":"26a70b3e-c92f-4f6e-b92a-d4e222da2445","resolution":{"observed_at":"2026-05-10T14:23:49.683295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"cf98b770-80c8-449c-a6ab-75eba846dd23","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:d8fe813e24fdeb4cb59f50957ca2b6667502499cc8d0341e20fa8beb7cf8ff04","observation_id":"cbbad9f4-b95f-44e3-a807-34efa192c4c6","resolution":{"observed_at":"2026-05-10T14:23:49.685493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"badfd34f-0958-4610-aab2-75ea145cef57","year":2019},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:9a67c92fad3e4b406eebd725fb349b91f8de2b221bd8f8cac82cec903ad52c1b","observation_id":"1fe2b577-ad07-40b4-a9db-b016eeaaf124","resolution":{"observed_at":"2026-05-10T14:23:49.687408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The iam-database: an english sentence database for offline handwriting recognition","venue":null,"work_id":"17b1f4c6-d301-45c2-9516-204315475754","year":2002},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:445772a8dff7347a931f29caceb94099939e6bf6f4010b51cb00fedf8bc4a8c3","observation_id":"c289ac2f-f956-4e93-b0a0-4ba45a1478dd","resolution":{"observed_at":"2026-05-10T14:23:49.689261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":1,"verified_exact":16,"verified_fuzzy":79},"total_outbound_references":179},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 179 outbound references and 100 inbound Pith citation observations for arXiv:2408.03326."}