{"as_of":"2026-08-11T02:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df4e568250de1f61086980595ef9f96bb2a02b788b60a17d4a1c48ec218b57c8","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T10:53:26.574350Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":129,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:15:04.579056Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T05:35:13.118221Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2505.15436"},"observation_digest":"sha256:f6748e2b1dbf5c271f74efbb4300872b18f9c711cca1cb64f4094883de6193af","observation_id":"b917bfce-3735-45c4-80af-82bfe0998b31","resolution":{"observed_at":"2026-05-17T05:35:13.215458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T18:15:04.579056Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-10T17:38:35.603291Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:04.579056Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:592f1914570166326f8ec35b464890adedfae09f49a5c30b55efd0aebd97e516","observation_id":"1ac081a8-7e28-4f8c-bf34-9c7875622ae9","resolution":{"observed_at":"2026-08-03T18:15:04.579056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T14:57:29.090391Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.18735","last_updated":"2026-05-25T12:55:14Z","snapshot_observed_at":"2026-08-07T05:11:54.627363Z","submitted_at":"2025-12-21T13:50:26Z","title":"$M^3-Verse$: A \"Spot the Difference\" Challenge for Large Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T14:57:29.090391Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2512.18735"},"observation_digest":"sha256:9f8dfd3773da556440b7e49b2d45566d201b23d35e836a84290448c8e396b66c","observation_id":"5356b479-aeb8-46c3-bb09-b613b6c54de4","resolution":{"observed_at":"2026-08-03T14:57:29.090391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T11:28:04.980968Z","title":"arXiv preprint arXiv:2509.23661 (2025) 2, 3, 4, 11, 24, 35, 36","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06550","last_updated":"2026-07-22T15:20:13Z","snapshot_observed_at":"2026-08-06T23:57:51.136833Z","submitted_at":"2026-01-10T12:18:12Z","title":"Generative Semantic Multi-Object Tracking: A Large-Scale Benchmark and an MLLM-Driven Reasoning Framework","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:28:04.980968Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2601.06550"},"observation_digest":"sha256:c6f48deeda945a9dcdcdb693a55bfece8660a677957a2612dbedafb92a4b26c1","observation_id":"a56e1fd8-4266-4845-a1f8-4e3861645a2d","resolution":{"observed_at":"2026-08-03T11:28:04.980968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2601.09636","last_updated":"2026-05-13T02:54:19Z","snapshot_observed_at":"2026-07-06T22:41:43.594456Z","submitted_at":"2026-01-14T17:12:48Z","title":"PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T14:32:36.257645Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2601.09636"},"observation_digest":"sha256:5d3702f627658a442e3fa1048c1fa1da4ed92a936361adc3ebd2f59628f57f44","observation_id":"5716265c-27fa-4e24-a474-7d6ee936cdbc","resolution":{"observed_at":"2026-05-16T14:32:59.922873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T06:04:50.083863Z","title":"Llava- onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.00471","last_updated":"2026-06-05T06:11:46Z","snapshot_observed_at":"2026-08-10T16:49:13.302966Z","submitted_at":"2026-01-31T02:49:10Z","title":"Dual Latent Memory for Visual Multi-agent System","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:04:50.083863Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2602.00471"},"observation_digest":"sha256:3b478b572f04bb753b1ead8592bed8023b5d11874d17d2f25b4d0fefeb1ed9fb","observation_id":"5a194843-e605-457b-8ed1-d8df4eb8ec76","resolution":{"observed_at":"2026-08-03T06:04:50.083863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T05:06:43.872810Z","title":"Llava- onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03300","last_updated":"2026-06-15T19:28:32Z","snapshot_observed_at":"2026-08-07T14:53:21.548464Z","submitted_at":"2026-02-03T09:26:32Z","title":"R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T05:06:43.872810Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2602.03300"},"observation_digest":"sha256:86604b5f0a3505557d3ed7263394fddd1ffd5b490f8196a460323211e69a4052","observation_id":"349738ae-b01c-42f3-91c0-9874107e2033","resolution":{"observed_at":"2026-08-03T05:06:43.872810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-03T03:16:49.965608Z","title":"LLaV A- OneVision-1.5: Fully Open Framework for Democratized Multimodal Training.arXiv preprint 2509.23661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.08735","last_updated":"2026-06-10T06:24:51Z","snapshot_observed_at":"2026-08-09T18:15:14.799535Z","submitted_at":"2026-02-09T14:39:43Z","title":"From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:16:49.965608Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2602.08735"},"observation_digest":"sha256:bba70bad8cb467f3ed24e7d3118b8b3c6d812ff80eda001862779373ae36613c","observation_id":"73b4d90e-ff62-4713-ab13-0b5c884139de","resolution":{"observed_at":"2026-08-03T03:16:49.965608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-02T20:57:10.768968Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21877","last_updated":"2026-03-19T15:10:18Z","snapshot_observed_at":"2026-08-09T03:07:50.471790Z","submitted_at":"2026-02-25T13:02:35Z","title":"How to Take a Memorable Picture? Empowering Users with Actionable Feedback","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T20:57:10.768968Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2602.21877"},"observation_digest":"sha256:a9439e90afca011c862f2cd9222a16768edd7caa6edb653247d3e7b6e27fcf93","observation_id":"85f3831f-f314-4016-b1fa-e21ad07c8f9b","resolution":{"observed_at":"2026-08-02T20:57:10.768968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2603.01400","last_updated":"2026-04-09T18:07:09Z","snapshot_observed_at":"2026-08-07T14:16:18.120869Z","submitted_at":"2026-03-02T03:06:40Z","title":"Token Reduction via Local and Global Contexts Optimization for Efficient Video Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T18:25:21.621268Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.01400"},"observation_digest":"sha256:0d104590d4ebc35f4d6db664bdd05287124386282857170c39b7a80d98755334","observation_id":"1055f925-b328-461c-b4ae-ae9e7c4202ec","resolution":{"observed_at":"2026-05-15T18:26:26.935702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2603.03944","last_updated":"2026-04-03T20:11:12Z","snapshot_observed_at":"2026-07-06T22:47:46.409064Z","submitted_at":"2026-03-04T11:09:39Z","title":"SCP: Spatial Causal Prediction in Video","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T16:47:44.523606Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.03944"},"observation_digest":"sha256:0b738a0461e0cb27f89554495d7e8e1634d877214ad938b8d09e72688170520e","observation_id":"ed61e2d9-dd4d-4810-bf4c-937f630c789a","resolution":{"observed_at":"2026-05-15T16:50:11.662033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2509.23661 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-10T15:56:12.567330Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:1bca44ceee774115efdc9e9fcafe5d33daba9e2da5179ee000019daed4000482","observation_id":"127ea1cc-24a0-4cb0-bdb4-b7814eccc74c","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-15T12:42:28.672749Z","title":"arXiv preprint arXiv:2509.23661 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08316","last_updated":"2026-07-01T07:09:02Z","snapshot_observed_at":"2026-08-04T04:57:22.852231Z","submitted_at":"2026-03-09T12:38:28Z","title":"SlowBA: An efficiency backdoor attack towards VLM-based GUI agents","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T12:42:28.672749Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.08316"},"observation_digest":"sha256:41ccf5fd3c27a3b683634f6e59019b7569a49574165986e7f0a58e14d89a237e","observation_id":"aba40587-7c77-41d3-ba35-b127dbd705b6","resolution":{"observed_at":"2026-07-15T12:42:28.672749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-02T18:10:17.054079Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14807","last_updated":"2026-07-26T09:06:12Z","snapshot_observed_at":"2026-08-09T22:46:46.886546Z","submitted_at":"2026-03-16T04:23:29Z","title":"HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:10:17.054079Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.14807"},"observation_digest":"sha256:cc056d028c41d9b2d3d424558fb6160551e03d570e39e6714f94f460babbecb1","observation_id":"1e00bf86-2b95-41c9-bcc9-462e83cb5da0","resolution":{"observed_at":"2026-08-02T18:10:17.054079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-13T22:32:19.740039Z","title":"LLaVA-OneVision-1.5: Fully open framework for democratized multimodal training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18558","last_updated":"2026-06-26T08:15:42Z","snapshot_observed_at":"2026-08-01T05:33:52.971932Z","submitted_at":"2026-03-19T07:11:53Z","title":"HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T22:32:19.740039Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.18558"},"observation_digest":"sha256:871fd10c3c52e7550ead9b17ad278a4ea2550be3abf69c1fb588a9bde1b7060c","observation_id":"1947a29a-bdd4-4bc0-a9d5-acd628fd37d9","resolution":{"observed_at":"2026-07-13T22:32:19.740039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2603.25120","last_updated":"2026-03-26T07:45:29Z","snapshot_observed_at":"2026-07-06T22:50:37.468743Z","submitted_at":"2026-03-26T07:45:29Z","title":"DFLOP: A Data-driven Framework for Multimodal LLM Training Pipeline Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T11:05:07.336827Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.25120"},"observation_digest":"sha256:108657fba9f16c7a6647268fabfa45971857d4212d10d54b3ca78ba4eea9b7f0","observation_id":"3142730b-f9d2-408f-9a3f-7ecc346f62ca","resolution":{"observed_at":"2026-05-21T11:10:02.348735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-14T20:08:04.785209Z","title":"ArXiv Preprint ArXiv:2509.23661 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.26645","last_updated":"2026-07-13T17:23:53Z","snapshot_observed_at":"2026-08-09T04:28:44.944874Z","submitted_at":"2026-03-27T17:48:00Z","title":"Peel neighborhoods","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T20:08:04.785209Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.26645"},"observation_digest":"sha256:f1841c2a6ebb9e26e2f12b165fbb9a3864640deafeec1894db4e0165da2b009f","observation_id":"5bdf1458-ab84-49fb-bfbe-bae8e742e76b","resolution":{"observed_at":"2026-07-14T20:08:04.785209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2603.27064","last_updated":"2026-04-14T20:08:27Z","snapshot_observed_at":"2026-07-06T22:50:50.593464Z","submitted_at":"2026-03-28T00:45:05Z","title":"ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T22:39:06.113655Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2603.27064"},"observation_digest":"sha256:0c3e3a08f297020b549b468a94ab572b2ed829c71153794091f8c5195904ba00","observation_id":"2e90120b-beb8-4475-95d0-04bff2add184","resolution":{"observed_at":"2026-05-14T22:39:32.904073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-01T03:43:05.117795Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:58660833445eefd2bbd62c18cf22bb03e00c86e9aba62750261a053f70348e7b","observation_id":"cd311869-f0bd-4e8a-b264-8c4536981707","resolution":{"observed_at":"2026-05-13T21:08:17.284561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.04419","last_updated":"2026-04-06T04:56:49Z","snapshot_observed_at":"2026-08-11T02:23:13.315119Z","submitted_at":"2026-04-06T04:56:49Z","title":"BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:10:07.699225Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.04419"},"observation_digest":"sha256:b320082387b6a6b27253488b95dba6601000600623845aaced076303294b5c61","observation_id":"01e30d6b-ae9a-4cde-9452-8ffd76e762b7","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.06714","last_updated":"2026-04-08T06:13:16Z","snapshot_observed_at":"2026-07-06T22:55:06.424752Z","submitted_at":"2026-04-08T06:13:16Z","title":"Steering the Verifiability of Multimodal AI Hallucinations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:19:45.405698Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.06714"},"observation_digest":"sha256:44ce358f1335d664fc3ca273fa3813f65a8c9a854d274dc3b2c1408fae1362a8","observation_id":"cfbfdf4f-b70c-4886-bfa7-560635bcffe1","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.06725","last_updated":"2026-04-08T06:47:55Z","snapshot_observed_at":"2026-08-02T13:53:46.692069Z","submitted_at":"2026-04-08T06:47:55Z","title":"Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:46.753641Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.06725"},"observation_digest":"sha256:1d960a5712113b1d865e44e7a6ccfdf388744caa4d4bd29f2416cdc6070735c2","observation_id":"85be7987-200e-4b19-a14a-0db85f1bb29d","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-04T18:58:19.981225Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:9db3ed8cf0f9c84ab21085234fa54c25b65c2260745b7a5e92d61978bb8f15be","observation_id":"787b359f-03c1-4185-a051-bdb401ced8dc","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.08120","last_updated":"2026-04-09T11:40:25Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:40:25Z","title":"Small Vision-Language Models are Smart Compressors for Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:49.654073Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.08120"},"observation_digest":"sha256:e1c4f8e5f7fac887c83aeccb4b3856b2c281c296a89d9ea3c436c0ddf7bc85b5","observation_id":"5016fc86-0c22-4adc-9087-09269cfb3ac9","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.08456","last_updated":"2026-04-09T16:51:42Z","snapshot_observed_at":"2026-07-06T22:57:31.046146Z","submitted_at":"2026-04-09T16:51:42Z","title":"Entropy-Gradient Grounding: Training-Free Evidence Retrieval in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:14:11.941977Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.08456"},"observation_digest":"sha256:678cefda82505a60313dfda034debb35dc01cc3f3a9633fea187f0481072d2e2","observation_id":"7e4d366d-480f-497a-a5ed-b996f6d4fb22","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:34.909229Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:349a30c6974eb69a8997755d702c9791d27ec43efec5280092cbddacf2ab457b","observation_id":"108cb2b1-22d1-4f94-adda-44c29233d8dc","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-02T16:34:02.688999Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.08881","last_updated":"2026-07-30T10:00:35Z","snapshot_observed_at":"2026-08-02T23:16:51.942005Z","submitted_at":"2026-04-10T02:42:52Z","title":"Targeted Interpretable Safety Neuron Enhancement for Multilingual Vision-Language Large Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T16:34:02.688999Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.08881"},"observation_digest":"sha256:ae90ea0cd5d72dd66d01721c4b96a742d1a68a029928ff9cc3c94312a8b7001e","observation_id":"703b41d5-9773-42e5-91b4-932b3c967f8a","resolution":{"observed_at":"2026-08-02T16:34:02.688999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.08991","last_updated":"2026-05-14T13:17:55Z","snapshot_observed_at":"2026-08-02T15:20:59.838640Z","submitted_at":"2026-04-10T05:53:47Z","title":"PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:40:39.180502Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.08991"},"observation_digest":"sha256:40e52157599f6824bef1d41a84fa4053a8940a259318b5c8ae1fad2e017462c7","observation_id":"5feff337-67bd-4dd0-b6f4-d500cb2c9ad0","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.08991","last_updated":"2026-05-14T13:17:55Z","snapshot_observed_at":"2026-08-02T15:20:59.838640Z","submitted_at":"2026-04-10T05:53:47Z","title":"PinpointQA: A Dataset and Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T06:36:57.544235Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.08991"},"observation_digest":"sha256:b61765621e192057855f9efafc8f093f76755c7f8cd34adadaf66922664384d4","observation_id":"8c4c3159-2089-4c1f-8f42-2019eabc6b59","resolution":{"observed_at":"2026-05-15T06:39:48.790068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.12966","last_updated":"2026-04-14T16:59:53Z","snapshot_observed_at":"2026-08-08T13:53:17.870129Z","submitted_at":"2026-04-14T16:59:53Z","title":"Boosting Visual Instruction Tuning with Self-Supervised Guidance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:27:52.208827Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.12966"},"observation_digest":"sha256:d6ee3e9909a5eeb926df408af3490b3c7ec1ed20dd936541cd82f65c056bbb79","observation_id":"a4065dd2-6766-4ff8-8f39-da886683f0ab","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.13074","last_updated":"2026-03-20T17:59:57Z","snapshot_observed_at":"2026-07-06T23:01:10.333101Z","submitted_at":"2026-03-20T17:59:57Z","title":"PersonaVLM: Long-Term Personalized Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T08:02:10.327523Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.13074"},"observation_digest":"sha256:af16726f05704ad76cf959e42e709674d652cee4ce1bdc3f47ac676ee2fa50e4","observation_id":"d3f719bc-52d5-461c-a042-fceb0656903c","resolution":{"observed_at":"2026-05-15T08:05:15.453050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.13710","last_updated":"2026-05-09T08:14:59Z","snapshot_observed_at":"2026-08-03T00:43:33.977595Z","submitted_at":"2026-04-15T10:39:42Z","title":"SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T14:03:23.807710Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.13710"},"observation_digest":"sha256:294ff0317e546c21f3a03b7e92436196b96e151e335e9c83a908037b4f0ee057","observation_id":"63e716c8-fc00-47bc-a5af-85a4da609d5f","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.13710","last_updated":"2026-05-09T08:14:59Z","snapshot_observed_at":"2026-08-03T00:43:33.977595Z","submitted_at":"2026-04-15T10:39:42Z","title":"SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:25.022963Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.13710"},"observation_digest":"sha256:114fe60d261c7bd68e7c0e3bf6f8d40c7e6f1f7bda358779a3ab56b57b86b7ed","observation_id":"ea5dc257-7758-4616-aec3-430dfd6e0574","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.14041","last_updated":"2026-04-16T03:14:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:22:10Z","title":"Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:04:34.328439Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.14041"},"observation_digest":"sha256:1a04e8ca1e76bdd1b545457f40387d958ddb1ed2dbc4074dfa66709432adead0","observation_id":"ba838f1f-db2c-41f3-9f83-335e075b4a11","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.15188","last_updated":"2026-04-16T16:21:05Z","snapshot_observed_at":"2026-07-06T23:02:49.302337Z","submitted_at":"2026-04-16T16:21:05Z","title":"VisPCO: Visual Token Pruning Configuration Optimization via Budget-Aware Pareto-Frontier Learning for Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T11:28:44.565497Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.15188"},"observation_digest":"sha256:b43c5703ef5f49e33e09deca5b585c87d4f10dcaab4aa01c7b65b9b716a5565e","observation_id":"99182cbd-e134-48a7-92f6-eb31c28a6a36","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.16514","last_updated":"2026-07-12T15:32:26Z","snapshot_observed_at":"2026-08-09T21:17:15.733635Z","submitted_at":"2026-04-15T09:17:38Z","title":"BARD: Bridging AutoRegressive and Diffusion Vision-Language Models Via Highly Efficient Progressive Block Merging and Stage-Wise Distillation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T14:28:47.505755Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.16514"},"observation_digest":"sha256:63e2d60c1ad76911c7f3ab6074f9142eda27b474a47381971546f24e88616d4e","observation_id":"d1212e51-d4f0-4391-be2d-9181e458135d","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-07-14T19:27:29.843866Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22226","last_updated":"2026-07-13T04:05:34Z","snapshot_observed_at":"2026-07-16T23:18:42.650626Z","submitted_at":"2026-04-24T05:02:03Z","title":"Towards Temporal Compositional Reasoning in Long-Form Sports Videos","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T19:27:29.843866Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.22226"},"observation_digest":"sha256:e8bdf3468062efc53ba2c3bda24804b6d14d871286d8ef8318f34ec026390298","observation_id":"1d8947d4-f66f-4005-ada7-56ffeb0eaded","resolution":{"observed_at":"2026-07-14T19:27:29.843866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.22575","last_updated":"2026-04-24T14:07:54Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:07:54Z","title":"SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T12:18:23.898779Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.22575"},"observation_digest":"sha256:e5f78470d956fdbe5d780e6b9fd3c1726244e630ed02f10bb70b014b8d25aab3","observation_id":"14176f09-46b7-4be3-8289-cc7cf2de2db3","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:d25da606e81d3e32bdd811d7c89903f8e5720fdaaf8a4e8a0cf15cf0c7040dd4","observation_id":"8da5f080-67dc-441f-965e-cb07b768a296","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:9c243f150cc7a4e3fbbeae50f4328fe77852dda113ba028fcce69b06f3c20e7a","observation_id":"aa21ed8b-d792-4f37-8981-a01aba58df48","resolution":{"observed_at":"2026-05-20T23:43:51.182896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.00444","last_updated":"2026-05-01T06:24:40Z","snapshot_observed_at":"2026-07-06T23:13:52.304925Z","submitted_at":"2026-05-01T06:24:40Z","title":"Scaling Video Understanding via Compact Latent Multi-Agent Collaboration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T20:11:11.410051Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.00444"},"observation_digest":"sha256:4dece4c22fb9f54a5036515a57eb8cb63bd514a1bb4ef7a6f0133a5effd6ae91","observation_id":"c4a7cbcb-c5c9-4b51-b8f7-42da4fcf56c7","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:483844bf9d37b2dd8f9c7bd1c4f9532ffc42a4fbef753ded6c15d8ac436d1a74","observation_id":"d57b3385-acb7-4ee0-a523-0827cb857b0a","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:d333c78b3ba998e23c860f42a892b97c0d382f590516711f8ccedd1799163f52","observation_id":"bcc3743c-f4d9-4dd8-b78e-ea3c3e13b86f","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.01272","last_updated":"2026-05-02T06:11:53Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T06:11:53Z","title":"GameScope: A Multi-Attribute, Multi-Codec Benchmark Dataset for Gaming Video Quality Assessment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T15:02:17.115842Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.01272"},"observation_digest":"sha256:4dd59b12f8a1801e57959aff6808628a676fa103f6077b05855f9969c87a466f","observation_id":"3f00c458-fd10-4d3a-8806-2a235c9b2cb5","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.01911","last_updated":"2026-05-05T13:32:54Z","snapshot_observed_at":"2026-08-08T19:47:13.865519Z","submitted_at":"2026-05-03T14:47:03Z","title":"SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T17:27:57.384336Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.01911"},"observation_digest":"sha256:62648debb7de312f611d95798aa4931fccfe1e3b7fd3235f7a9629527a42314f","observation_id":"6d95d961-fc09-4be7-b773-9da99db45b7f","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.05593","last_updated":"2026-05-07T02:25:46Z","snapshot_observed_at":"2026-08-02T17:50:24.855737Z","submitted_at":"2026-05-07T02:25:46Z","title":"Causal Probing for Internal Visual Representations in Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T11:58:08.853836Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.05593"},"observation_digest":"sha256:e1610cf2a06666fb0eaa8e9ad29b5768eefab8859a322d83ecc45bd6e6e43c38","observation_id":"9aa22368-ea91-4392-ab56-2a7fdc87daa5","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.07575","last_updated":"2026-05-11T11:58:53Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:46:10Z","title":"Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-11T02:30:55.939351Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.07575"},"observation_digest":"sha256:533acc1f447fa53f0df5f8753b802dad13c1806a7d8651e1d0a1fdd71ee4d698","observation_id":"8597090d-1cd3-4f16-bf27-eea09536c982","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.07575","last_updated":"2026-05-11T11:58:53Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:46:10Z","title":"Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-12T03:00:34.728880Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.07575"},"observation_digest":"sha256:0ddff5c263ed90dc503a8cd9cac0a7553d45713e8147b6f8d9c9b19c1bfe6b61","observation_id":"54b888d4-6da8-46bb-85a6-2b2ad46d75a3","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.07817","last_updated":"2026-05-08T14:49:10Z","snapshot_observed_at":"2026-08-10T21:15:51.869790Z","submitted_at":"2026-05-08T14:49:10Z","title":"GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:03:52.566413Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.07817"},"observation_digest":"sha256:430d9f359bc884800bd01646ef670a05504a389f20d29ef08b5bc722ab4cd648","observation_id":"d1c355a4-e3f6-43a2-a814-e2cc36b37582","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-06T15:47:06.010179Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:e39fc12fba8399b7c4baabe99cbf2362c78a73a81b53e48eea066e723a1b8f80","observation_id":"37d812f7-ce55-421c-85e6-4b13a27bb05e","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.09429","last_updated":"2026-05-10T09:07:04Z","snapshot_observed_at":"2026-08-03T02:25:12.314678Z","submitted_at":"2026-05-10T09:07:04Z","title":"Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T02:29:22.152053Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.09429"},"observation_digest":"sha256:c9905dfdaf02725f1d3acc64401d4ccc3d1b9c5a49d056dfb09eae92167844a1","observation_id":"eb7ac702-33ad-4a53-b580-b7dce4cd9dbb","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.10394","last_updated":"2026-05-11T11:38:32Z","snapshot_observed_at":"2026-08-06T20:47:24.012535Z","submitted_at":"2026-05-11T11:38:32Z","title":"Sens-VisualNews: A Benchmark Dataset for Sensational Image Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:13.461412Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.10394"},"observation_digest":"sha256:a68734aa24cf670f321ad088d1ba611d0476481263af003787a3e2831e355443","observation_id":"73b8cc84-5552-42c3-b5cb-f0bae577c1d0","resolution":{"observed_at":"2026-05-12T10:53:26.698662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.11477","last_updated":"2026-05-12T03:45:11Z","snapshot_observed_at":"2026-08-02T08:51:18.307633Z","submitted_at":"2026-05-12T03:45:11Z","title":"LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T03:20:42.684286Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.11477"},"observation_digest":"sha256:ad8c64cd3c672dbe8c8f363d8fe2e26e482f095744a87d566611a138970462f0","observation_id":"e948a9e3-9bbc-4c6f-a842-538d8c5569fe","resolution":{"observed_at":"2026-05-13T03:22:10.102663Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.11591","last_updated":"2026-05-12T06:17:01Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:17:01Z","title":"Logit-Attention Divergence: Mitigating Position Bias in Multi-Image Retrieval via Attention-Guided Calibration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:26:45.182597Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.11591"},"observation_digest":"sha256:acab25ad29e75990c67b7b64587ba40d7cced24236c7925a967339a430f74116","observation_id":"5383bb70-7c6e-4e24-b80a-001e835af3c2","resolution":{"observed_at":"2026-05-13T01:27:01.711374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.12258","last_updated":"2026-05-12T15:27:40Z","snapshot_observed_at":"2026-08-07T21:13:36.134875Z","submitted_at":"2026-05-12T15:27:40Z","title":"Instruction Lens Score: Your Instruction Contributes a Powerful Object Hallucination Detector for Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T05:50:47.441551Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.12258"},"observation_digest":"sha256:9a8e878ace574fad17dc7d969ccc4921f1b58bb849ff3b38fff87872e135dc69","observation_id":"45c912ff-38df-4f70-831e-63ef8f6060cd","resolution":{"observed_at":"2026-05-13T05:52:22.127221Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-02T12:36:41.415898Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:0f21cdb122a290595f2948e1489e919b421f0b9012f12674603847fcd9ccdc06","observation_id":"5d5bfda9-6dea-41ac-bdf6-41c6312e63a4","resolution":{"observed_at":"2026-05-14T20:22:56.380945Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.15198","last_updated":"2026-05-14T17:59:55Z","snapshot_observed_at":"2026-07-31T04:06:34.172304Z","submitted_at":"2026-05-14T17:59:55Z","title":"ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T03:09:58.411261Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.15198"},"observation_digest":"sha256:38318b10440038ee56e435c6febe8313ba341f8ffdc97310346f854f8187af11","observation_id":"a476c70a-76b1-4475-aff1-ec1cdfa79336","resolution":{"observed_at":"2026-05-15T03:14:53.478527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.15764","last_updated":"2026-05-15T09:24:41Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:24:41Z","title":"GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T18:49:18.815456Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.15764"},"observation_digest":"sha256:76be7a10ed04997aa3d2c7781f67d96d4825fdb33ac6e8ab5b74b5c40789735a","observation_id":"0259e5b1-bb7b-419c-9120-6bdd82715438","resolution":{"observed_at":"2026-05-20T18:53:38.987244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.18214","last_updated":"2026-05-22T16:21:46Z","snapshot_observed_at":"2026-08-09T01:00:58.189744Z","submitted_at":"2026-05-18T10:58:56Z","title":"EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T11:01:17.353843Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.18214"},"observation_digest":"sha256:2ecc42e3a6de3437e678157b7ebcbf863213fa076a6e52ac87385ef3e566af4c","observation_id":"5933b99b-2729-44a8-a312-490afc1eac6a","resolution":{"observed_at":"2026-05-20T11:03:13.579091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.18214","last_updated":"2026-05-22T16:21:46Z","snapshot_observed_at":"2026-08-09T01:00:58.189744Z","submitted_at":"2026-05-18T10:58:56Z","title":"EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T06:22:17.582854Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.18214"},"observation_digest":"sha256:ae643ea8fbcf96eec159e801a4792a015ee233c7b1f7fff978647930d06f43c8","observation_id":"6872e68a-820a-4737-9509-552ffa257b09","resolution":{"observed_at":"2026-05-25T06:25:23.734356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.18853","last_updated":"2026-05-13T12:44:10Z","snapshot_observed_at":"2026-08-05T08:39:22.609418Z","submitted_at":"2026-05-13T12:44:10Z","title":"INAR-VL: Input-Aware Routing for Edge-Cloud Vision-Language Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T20:37:06.957970Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.18853"},"observation_digest":"sha256:80053473ffd92bf8076d6c4e2d02d4d3eb0c9b28fadc9205b8f553fb099b789c","observation_id":"28594ffb-d7c4-4999-b4ed-626fb5da731e","resolution":{"observed_at":"2026-05-20T20:38:59.940512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.20247","last_updated":"2026-08-06T06:26:16Z","snapshot_observed_at":"2026-08-09T23:09:44.275010Z","submitted_at":"2026-05-18T06:31:14Z","title":"CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T08:37:10.313340Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.20247"},"observation_digest":"sha256:7867038b15840df38350122f701aeac93a1709348b0b9318ef8134cb4e10dc7e","observation_id":"dd4052d0-c5d6-47fe-86fa-3139ad344cc1","resolution":{"observed_at":"2026-05-21T08:39:53.506540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:38:26.590720Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:5cffdece769eb6b200813067dfede34aabcb259b6fd1dd0690344a0170a9b0f6","observation_id":"1081bbc3-cc39-4d01-bf51-4457b6d742a4","resolution":{"observed_at":"2026-05-21T05:39:40.607807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.20914","last_updated":"2026-05-26T05:21:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-20T08:57:57Z","title":"RISE: Reliable Improvement in Self-Evolving Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:19:09.596950Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.20914"},"observation_digest":"sha256:1477893c49269bfcbb8f431db635c9d397bea4417f4971b95da9cd1628af6d76","observation_id":"d72db277-76e2-45dd-9276-881537fc991a","resolution":{"observed_at":"2026-06-30T17:24:57.596388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.21487","last_updated":"2026-05-22T09:11:59Z","snapshot_observed_at":"2026-08-02T23:57:55.080721Z","submitted_at":"2026-05-20T17:59:42Z","title":"Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T04:33:51.535737Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.21487"},"observation_digest":"sha256:1a3295e95d89381b427063378ed84c96001259837b63b9d47986dbd765e7cd58","observation_id":"cfe8a004-722e-446c-8021-a22c89f909e7","resolution":{"observed_at":"2026-05-21T04:33:57.700008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.21487","last_updated":"2026-05-22T09:11:59Z","snapshot_observed_at":"2026-08-02T23:57:55.080721Z","submitted_at":"2026-05-20T17:59:42Z","title":"Uni-Edit: Intelligent Editing Is A General Task For Unified Model Tuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T05:43:38.328972Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.21487"},"observation_digest":"sha256:47f5c11417dcc9fa86cfafc62297353b505f4bcfa776bead6cd3a2d315ac3f2a","observation_id":"3cb2db30-8ff8-449d-a5ed-8a34bfb4b918","resolution":{"observed_at":"2026-05-25T05:45:24.148505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.22907","last_updated":"2026-05-21T18:00:22Z","snapshot_observed_at":"2026-08-02T16:30:28.109405Z","submitted_at":"2026-05-21T18:00:22Z","title":"VideoOdyssey: A Benchmark for Ultra-Long-Context and Omni-Modal Video Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:49.390597Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.22907"},"observation_digest":"sha256:2b369491a5ab540ede7713760d8930b3f6a07dd42ec76ee75b9b6b8fcf72360d","observation_id":"922854f8-c61e-4047-b37f-f0bbb1a97a98","resolution":{"observed_at":"2026-05-25T05:55:25.030147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.25461","last_updated":"2026-05-25T06:12:19Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T06:12:19Z","title":"MetaphorVU: Towards Metaphorical Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T22:43:20.101830Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.25461"},"observation_digest":"sha256:32c65542083c8c26841e8c0f78f0d67181c2702fa51c3435faf2a72ff0531b71","observation_id":"8b00eee8-c5f7-44fb-8807-5c5d731ff68e","resolution":{"observed_at":"2026-06-29T22:44:01.337297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.25706","last_updated":"2026-07-04T04:01:13Z","snapshot_observed_at":"2026-07-31T08:07:43.069382Z","submitted_at":"2026-05-25T11:05:37Z","title":"Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:02.455554Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.25706"},"observation_digest":"sha256:02c9bed71bbf75fd702764c176c96c2fd519e24179641ed5033929abc4ce9776","observation_id":"ea9195d4-8be6-4066-ac1e-c19e6997d5b4","resolution":{"observed_at":"2026-06-29T23:24:02.152246Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-07-06T23:35:50.787324Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T22:12:05.365596Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.25979"},"observation_digest":"sha256:5153491846e6e1e9544a5e0a81e9ef8416b4533bb210b1a326d0a1a3e37d48e4","observation_id":"581aa147-7652-47d4-b5e1-341d2bfcc9db","resolution":{"observed_at":"2026-06-29T22:13:59.610224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.29606","last_updated":"2026-05-28T08:42:21Z","snapshot_observed_at":"2026-08-07T08:04:07.008644Z","submitted_at":"2026-05-28T08:42:21Z","title":"HiKEY: Hierarchical Multimodal Retrieval for Open-Domain Document Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T07:39:14.379668Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.29606"},"observation_digest":"sha256:b8465f1270e706671321ede51d80e69f41cb21a5d50a755a8d744bf9e3e200a4","observation_id":"22c7d3f0-56c9-4a51-b678-7d0ec76415b3","resolution":{"observed_at":"2026-06-29T07:43:13.820514Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:2b1bb2beb1de0f02fa1938717a8e31795e376878b88ebdbb5428f2dc14d97ca7","observation_id":"da34d152-e821-4a29-8496-35baa38ce090","resolution":{"observed_at":"2026-06-29T08:23:15.910626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.30265","last_updated":"2026-05-28T17:27:55Z","snapshot_observed_at":"2026-08-01T22:14:47.638279Z","submitted_at":"2026-05-28T17:27:55Z","title":"LoMo: Local Modality Substitution for Deeper Vision-Language Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T08:20:05.081980Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.30265"},"observation_digest":"sha256:8893358bcb8d17a61ace3032e54e41f997254ddc8a6994c8e19dffd43f39fa28","observation_id":"e6283773-defb-4958-89f7-07a6107e90ee","resolution":{"observed_at":"2026-06-29T08:23:15.124540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2605.30698","last_updated":"2026-05-29T00:45:25Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T00:45:25Z","title":"Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:06.490634Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2605.30698"},"observation_digest":"sha256:bf4f7d08cb2718651bfb87cc5b91046de6c2c4152ad9d069dd923791c21ab4b4","observation_id":"df923450-20fe-43a9-a62d-1c3b979d3bdb","resolution":{"observed_at":"2026-06-28T23:42:50.112005Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:ec0432590794b7431e0d8db20cae8e040495a558822066ae8bbf2f5914ec844c","observation_id":"9616b357-95b2-49d2-a8fe-551a5dff4033","resolution":{"observed_at":"2026-07-01T19:26:00.679535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.02171","last_updated":"2026-06-01T12:30:12Z","snapshot_observed_at":"2026-07-06T23:42:35.063977Z","submitted_at":"2026-06-01T12:30:12Z","title":"InsightVQA: High-Dimensional Emotion-Cognitive Visual Question Answering Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T14:57:12.827012Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.02171"},"observation_digest":"sha256:17bf239a9e7eedf2ae49b6d878c6b19b53db6e0a5b661e55afd863e8df85257c","observation_id":"d9117f3e-77ae-447c-b39f-e4aa0fa140cc","resolution":{"observed_at":"2026-06-28T15:02:18.800254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.03871","last_updated":"2026-06-02T16:42:21Z","snapshot_observed_at":"2026-08-06T06:38:24.891846Z","submitted_at":"2026-06-02T16:42:21Z","title":"Visual Instruction Tuning Aligns Modalities through Abstraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:25:20.950792Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.03871"},"observation_digest":"sha256:48450f288dfcbfa4c41be4b8f016e790d92e856743a9b5ca704f68d8bd688210","observation_id":"9e8a6090-5e48-4629-a5d8-ae8f01b80629","resolution":{"observed_at":"2026-07-02T02:56:29.785632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.06462","last_updated":"2026-06-04T17:52:04Z","snapshot_observed_at":"2026-08-08T03:18:09.885458Z","submitted_at":"2026-06-04T17:52:04Z","title":"Benchmark Everything Everywhere All at Once","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T01:03:52.964870Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.06462"},"observation_digest":"sha256:5f059067fa31ebb829984e998f3bd179b4b226a289aeafa21b5dcf6ab9c584c8","observation_id":"b35417bc-f33f-49ef-a6d3-0349718ddb53","resolution":{"observed_at":"2026-07-02T13:46:59.041205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.07639","last_updated":"2026-06-01T09:07:15Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-06-01T09:07:15Z","title":"MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:22:31.310003Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.07639"},"observation_digest":"sha256:78fb3aae5f0550fcfe02119ed2f2de845e6f75d0ddfaca7325c629924eb431a7","observation_id":"67bf9386-ea11-4b0f-99dd-e994e8c4f025","resolution":{"observed_at":"2026-07-01T22:26:17.877757Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.08464","last_updated":"2026-06-07T05:58:39Z","snapshot_observed_at":"2026-07-06T23:47:57.376596Z","submitted_at":"2026-06-07T05:58:39Z","title":"TVI-CoT: Text-Visual Interleaved Chain-of-Thought Reasoning for Multimodal Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T18:54:34.353940Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.08464"},"observation_digest":"sha256:4aa4de8ff7d2612bdbb9a3e980f6753240811ce9b1c3575890a77bff12d122e4","observation_id":"a41ade6a-6a63-4175-b91c-519e332121d4","resolution":{"observed_at":"2026-07-02T22:27:25.908380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.08511","last_updated":"2026-06-07T08:32:13Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:32:13Z","title":"Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T19:02:59.403688Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.08511"},"observation_digest":"sha256:06b610f25a589d928e6a6048e5425e610f004ea5fefe6d0fe06aeba85ef2e014","observation_id":"b6231428-e782-496f-be68-21e46aa0112f","resolution":{"observed_at":"2026-07-02T22:17:26.122906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.10147","last_updated":"2026-06-08T20:26:09Z","snapshot_observed_at":"2026-08-03T03:43:21.595942Z","submitted_at":"2026-06-08T20:26:09Z","title":"From Senses to Decisions: The Information Flow of Auditory and Visual Perception in Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T16:12:53.387567Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.10147"},"observation_digest":"sha256:111531a32c24d9b844b250072bb1c051922d569a224fd6b6707b9560e756cf72","observation_id":"9c7231c6-d17f-4431-801e-68e93c8b7e2e","resolution":{"observed_at":"2026-07-03T01:57:32.394178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.12125","last_updated":"2026-06-10T14:19:15Z","snapshot_observed_at":"2026-08-04T05:43:14.707313Z","submitted_at":"2026-06-10T14:19:15Z","title":"Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T10:04:29.739632Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.12125"},"observation_digest":"sha256:8acba932bbfab52df4b0c6e6530d56e8ba3e6096ab7fff8e28514872a3f27585","observation_id":"e1095336-8700-4016-ad38-021264c5b1fd","resolution":{"observed_at":"2026-07-03T10:27:56.048823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":215,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:f3e993f189e31119b77f130a97ef59d271bdf255fab902c6e27e22b77c5e9915","observation_id":"9fb5d31f-d23d-43a2-885a-1a023423e044","resolution":{"observed_at":"2026-07-03T14:28:29.702432Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.18242","last_updated":"2026-06-16T17:58:40Z","snapshot_observed_at":"2026-08-02T10:04:20.980054Z","submitted_at":"2026-06-16T17:58:40Z","title":"EventDrive: Event Cameras for Vision-Language Driving Intelligence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T01:26:43.752335Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.18242"},"observation_digest":"sha256:ff62e05dd10112b6b55a8dd755ff2d6dafde65c364e9ab17912d21f843f91fae","observation_id":"b8dc02e2-c7d2-4d29-b1fa-b908df80c43a","resolution":{"observed_at":"2026-07-03T20:18:57.091374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19096","last_updated":"2026-06-30T23:36:45Z","snapshot_observed_at":"2026-08-08T13:50:46.156715Z","submitted_at":"2026-06-17T14:06:26Z","title":"PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T21:28:31.600252Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19096"},"observation_digest":"sha256:19c828fd4957da6cf42f781ba9f96326414864befdefea90b32a8890f266f96a","observation_id":"4b6bb2d1-56cb-45d7-8363-9822f964601b","resolution":{"observed_at":"2026-07-04T00:09:14.505087Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19096","last_updated":"2026-06-30T23:36:45Z","snapshot_observed_at":"2026-08-08T13:50:46.156715Z","submitted_at":"2026-06-17T14:06:26Z","title":"PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T22:18:03.991161Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19096"},"observation_digest":"sha256:b8893478f7e84f0d5abb56742162a33156f5afa01e38f215c1729c7627a9f2c7","observation_id":"ba74f4e7-5a76-40a1-8d61-6fa971326ead","resolution":{"observed_at":"2026-07-02T22:27:25.279901Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19100","last_updated":"2026-07-01T09:15:37Z","snapshot_observed_at":"2026-08-02T22:09:19.055769Z","submitted_at":"2026-06-17T14:11:41Z","title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T21:22:53.792778Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19100"},"observation_digest":"sha256:295041819718d2dc739d4f67548ab56769208dd9436d95e9a8449fa85da45a34","observation_id":"2ae1fd90-c27c-4c8d-9da8-c5abf5a1c386","resolution":{"observed_at":"2026-07-04T00:19:12.958668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19100","last_updated":"2026-07-01T09:15:37Z","snapshot_observed_at":"2026-08-02T22:09:19.055769Z","submitted_at":"2026-06-17T14:11:41Z","title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-01T07:34:37.974692Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19100"},"observation_digest":"sha256:6071cd2d159abb9ea78ebe8fc6a1dee91b8a94a8e55507b53938e826ea36ded3","observation_id":"60e186ea-3219-4e3d-9880-16036e32a177","resolution":{"observed_at":"2026-07-01T07:35:28.806321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19100","last_updated":"2026-07-01T09:15:37Z","snapshot_observed_at":"2026-08-02T22:09:19.055769Z","submitted_at":"2026-06-17T14:11:41Z","title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-02T22:15:14.561596Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19100"},"observation_digest":"sha256:78ea425b84044578945c459d7c0971ecc345ffa4ac74fd4853b74b5d79cd530d","observation_id":"b6c3952d-1f89-4698-ae5e-b28ecc9cb72f","resolution":{"observed_at":"2026-07-02T22:17:24.978246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19534","last_updated":"2026-06-17T19:27:55Z","snapshot_observed_at":"2026-08-03T14:33:40.759154Z","submitted_at":"2026-06-17T19:27:55Z","title":"PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T20:59:26.886235Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19534"},"observation_digest":"sha256:83f14fc908f039f449fd5fe0bcf6feb40d516a9488c4584c69fe7a77a4ddefcb","observation_id":"69465d34-1e91-4d0f-8be4-fcbe807e7c05","resolution":{"observed_at":"2026-07-04T00:49:17.966899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.19776","last_updated":"2026-06-18T04:24:28Z","snapshot_observed_at":"2026-08-03T12:16:21.711624Z","submitted_at":"2026-06-18T04:24:28Z","title":"Occ-VLM: Occupancy Grounded Vision Language Model for Indoor Scene Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T18:40:20.588652Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.19776"},"observation_digest":"sha256:fad2f94281ba09f9f0b66f16976510e255ae8a34cd6ce904639eb9b8eb9876e0","observation_id":"0dcb5745-6d38-4870-8e3d-d553d0c16a24","resolution":{"observed_at":"2026-07-04T02:59:25.847804Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.20077","last_updated":"2026-06-18T10:52:49Z","snapshot_observed_at":"2026-08-04T07:49:21.370818Z","submitted_at":"2026-06-18T10:52:49Z","title":"The Hidden Evolution of Disguised Visual Context inside the VLM","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T18:08:56.044278Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.20077"},"observation_digest":"sha256:cae6efe39666e7642f5a5a555d8629ffa90817c17bc690e4b737e244f95c5d7d","observation_id":"3bb3aa63-3f91-48ce-a715-d44acc1b30da","resolution":{"observed_at":"2026-07-04T03:19:31.060994Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.23061","last_updated":"2026-06-22T09:13:19Z","snapshot_observed_at":"2026-08-06T17:44:01.065759Z","submitted_at":"2026-06-22T09:13:19Z","title":"MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T08:58:37.673268Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.23061"},"observation_digest":"sha256:aa6f88020945ce62c752de97d8cc9c55da5586f06755173fc4ec62c256da6a7f","observation_id":"32b7ad4e-1322-4a12-922c-a467a5910ea3","resolution":{"observed_at":"2026-07-04T10:19:47.497930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.24539","last_updated":"2026-06-23T13:06:51Z","snapshot_observed_at":"2026-08-02T12:19:25.025255Z","submitted_at":"2026-06-23T13:06:51Z","title":"PointVG-R: Internalizing Geometric Reasoning in MLLMs for Precise Pointing Localization via Visual Chain of Thought","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T00:46:17.094339Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.24539"},"observation_digest":"sha256:f1590e06b3a4063bb0c0a23b8653ea25c2e5ae88fe326fc3ae93cdfaaa0d4815","observation_id":"2380fd62-8a0a-4ffd-96a2-a0a8c2e04b39","resolution":{"observed_at":"2026-07-04T16:19:57.673272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.25634","last_updated":"2026-06-24T09:38:27Z","snapshot_observed_at":"2026-07-07T00:00:02.505448Z","submitted_at":"2026-06-24T09:38:27Z","title":"SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:02:44.441202Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.25634"},"observation_digest":"sha256:347e2cd939db3f375be83d679c67db301beab5a933604280ee3165f58656cad3","observation_id":"7a49d3f0-710f-4c52-bec9-feceaa80b68e","resolution":{"observed_at":"2026-07-04T19:50:10.245866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.26535","last_updated":"2026-06-25T02:18:38Z","snapshot_observed_at":"2026-08-06T19:33:14.892044Z","submitted_at":"2026-06-25T02:18:38Z","title":"From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T05:31:17.461916Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.26535"},"observation_digest":"sha256:256e3380b46cc4431ad61cbe1035dd32d9fe4248fc93857c43caf067b70a48e0","observation_id":"d5d0d744-97d9-4ced-831d-bf813336622c","resolution":{"observed_at":"2026-07-04T13:09:50.241764Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.26602","last_updated":"2026-06-25T05:02:38Z","snapshot_observed_at":"2026-08-05T11:23:05.305941Z","submitted_at":"2026-06-25T05:02:38Z","title":"DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T05:18:01.931929Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.26602"},"observation_digest":"sha256:0a55c100b3312bd2f49ff67fc0747831a365347e274527ff0290803353ddff69","observation_id":"f250ae5c-09ae-45ab-89a6-26bf685e844d","resolution":{"observed_at":"2026-07-04T13:19:50.940528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.26631","last_updated":"2026-06-25T05:47:52Z","snapshot_observed_at":"2026-07-07T00:00:56.276365Z","submitted_at":"2026-06-25T05:47:52Z","title":"Position Rebinding Cache Reuse: Replay-Free Visual Revisiting for Interleaved Multimodal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T05:08:09.884231Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.26631"},"observation_digest":"sha256:8d2c6bf62356df3237ee08c0cb90da983a67f3fe6a87897bc9dfcfbd4c2b0df0","observation_id":"561bd4ba-7118-41f8-9697-05d8be3b0324","resolution":{"observed_at":"2026-07-04T13:29:52.025953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":"2509.23661","doi":"10.48550/arxiv.2509.23661","metadata_source":"pith","pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","venue":"cs.CV","work_id":"41c2802e-aff9-482f-b506-10955ff0838d","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-11T02:19:47.304575Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:638c2e8bbfbe510c5eee92ed6a854e417dee003f8fece1b694957619a0b0bb60","observation_id":"67e520c4-024a-4f67-a238-b39f9699f33a","resolution":{"observed_at":"2026-07-01T15:35:48.920115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.817018+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.23661/citation-record","integrity":"/paper/2509.23661/integrity","json":"/paper/2509.23661/citation-record.json","paper":"/paper/2509.23661"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:e67c688397fd4c56f2c8cc7df84a05ddc1eb5a2f3175e2f09dd083ca99710fb3","observation_id":"cbc9b1a2-80e2-4ec9-9357-be6e956ad599","resolution":{"observed_at":"2026-05-12T10:53:26.605927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:626b82d45761377c84258aee28595cfa8c34dfadf8eb5ba11406c3f0754c6fef","observation_id":"b62095e3-85b8-401e-96ee-90db625f3260","resolution":{"observed_at":"2026-05-12T10:53:26.615927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:28f609453a12e8a38597a4ab26dc7c0ca91b00869c54857302a6eb7e4bd996e5","observation_id":"6be7f074-8350-42ff-ae4e-2dfaa8007e4d","resolution":{"observed_at":"2026-05-12T10:53:26.625638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:bc5a533a318e1146b60f64ad98ee7f65d8146c17c726a4e4880b77f9474137cd","observation_id":"0ccb065e-fc53-4243-8d35-1912f4ee181b","resolution":{"observed_at":"2026-05-12T10:53:26.633881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1a14e317-02a5-4d8a-8cb7-d3d0bd156ce6","year":2024},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:f987c0be9465f734e3d1763c57600ecdb5ab9ae3f82a2121c29caa445104b7de","observation_id":"0e9fd3db-5621-447e-a107-d9caf1fe1d66","resolution":{"observed_at":"2026-05-12T10:53:26.690243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:4db29de011c3776a711a72a793a5b887801c573c82807e751e8ad68d894ffbb1","observation_id":"6e7f1377-5f59-4b6e-a128-dc2373558a68","resolution":{"observed_at":"2026-05-12T10:53:26.659111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:5d0ae48f246393d995ad8d01b91416516e1261745ec27acb36677a7ab8eb4b05","observation_id":"d4721ba2-2861-46cd-984a-826ed8ccff76","resolution":{"observed_at":"2026-05-12T10:53:26.665304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:11c19f58b7a0306b0f628c231b9918ccba329c122701be1f5c6a9c003cd8c700","observation_id":"cf0b588f-8e48-4056-aa29-6a671db1bf53","resolution":{"observed_at":"2026-05-12T10:53:26.674948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:8ccff19d130e47c2d8858a5d51b72a6656f774460293c0714c6aeaaed546e7dd","observation_id":"3b1c8059-5c00-4693-8df0-5593e2087e77","resolution":{"observed_at":"2026-05-12T10:53:26.683427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.02970","last_updated":"2023-03-30T14:22:55Z","snapshot_observed_at":"2026-07-06T13:49:37.223049Z","submitted_at":"2022-09-07T07:32:37Z","title":"Fengshenbang 1.0: Being the Foundation of Chinese Cognitive Intelligence","version":3},"cited_work":{"arxiv_id":"2209.02970","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.02970","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fengshenbang 1.0: Being the foundation of chinese cognitive intelligence","venue":null,"work_id":"6b35b641-63be-4e1d-a381-e8e63d8b09e4","year":2022},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2209.02970","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:a566f82a744f1073403a84ecc22b9ce0c5d0acc13f4cd735cd9cafeca813afb9","observation_id":"9afd1751-b2fb-4b5d-a371-f26283a6438e","resolution":{"observed_at":"2026-05-12T10:53:26.642822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:2ce1af8d4be07fb16427a5b7a584abec404384bd5df3af91389db79844ce3146","observation_id":"c7c9e0a2-5806-4133-bc6d-1ce5d4549367","resolution":{"observed_at":"2026-05-12T10:53:26.651501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2.5-VL with Same LLM ToenableafaircomparisonwithQwen2.5-VL,wetrainLLaVA-Onevision-1.5-3BbasedonQwen2.5- 3B-Instruct","venue":null,"work_id":"31508e96-0ebb-4861-bb7c-f27df659c8e1","year":2023},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:6b2915ffb1ea1dbecf5b8fd1cd750cf9dfe57f1608a952ee6a5c13f4f95a6d47","observation_id":"c92bab24-d994-458e-8c1d-ba831700dccb","resolution":{"observed_at":"2026-05-12T10:53:26.696416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":2},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 100 inbound Pith citation observations for arXiv:2509.23661."}