{"as_of":"2026-08-11T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:02815d4a4a01e37e73d9311a6c044e81a3a5350e5e86286f1510578438ef2729","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T06:01:53.730356Z","state":"measured"},{"denominator":169,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":169,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":216,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:47:12.229444Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":23,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T01:29:30.032408Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2403.14624"},"observation_digest":"sha256:d6874df05f1118121b3122c20f16e423b1d0fae1276e8e1e024a7697af17ca33","observation_id":"211d1d65-7d4e-43bd-85b2-2e4ac21c0a52","resolution":{"observed_at":"2026-05-17T01:29:30.210789Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:19:27.255515Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2404.14219"},"observation_digest":"sha256:141901e59edca02a52c15c9ee076016b8827fe34076745a8757e6e79de3b23d2","observation_id":"615da092-a5ce-4f55-a172-38ac1fb26e79","resolution":{"observed_at":"2026-05-11T06:01:54.585341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:17f02a2baec2d356baf405720432fb986cd885ad289a2a8e708598e9ba08f6e5","observation_id":"16ad22ba-2820-4a99-9532-100dd81de35f","resolution":{"observed_at":"2026-05-20T06:20:36.416394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:a0ee6394c83335ee1067dd09244e5e1f93ab5009aff1446d5e1f05ce9d43807f","observation_id":"0a9b0b24-ddd6-4fe9-8a77-b6c2c21a5797","resolution":{"observed_at":"2026-05-14T00:51:48.357499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T21:19:43.882232Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2410.05160"},"observation_digest":"sha256:2deb448ded8965dd1a8561f0d9edfe6d00fa23568d48ef627c3bd95bf1c76a8e","observation_id":"6ce228db-5c85-4358-ac94-68ac0dde6c16","resolution":{"observed_at":"2026-05-17T21:19:43.983968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:ffc7f1b5b579192388e95caf3034d0a2ddf095ed958ef24b9da357c0af04b115","observation_id":"1b9d8dba-f3b9-4110-a689-ec02bb49593f","resolution":{"observed_at":"2026-05-18T14:40:00.141940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:f2053aa3c36d09f16087811719834095ccb4f67ae63df2bdaa9c4acb6004074b","observation_id":"9512c314-7c3b-47c8-b3c5-fdfe3c0b33bc","resolution":{"observed_at":"2026-05-23T17:33:15.639650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:1a34a9a87e009078c3779f0e5b3d65b8bfc8be61e44ce01cca5f6b0f7ebaf8cd","observation_id":"ca3abdb6-e5d6-46ab-98dc-6f98ad8a3a1b","resolution":{"observed_at":"2026-05-11T10:09:23.805919Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T00:47:12.229444Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19326","last_updated":"2025-06-30T13:15:13Z","snapshot_observed_at":"2026-08-11T00:39:56.306346Z","submitted_at":"2024-12-26T18:56:05Z","title":"Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T00:47:12.229444Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.19326"},"observation_digest":"sha256:ddeb2fa76fe8531c3784c061422e11f91403a677ef81e12e6608ccd925198048","observation_id":"e0323e11-6fcc-49e0-be01-07331a41f31d","resolution":{"observed_at":"2026-08-11T00:47:12.229444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-03T02:30:08.318253Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T11:49:14.698249Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.21059"},"observation_digest":"sha256:ea4410b381f7c10ba4761986d9a41ffbcc675c06240e8ef4a1857fef0f3111a8","observation_id":"a208d090-c73e-48b8-82a5-cf931a563881","resolution":{"observed_at":"2026-05-16T11:49:14.727821Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:917f9f97734d3d340e2a194e89b55c233499e5a1d870b4ed023dee2911c8f1f7","observation_id":"82223398-adaf-490f-b246-cc2e9b3989d8","resolution":{"observed_at":"2026-05-18T04:02:43.430481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T21:31:15.965901Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-10T21:24:48.662023Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:15.965901Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:6543d89cc342d3cd5e8088b87fb2ea421608053cb2e31e34c67d98031f329b1b","observation_id":"f7f28594-1b24-47e6-a3d8-0760c86a7a36","resolution":{"observed_at":"2026-08-10T21:31:15.965901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T21:26:00.546599Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04931","last_updated":"2025-06-27T10:07:29Z","snapshot_observed_at":"2026-08-11T00:00:47.311851Z","submitted_at":"2025-01-09T02:47:01Z","title":"Jailbreaking Multimodal Large Language Models via Shuffle Inconsistency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:26:00.546599Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.04931"},"observation_digest":"sha256:6320c965e571782f427a847a24580397afc72b7fcf7a0a58a422e0080a93f402","observation_id":"cef14f9f-c31c-4f57-81e0-bf0972528647","resolution":{"observed_at":"2026-08-10T21:26:00.546599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:e559e0c3bcba8c660dec066051a0fb29e49b252ab909867a57f0e68ff3b45fba","observation_id":"8e5b1fdb-994f-432a-b989-b8dc7c3bf9cc","resolution":{"observed_at":"2026-05-23T06:02:37.355001Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T21:10:40.578987Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05767","last_updated":"2025-02-18T02:40:14Z","snapshot_observed_at":"2026-08-10T21:04:28.854755Z","submitted_at":"2025-01-10T07:56:23Z","title":"Migician: Revealing the Magic of Free-Form Multi-Image Grounding in Multimodal Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:40.578987Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.05767"},"observation_digest":"sha256:fd7b8f4b1a8e1efbc75f06612d7fad0aeefa3229324d5c11909c9f2e2bd79ee1","observation_id":"941e3834-430a-4454-93d8-e918e571fb39","resolution":{"observed_at":"2026-08-10T21:10:40.578987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T21:03:44.464754Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06598","last_updated":"2025-07-02T04:47:37Z","snapshot_observed_at":"2026-08-10T20:54:40.750061Z","submitted_at":"2025-01-11T17:52:22Z","title":"ChartCoder: Advancing Multimodal Large Language Model for Chart-to-Code Generation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T21:03:44.464754Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.06598"},"observation_digest":"sha256:e194d0f8fd96c498ac60c54f1c0b9184fbefb615c48eac6702be55c3b04de74f","observation_id":"2b9fbd42-d719-43f2-948d-1c458390340b","resolution":{"observed_at":"2026-08-10T21:03:44.464754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T20:33:54.031175Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07978","last_updated":"2025-01-14T09:52:56Z","snapshot_observed_at":"2026-08-10T20:27:33.358854Z","submitted_at":"2025-01-14T09:52:56Z","title":"Facial Dynamics in Video: Instruction Tuning for Improved Facial Expression Perception and Contextual Awareness","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:33:54.031175Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.07978"},"observation_digest":"sha256:50a82959850d2908380d0b85ba29e4844ac4e4f1d088523cf3989389327d0767","observation_id":"e26760f4-3fcf-4b4e-ac56-e16b76841d14","resolution":{"observed_at":"2026-08-10T20:33:54.031175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T19:05:52.804312Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.10604","last_updated":"2025-01-17T23:35:34Z","snapshot_observed_at":"2026-08-11T01:13:50.295848Z","submitted_at":"2025-01-17T23:35:34Z","title":"When language and vision meet road safety: leveraging multimodal large language models for video-based traffic accident analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T19:05:52.804312Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.10604"},"observation_digest":"sha256:1ba130db77a7c1525a709f69d248ce2b390630542a3389bf188935a674c91c0f","observation_id":"4652513e-de24-4f2b-9611-4b62980f1b79","resolution":{"observed_at":"2026-08-10T19:05:52.804312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T15:31:35.602049Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13920","last_updated":"2025-01-23T18:58:33Z","snapshot_observed_at":"2026-08-10T18:06:32.233721Z","submitted_at":"2025-01-23T18:58:33Z","title":"IMAGINE-E: Image Generation Intelligence Evaluation of State-of-the-art Text-to-Image Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T15:31:35.602049Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.13920"},"observation_digest":"sha256:a82658dc0770ea785b3daaffb99906a27bfc6da140a94f44a3221b3cb96e2db3","observation_id":"700fca19-cb51-4cbe-809b-15818d86dd94","resolution":{"observed_at":"2026-08-10T15:31:35.602049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-10T14:40:55.236516Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-10T14:34:53.812449Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:40:55.236516Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2501.15111"},"observation_digest":"sha256:a95fcb4794896c0313d589c22d4f2b9ebfadec2dc93b2390602c5d978b74f6fa","observation_id":"fabd24d6-5e9c-487c-ab18-8415e1e5138b","resolution":{"observed_at":"2026-08-10T14:40:55.236516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-08T13:30:12.974013Z","title":"Llava-next-interleave: 9 Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07221","last_updated":"2026-07-01T01:12:22Z","snapshot_observed_at":"2026-08-08T13:23:13.267026Z","submitted_at":"2025-02-11T03:28:55Z","title":"Histopathology Multi-modal Embedding for Pathology Composed Retrieval","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T13:30:12.974013Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2502.07221"},"observation_digest":"sha256:b600fde0948d7819d3db51cd59e5aae0470441d851bc879e2dc2b13802e1a5a9","observation_id":"9388e9f1-7733-45f2-a9a0-4616af00ec98","resolution":{"observed_at":"2026-08-08T13:30:12.974013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-08T12:15:53.477089Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07601","last_updated":"2025-03-17T07:11:04Z","snapshot_observed_at":"2026-08-10T13:07:47.394431Z","submitted_at":"2025-02-11T14:50:43Z","title":"Towards Zero-Shot Anomaly Detection and Reasoning with Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T12:15:53.477089Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2502.07601"},"observation_digest":"sha256:5abb4a3f95fa4a6718262f0d19943ac78cc5f8698c8e282e922479577afde5ac","observation_id":"4d4bd1b1-48f3-42f9-a787-d0fba4c35e45","resolution":{"observed_at":"2026-08-08T12:15:53.477089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T23:21:24.811203Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.811203Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:5a07884eeda00c4b36f685748b8918a8374ac0ce3d3366c64983ec3dba629d20","observation_id":"5eef3c2e-3460-4598-bd12-47a07501e139","resolution":{"observed_at":"2026-08-07T23:21:24.811203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":276,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:2379a407bf7b048055b682ac72e81f0af7a7bd2eb406388c68d67ad7ad0715e8","observation_id":"34c000dd-59bc-471b-992b-76d91a23abb6","resolution":{"observed_at":"2026-05-15T17:18:53.614766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2503.16549","last_updated":"2026-04-18T11:44:37Z","snapshot_observed_at":"2026-08-08T08:24:44.422314Z","submitted_at":"2025-03-19T11:46:19Z","title":"MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T22:55:34.238427Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2503.16549"},"observation_digest":"sha256:dd0b43825ea04cf11ff08ae290035444efc4bbaf5d91ea6883440be17bf53578","observation_id":"00cbfc93-433b-4d54-8a6d-d9dc03f3d662","resolution":{"observed_at":"2026-05-22T22:57:13.351076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:d4e10a43e0eb157704f474910f4b77d4675fe53f8cf2fb234dc0c83be6189ff4","observation_id":"e66a46c0-3c91-4517-ac37-8e63025eff47","resolution":{"observed_at":"2026-05-11T06:01:54.585341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:42:24.855615Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14131","last_updated":"2025-05-20T09:36:17Z","snapshot_observed_at":"2026-08-10T01:15:54.460027Z","submitted_at":"2025-05-20T09:36:17Z","title":"Texts or Images? A Fine-grained Analysis on the Effectiveness of Input Representations and Models for Table Question Answering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.855615Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.14131"},"observation_digest":"sha256:be1c8d21fa3ca926462e5829d625820eb14dcd213567f2564f3e59d134b3ef4a","observation_id":"3341a722-d566-4051-a973-097073331774","resolution":{"observed_at":"2026-08-07T15:42:24.855615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:42:27.491865Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-07T17:35:55.668492Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.491865Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:67366e9fc49f91e8b1979f742c74494fa61eb4418d3f3f26f8e058a97e3e4bcb","observation_id":"12cec2a7-abdf-4484-a537-a7d49576ec7a","resolution":{"observed_at":"2026-08-07T15:42:27.491865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:41:04.786215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14405","last_updated":"2025-05-20T14:18:56Z","snapshot_observed_at":"2026-08-09T12:52:19.354205Z","submitted_at":"2025-05-20T14:18:56Z","title":"Investigating and Enhancing the Robustness of Large Multimodal Models Against Temporal Inconsistency","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:41:04.786215Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.14405"},"observation_digest":"sha256:525994758691385826c6e0ffdef3306f2cf8179480f18d985d2b8edbb766cd6a","observation_id":"cf32c404-8e32-4da5-8a41-e18106c4adc5","resolution":{"observed_at":"2026-08-07T15:41:04.786215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:20:57.242364Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-09T00:23:31.907645Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:57.242364Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:5f390dadfad2f06a3f47466be901f6771d46d7b2a15675cca3388b3dd85b5060","observation_id":"113e3bc5-eadf-4c37-92bb-29c545e23c57","resolution":{"observed_at":"2026-08-07T15:20:57.242364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T15:15:42.075306Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.075306Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:70638ce07141d4678e22145ecbe9faec34688a949ee1d7c9a290fe64978974f4","observation_id":"5e666ddb-be36-425a-86fd-cf359b6216de","resolution":{"observed_at":"2026-08-07T15:15:42.075306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:52:06.857116Z","title":"Llava-next-interleave: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-10T12:17:50.718470Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.857116Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:f74378b19781fa7f5a89fdf33703b520864f75f6f9d61fde7c0c3adf132d1f91","observation_id":"f5cf6810-da43-4cd8-81d0-acd914e552a2","resolution":{"observed_at":"2026-08-07T14:52:06.857116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:25:55.063902Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19076","last_updated":"2025-05-25T10:21:29Z","snapshot_observed_at":"2026-08-10T12:01:16.122432Z","submitted_at":"2025-05-25T10:21:29Z","title":"ChartSketcher: Reasoning with Multimodal Feedback and Reflection for Chart Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.063902Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.19076"},"observation_digest":"sha256:e063a66eb0ef6c5d1c8d3f06b5e62b98f85dc6ddb699d908a5c559544937bd22","observation_id":"d07eb18d-c68a-4dc3-984f-9d24bbbf74c5","resolution":{"observed_at":"2026-08-07T14:25:55.063902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:17:12.320067Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19529","last_updated":"2025-05-29T16:57:36Z","snapshot_observed_at":"2026-08-10T01:35:01.414848Z","submitted_at":"2025-05-26T05:29:47Z","title":"Small Language Models: Architectures, Techniques, Evaluation, Problems and Future Adaptation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:12.320067Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.19529"},"observation_digest":"sha256:5c1083b39c8d44e8482753cfd4ab9fa752f3be18175e5705812fd2841580a647","observation_id":"981ae193-7e67-442a-9c3b-1bf192d17e9e","resolution":{"observed_at":"2026-08-07T14:17:12.320067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:15:48.190049Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19535","last_updated":"2025-05-26T05:47:09Z","snapshot_observed_at":"2026-08-08T09:36:17.755126Z","submitted_at":"2025-05-26T05:47:09Z","title":"TDVE-Assessor: Benchmarking and Evaluating the Quality of Text-Driven Video Editing with LMMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:48.190049Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.19535"},"observation_digest":"sha256:a7499575a7e11a26a1a0ce1e6e613321bb9535c6ceae1707576f88d01ab7806e","observation_id":"1f8005a3-abc0-497d-a663-8d9b958afd0b","resolution":{"observed_at":"2026-08-07T14:15:48.190049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:11:59.735118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-08T09:25:43.689145Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:59.735118Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.19683"},"observation_digest":"sha256:3892ea18361186c605d89b3adbf5d471598cc0c5c5f5a73ff7e0895b68b2e34b","observation_id":"f855ee83-aae6-49e2-8691-74e7a8b72270","resolution":{"observed_at":"2026-08-07T14:11:59.735118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:03:00.801599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.801599Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:4970e80cd48a419925e6146770c262f3d141ca43cfcfac9f910deeb062bbbd13","observation_id":"2c500152-2066-4fa1-bda7-fbb376034dcc","resolution":{"observed_at":"2026-08-07T14:03:00.801599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:25:17.473519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21926","last_updated":"2025-05-28T03:21:28Z","snapshot_observed_at":"2026-08-10T10:53:00.105328Z","submitted_at":"2025-05-28T03:21:28Z","title":"Beyond Completion: A Foundation Model for General Knowledge Graph Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:25:17.473519Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.21926"},"observation_digest":"sha256:dcba6835b225c8efcbd3345e0291e820397a046d34ca346316e3a010a6c9dd86","observation_id":"8485d23b-57a7-4c04-a5a4-44bfb5ed4672","resolution":{"observed_at":"2026-08-07T13:25:17.473519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:14:10.915411Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.915411Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3bbd63d2f6c1cf6fb623f507f8bdb510374cd7e3b4deb74084bcafbb80a721b3","observation_id":"7661d267-206a-4624-a7d2-ad635d018b9d","resolution":{"observed_at":"2026-08-07T13:14:10.915411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:10:42.429393Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-09T21:52:56.063992Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:42.429393Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:a883b5cabcda42454faa3ec2b99671b0b74b4c6598bc0326aeb70039c0825774","observation_id":"481d3352-d8e1-4c05-97e5-2b773533b625","resolution":{"observed_at":"2026-08-07T13:10:42.429393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T12:00:48.885841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00805","last_updated":"2025-06-01T03:11:00Z","snapshot_observed_at":"2026-08-10T21:22:01.293448Z","submitted_at":"2025-06-01T03:11:00Z","title":"HSCR: Hierarchical Self-Contrastive Rewarding for Aligning Medical Vision Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:00:48.885841Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.00805"},"observation_digest":"sha256:55e0088c868273731994103bb5f808c5d4507e1c21db30871b41f1d02feadc12","observation_id":"9a96e7a8-45c8-4de3-8a5a-1a800d78b3af","resolution":{"observed_at":"2026-08-07T12:00:48.885841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T11:51:27.183905Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:27.183905Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:1eb04e564280bf729a8302cf4190de9fb5020ec1bb55ec1693e2abc6656dc127","observation_id":"a58b2d41-789f-4fd5-b5c6-b70b91274d4e","resolution":{"observed_at":"2026-08-07T11:51:27.183905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T11:16:45.182318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03007","last_updated":"2025-06-03T15:45:41Z","snapshot_observed_at":"2026-08-10T00:48:35.502586Z","submitted_at":"2025-06-03T15:45:41Z","title":"DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:45.182318Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.03007"},"observation_digest":"sha256:079b232672c510e7353801362e162d8515f18b86b3d5869d06441471d9cd1b0f","observation_id":"71ddb09f-9ca1-4b1d-aa5a-6e3e07673ac3","resolution":{"observed_at":"2026-08-07T11:16:45.182318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T10:55:14.706996Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.706996Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:5291b45a1e1a021ab5a38eac2ca1ae7cee683e58861502fcfd9aa5af4fc3071b","observation_id":"344aad25-01f9-4cb8-9749-f1ef562dcc3f","resolution":{"observed_at":"2026-08-07T10:55:14.706996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T10:27:08.522356Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-07T10:18:54.361523Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.522356Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:a8dc572dec895e33ad9e1dd83de6e753b59c24ccb5ff98d40f6db8535f544a04","observation_id":"396755af-003a-4a95-979d-1e876c601d0a","resolution":{"observed_at":"2026-08-07T10:27:08.522356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T10:50:52.638441Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-09T06:09:58.091457Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:52.638441Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:0666955fc756d7f86e4ce383fd0eda43bde89ae65a4948fc4b3404371cbf2a80","observation_id":"1b379fc0-4ef3-45e3-93b6-51201ac64726","resolution":{"observed_at":"2026-08-07T10:50:52.638441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T05:43:32.559182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.559182Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:4d09f07d5bb37c51155833bbf413e5773d559dfabe4efa189fb18c09df188344","observation_id":"ba1f3937-444b-4ad9-b686-4a5cf4401404","resolution":{"observed_at":"2026-08-07T05:43:32.559182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T04:49:27.831298Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09557","last_updated":"2025-06-11T09:41:46Z","snapshot_observed_at":"2026-08-09T00:11:49.117375Z","submitted_at":"2025-06-11T09:41:46Z","title":"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:27.831298Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.09557"},"observation_digest":"sha256:a6a57a1013cb2fb4b0e94908dbb54836337e37dedd29bb93094e237b27cf5294","observation_id":"045796f1-b877-4933-81e6-b55437019dbc","resolution":{"observed_at":"2026-08-07T04:49:27.831298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T04:34:03.206849Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:03.206849Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:bfeba705edc916cf25247c7dae75237118691cbf9b004873c7a5af1d043f10dc","observation_id":"12899f82-3563-44a6-9a78-941a20b1afd3","resolution":{"observed_at":"2026-08-07T04:34:03.206849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T04:36:56.903250Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10415","last_updated":"2025-06-12T07:12:31Z","snapshot_observed_at":"2026-08-10T07:42:00.940330Z","submitted_at":"2025-06-12T07:12:31Z","title":"Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:36:56.903250Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.10415"},"observation_digest":"sha256:88e35c0565f9998ba172d01ea066e8e87d39716c1221bd2d948ca251478d8d0b","observation_id":"aec1934d-55f9-4823-b709-84fa00b75b98","resolution":{"observed_at":"2026-08-07T04:36:56.903250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T00:13:34.729605Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14907","last_updated":"2025-06-17T18:25:56Z","snapshot_observed_at":"2026-08-08T10:07:53.261909Z","submitted_at":"2025-06-17T18:25:56Z","title":"PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:34.729605Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.14907"},"observation_digest":"sha256:0cd30a6bad2b65101e8c502cb68646f46cb57b159577e8815d2f1d72d1ea7733","observation_id":"aa1eb206-ca7b-4363-b8fd-77b9c0e6ef69","resolution":{"observed_at":"2026-08-07T00:13:34.729605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T23:56:38.092536Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15645","last_updated":"2025-06-18T17:14:07Z","snapshot_observed_at":"2026-08-07T21:48:56.620256Z","submitted_at":"2025-06-18T17:14:07Z","title":"Demystifying the Visual Quality Paradox in Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:56:38.092536Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.15645"},"observation_digest":"sha256:4564393a774cad0a968bdb0434678943c7e7a613daa21cc260c26d28a615840d","observation_id":"a9cd6f8d-803e-4d7d-9736-8787ab4efb4a","resolution":{"observed_at":"2026-08-06T23:56:38.092536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T23:42:42.178165Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16679","last_updated":"2025-06-20T01:52:17Z","snapshot_observed_at":"2026-08-06T23:35:41.514817Z","submitted_at":"2025-06-20T01:52:17Z","title":"How to Train your Text-to-Image Model: Evaluating Design Choices for Synthetic Training Captions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:42.178165Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.16679"},"observation_digest":"sha256:1f5bb29c39231db78aa04c73fade11a28ac8f642d17a36718873ed0ff9d28957","observation_id":"da717749-599d-4916-9ecb-f93dbace5d54","resolution":{"observed_at":"2026-08-06T23:42:42.178165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T22:52:11.715965Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20420","last_updated":"2025-06-25T13:35:25Z","snapshot_observed_at":"2026-08-09T02:45:04.702614Z","submitted_at":"2025-06-25T13:35:25Z","title":"Semantic Caching for Improving Web Affordability","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:52:11.715965Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.20420"},"observation_digest":"sha256:6d1be79c38f95da28baaa679522387fa7acd19fc97b8f9ade568feb164bfb520","observation_id":"a3c7d626-021b-4630-ba82-b41255c2a330","resolution":{"observed_at":"2026-08-06T22:52:11.715965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T22:37:36.453279Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:36.453279Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:addd2a9c10754e704e8fa878a5ac83b522b2eb0905f9f014d3549a60ba114c94","observation_id":"0304ec94-346f-42ef-92bb-ffa955e7c5e6","resolution":{"observed_at":"2026-08-06T22:37:36.453279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T22:24:27.690418Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21862","last_updated":"2025-06-27T02:29:58Z","snapshot_observed_at":"2026-08-09T10:29:21.701927Z","submitted_at":"2025-06-27T02:29:58Z","title":"LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:24:27.690418Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.21862"},"observation_digest":"sha256:93b2a79c95c54c341958efa184658fea0a977cb2445baf2f436ff182c9adaed2","observation_id":"81c4469d-25a7-4db2-ac88-4ab13f38b3a3","resolution":{"observed_at":"2026-08-06T22:24:27.690418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T22:10:20.772845Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-09T16:37:51.559760Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:20.772845Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:29b419647212bb23e5eec5743db974142224979dbd86e8b23b098e8d78c76129","observation_id":"491e6990-29ec-4934-a82d-bdedd27f0979","resolution":{"observed_at":"2026-08-06T22:10:20.772845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T21:25:04.533347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00263","last_updated":"2026-06-30T03:32:49Z","snapshot_observed_at":"2026-08-06T21:18:02.122188Z","submitted_at":"2025-06-30T21:11:35Z","title":"Room Scene Discovery and Grouping in Unstructured Vacation Rental Image Collections","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:04.533347Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.00263"},"observation_digest":"sha256:bd96aa0898bc569d5cdff4651207839566cb05a599efebccefcb26b847100ca7","observation_id":"004e1b95-1576-4438-bb11-86d5d535fae5","resolution":{"observed_at":"2026-08-06T21:25:04.533347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-08-08T09:01:59.914584Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:027805de6bb9ee012e193184b705e2cb2086e2ea278466c74daa41802053a79b","observation_id":"3b25b168-8e05-4ae4-9e0d-dca0b148fd84","resolution":{"observed_at":"2026-05-19T06:52:07.952982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T20:45:07.955283Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:07.955283Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:bc400656417caa230f9ba3bde7b3e0906b6c602c66a0c5d79828af15f0e924f3","observation_id":"e21e9a31-6b36-4a6f-90ac-6cc483401ae9","resolution":{"observed_at":"2026-08-06T20:45:07.955283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T21:06:26.659753Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02001","last_updated":"2025-07-01T18:39:26Z","snapshot_observed_at":"2026-08-09T02:09:40.214145Z","submitted_at":"2025-07-01T18:39:26Z","title":"Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:06:26.659753Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.02001"},"observation_digest":"sha256:aeedbec09259f236fd8535cef616bce872c24e567fb8a33e7081c3bca55e7539","observation_id":"a86a8290-85a0-4b46-9027-cb17eeb6047d","resolution":{"observed_at":"2026-08-06T21:06:26.659753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T20:38:29.433115Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-10T06:47:29.520867Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.433115Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:df9e4a32414400eb2fcf543b0167da2f31428d60ddd7e05bc25f401e5a5f8b51","observation_id":"34958276-5601-46d2-a9fe-fc054773bdba","resolution":{"observed_at":"2026-08-06T20:38:29.433115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T21:19:36.992645Z","title":"arXiv preprint arXiv:2407.07895 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02984","last_updated":"2025-07-28T05:53:50Z","snapshot_observed_at":"2026-08-07T08:32:24.456726Z","submitted_at":"2025-07-01T08:24:51Z","title":"From Answers to Rationales: Self-Aligning Multimodal Reasoning with Answer-Oriented Chain-of-Thought","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:36.992645Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.02984"},"observation_digest":"sha256:8d9f9e2a4c6be3456349b96b334f7d59e7a8ba4fed3710e7b87cbb1c1aa498fd","observation_id":"8ad19dd6-f942-4ace-90d9-dab0c91f6bc5","resolution":{"observed_at":"2026-08-06T21:19:36.992645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T19:59:56.791343Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-10T11:09:11.797041Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.791343Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:b655b1d637de62a050d21b3a501210335b4a88f972313eb65d7a205c9c92feb9","observation_id":"f989038e-d8a4-4f79-a1a3-12bf90ba02b3","resolution":{"observed_at":"2026-08-06T19:59:56.791343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T19:10:00.229869Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07135","last_updated":"2025-07-08T23:02:10Z","snapshot_observed_at":"2026-08-10T01:34:44.777886Z","submitted_at":"2025-07-08T23:02:10Z","title":"FACap: A Large-scale Fashion Dataset for Fine-grained Composed Image Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:00.229869Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.07135"},"observation_digest":"sha256:87cdd42f4630e0948f71ca56135b2652dc6e49b1da60dfbbcc27fd37cc3dcc9e","observation_id":"66ff6505-3b8c-489a-93fc-f5953c148163","resolution":{"observed_at":"2026-08-06T19:10:00.229869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T18:21:46.949417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08496","last_updated":"2025-07-11T11:18:49Z","snapshot_observed_at":"2026-08-10T09:36:01.094283Z","submitted_at":"2025-07-11T11:18:49Z","title":"LLaPa: A Vision-Language Model Framework for Counterfactual-Aware Procedural Planning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:46.949417Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.08496"},"observation_digest":"sha256:79655b7872fdabbe5c3212c241691661ef14a2b70cf5e193fd513de76d091eb7","observation_id":"4538fcbd-2ec2-4ba8-94e9-b6a0e76935b6","resolution":{"observed_at":"2026-08-06T18:21:46.949417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T18:24:51.915011Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08513","last_updated":"2025-07-23T22:34:55Z","snapshot_observed_at":"2026-08-09T16:59:07.724320Z","submitted_at":"2025-07-11T12:00:10Z","title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:24:51.915011Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.08513"},"observation_digest":"sha256:c00248dea8cc7cf3280e7ef539aeea1e4cb80d25857b9e1418cc244d302f9ec2","observation_id":"b730cbda-5bef-43f6-8798-4771a4d6016f","resolution":{"observed_at":"2026-08-06T18:24:51.915011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T17:55:45.322384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09693","last_updated":"2025-07-13T16:09:58Z","snapshot_observed_at":"2026-08-10T16:27:53.336213Z","submitted_at":"2025-07-13T16:09:58Z","title":"ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:55:45.322384Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.09693"},"observation_digest":"sha256:67a53c4d341ae236cb909f6994de8ca375cd63ac0a0f6f2f1a38713cc828ab90","observation_id":"41f92863-7248-4f98-84ce-187f0a7959ac","resolution":{"observed_at":"2026-08-06T17:55:45.322384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T17:39:41.509601Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10300","last_updated":"2025-07-14T14:04:14Z","snapshot_observed_at":"2026-08-08T22:29:22.885986Z","submitted_at":"2025-07-14T14:04:14Z","title":"FaceLLM: A Multimodal Large Language Model for Face Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:41.509601Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.10300"},"observation_digest":"sha256:7df2c0f8334a1991bcec44a5b8f5b53df1c54a7a35c02aa762f4069c19c1b049","observation_id":"025ca9d1-b964-4484-94ed-e1e54b55c98b","resolution":{"observed_at":"2026-08-06T17:39:41.509601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T16:51:23.854998Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12441","last_updated":"2025-08-02T17:35:59Z","snapshot_observed_at":"2026-08-08T01:34:56.747369Z","submitted_at":"2025-07-16T17:28:19Z","title":"Describe Anything Model for Visual Question Answering on Text-rich Images","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:51:23.854998Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.12441"},"observation_digest":"sha256:b6573e82e6f3843943af04c7f0f4a2816510a3e0d9db4658c5c3982d51a5b865","observation_id":"5ba75bd4-02e0-44dc-8bcf-3d33d8a96cdd","resolution":{"observed_at":"2026-08-06T16:51:23.854998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T15:53:50.665017Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14743","last_updated":"2025-08-28T16:45:48Z","snapshot_observed_at":"2026-08-10T13:02:17.043066Z","submitted_at":"2025-07-19T20:30:43Z","title":"InterAct-Video: Reasoning-Rich Video QA for Urban Traffic","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:53:50.665017Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.14743"},"observation_digest":"sha256:d4d425424e7ffbad9e21bc97737f6485ee35276f7d7f5d503c817bfba07c9674","observation_id":"0188582b-0aa0-412d-bdb3-cdcba7394859","resolution":{"observed_at":"2026-08-06T15:53:50.665017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:a4311ac7811f10fac8a6591f64d41da572a45494f7b7ede6db10e63506e7d10d","observation_id":"3c20f704-e223-4e5b-a652-0cc82321eb7e","resolution":{"observed_at":"2026-05-17T08:04:12.673817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T15:19:57.692643Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16193","last_updated":"2025-09-07T09:10:06Z","snapshot_observed_at":"2026-08-07T01:00:51.428857Z","submitted_at":"2025-07-22T03:11:07Z","title":"LMM4Edit: Benchmarking and Evaluating Multimodal Image Editing with LMMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:19:57.692643Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.16193"},"observation_digest":"sha256:a7cfca452e00c79ec66fc390ccdb9950fc055c0a56097a7e16b591f2c736e3f6","observation_id":"50dfb0b0-7468-4715-a1fe-c5ddce93e998","resolution":{"observed_at":"2026-08-06T15:19:57.692643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T14:19:34.124422Z","title":"Llava- next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:34.124422Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1b690aa675409f5995713ab0ee5d30a8ccb7aef3e6390a6bd42469e2e9f0b5e3","observation_id":"f7cad20f-21af-4df1-92e8-4210147ffecf","resolution":{"observed_at":"2026-08-06T14:19:34.124422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:40:09.004173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21619","last_updated":"2025-07-29T09:18:22Z","snapshot_observed_at":"2026-08-07T23:36:20.034251Z","submitted_at":"2025-07-29T09:18:22Z","title":"EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T12:40:09.004173Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.21619"},"observation_digest":"sha256:9cd7fb4ae10989538e6251cf1f840d50ffeb8267ea0bb2157834e6f0a1e43061","observation_id":"c5af75d5-94d6-40be-ab56-232a5a907760","resolution":{"observed_at":"2026-08-06T12:40:09.004173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:31:26.071331Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-10T11:41:02.600708Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.071331Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:2caa3b50f7ca10617ee4afd0099aa283474d9d3bd50f9dd0dc0b2f258f75944e","observation_id":"ede1ea7f-a126-498b-8996-33326c899b63","resolution":{"observed_at":"2026-08-06T12:31:26.071331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T04:36:32.561417Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03263","last_updated":"2026-06-28T12:48:23Z","snapshot_observed_at":"2026-08-09T16:50:34.210282Z","submitted_at":"2025-08-05T09:39:25Z","title":"Volume-Distance-Ratio Asymptote and Spacetime Inextendibility for FLRW Spacetimes","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T04:36:32.561417Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.03263"},"observation_digest":"sha256:b3a55dd50b8c6c4d95db592d198483144cb26962a5c1a4b7e776387c824ab4a2","observation_id":"e6a316b7-1e19-4fc6-89ca-7f405d5bf9e2","resolution":{"observed_at":"2026-08-06T04:36:32.561417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2508.03583","last_updated":"2026-04-29T17:02:32Z","snapshot_observed_at":"2026-08-03T02:20:02.485667Z","submitted_at":"2025-08-05T15:50:16Z","title":"OpenLifelogQA: An Open-Ended Multi-Modal Lifelog Question-Answering Dataset","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T01:24:15.717972Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.03583"},"observation_digest":"sha256:1d4d0aa21448b93b09605844d770db792825419f4a2be99c041646facda735b0","observation_id":"910ab3a5-948e-4b7d-bcc9-3162ce11c2af","resolution":{"observed_at":"2026-05-19T01:26:57.847097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T12:18:32.553102Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03722","last_updated":"2025-07-29T15:55:23Z","snapshot_observed_at":"2026-08-06T12:18:29.057313Z","submitted_at":"2025-07-29T15:55:23Z","title":"Multimodal Video Emotion Recognition with Reliable Reasoning Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:18:32.553102Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.03722"},"observation_digest":"sha256:fffb7c3a2dcde70a494e4ebb491975e84092ee30fb1f51f82110914bba1e72d6","observation_id":"7ef91280-3fa7-4007-aa6a-39f50dfe993e","resolution":{"observed_at":"2026-08-06T12:18:32.553102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T23:43:08.269070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05016","last_updated":"2025-08-11T06:08:57Z","snapshot_observed_at":"2026-08-08T17:15:35.883421Z","submitted_at":"2025-08-07T03:55:11Z","title":"AU-IQA: A Benchmark Dataset for Perceptual Quality Assessment of AI-Enhanced User-Generated Content","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:43:08.269070Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.05016"},"observation_digest":"sha256:03bdda321c3d87bac8942f68ef5b6797bd6849b43285a107ae2734d1dfa9e83a","observation_id":"92fe071e-0cef-4f1d-a299-84da41f4e7b0","resolution":{"observed_at":"2026-08-05T23:43:08.269070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T21:53:40.542525Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07759","last_updated":"2025-08-11T08:42:49Z","snapshot_observed_at":"2026-08-09T15:03:58.455667Z","submitted_at":"2025-08-11T08:42:49Z","title":"Correspondence as Video: Test-Time Adaption on SAM2 for Reference Segmentation in the Wild","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:53:40.542525Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.07759"},"observation_digest":"sha256:ede49ff2ff00417e36bba54a820c1f7225c60c5b8715be7d2aaeb77b92a24618","observation_id":"177dc122-8273-4c03-870e-e8cf638b2e03","resolution":{"observed_at":"2026-08-05T21:53:40.542525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T20:20:12.525660Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10681","last_updated":"2025-08-14T14:24:47Z","snapshot_observed_at":"2026-08-06T15:57:51.802224Z","submitted_at":"2025-08-14T14:24:47Z","title":"IADGPT: Unified LVLM for Few-Shot Industrial Anomaly Detection, Localization, and Reasoning via In-Context Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:12.525660Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.10681"},"observation_digest":"sha256:fe9dab98df6f239f2a51e41c7d6f8ca0b47ac270d26ea1562956866a382170ad","observation_id":"e3899d92-19a9-4b3f-b1c8-8bab760c7cf2","resolution":{"observed_at":"2026-08-05T20:20:12.525660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T23:32:17.799225Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.799225Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:3d5a00d0e1990b523a69469467f935b17cd279a24b11beca90172c87a6e358ad","observation_id":"8d9f69a4-1136-4732-8936-b794417cb6bd","resolution":{"observed_at":"2026-08-05T23:32:17.799225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T19:39:48.167701Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.167701Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:97ed67689acb1ae62a22c53b4bc9a22c2c5cf14e75badf9e937becb0347b85dd","observation_id":"ec322ad7-3d90-4a70-ac13-c2e78f070e97","resolution":{"observed_at":"2026-08-05T19:39:48.167701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T19:02:49.929085Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13606","last_updated":"2025-08-19T08:12:45Z","snapshot_observed_at":"2026-08-05T19:02:49.194056Z","submitted_at":"2025-08-19T08:12:45Z","title":"AdaDocVQA: Adaptive Framework for Long Document Visual Question Answering in Low-Resource Settings","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:02:49.929085Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.13606"},"observation_digest":"sha256:6c6980cd966467f527ca56613ac6b2de5680eea2f7704f082b758194d6ffd2a8","observation_id":"5eaaec05-f53b-43aa-9ac0-424881140064","resolution":{"observed_at":"2026-08-05T19:02:49.929085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T17:13:07.599560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.599560Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:3166647460e71f94e2bbe762a42f7a87fa458c1195ec8e3f638ebb5143d13404","observation_id":"15ecf628-7c09-4a99-a955-bc2e90e71ac8","resolution":{"observed_at":"2026-08-05T17:13:07.599560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T16:32:43.040398Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-09T12:43:01.932559Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.040398Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:cc0b14ab764cbf7f7e059639a1ede4d4b4f08697f3cdfd2db5422e7bbbb426a2","observation_id":"c8c289cd-b6e4-4188-bf6e-c8e9db1b9195","resolution":{"observed_at":"2026-08-05T16:32:43.040398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T15:29:25.465694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19852","last_updated":"2025-08-28T07:08:03Z","snapshot_observed_at":"2026-08-10T05:35:40.855292Z","submitted_at":"2025-08-27T13:09:55Z","title":"Ego-centric Predictive Model Conditioned on Hand Trajectories","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T15:29:25.465694Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.19852"},"observation_digest":"sha256:68542496137990533370f9b104dbe1abd611d6c6844a53b147eae6fc086300f8","observation_id":"7f42c18c-c8e8-4144-8a66-04453bac6a48","resolution":{"observed_at":"2026-08-05T15:29:25.465694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2509.00789","last_updated":"2026-04-19T12:44:09Z","snapshot_observed_at":"2026-08-07T16:49:08.273704Z","submitted_at":"2025-08-31T10:34:44Z","title":"CogDriver: Integrating Cognitive Inertia for Temporally Coherent Planning in Autonomous Driving","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-18T20:10:43.416488Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2509.00789"},"observation_digest":"sha256:17fe4d03c725c2bf0ffb940fea1dc80b0b10d4a9762254225dc0a08733afb280","observation_id":"4097d819-b341-41b9-892a-7aae4935978f","resolution":{"observed_at":"2026-05-18T20:11:50.824721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T05:12:44.181052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05714","last_updated":"2025-09-06T13:26:04Z","snapshot_observed_at":"2026-08-06T23:54:59.571872Z","submitted_at":"2025-09-06T13:26:04Z","title":"Towards Meta-Cognitive Knowledge Editing for Multimodal LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T05:12:44.181052Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2509.05714"},"observation_digest":"sha256:d664029f99e979098f195eceb70fd1fd5cf9f600e3d9948d3d602df8bfa903cb","observation_id":"b4468c9a-0187-4eb9-abe4-590c55e5e6a5","resolution":{"observed_at":"2026-08-05T05:12:44.181052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2509.07966","last_updated":"2026-04-21T15:48:38Z","snapshot_observed_at":"2026-07-06T22:27:15.482704Z","submitted_at":"2025-09-09T17:52:26Z","title":"Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-18T17:37:31.837022Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2509.07966"},"observation_digest":"sha256:a36504d62c2c682fe169806afa5265eb2208998b1df5cabf4e0c9a6717583e24","observation_id":"7ab5c75e-59a5-4bb6-8b05-4d7047b3d975","resolution":{"observed_at":"2026-05-18T17:42:47.591189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-04T17:46:56.239297Z","title":"LLaV A-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.12263","last_updated":"2026-05-31T19:40:08Z","snapshot_observed_at":"2026-08-08T05:36:41.231494Z","submitted_at":"2025-09-12T20:07:12Z","title":"InPhyRe Discovers: Large Multimodal Models Struggle in Inductive Physical Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:46:56.239297Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2509.12263"},"observation_digest":"sha256:946a87dd4587f7be67f669daaa8d953cb5a170db754d37c61d7ea4851ab35313","observation_id":"6e57d26b-0ecc-47ba-9c55-5ba61a521cf0","resolution":{"observed_at":"2026-08-04T17:46:56.239297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2509.18095","last_updated":"2026-04-06T19:57:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:59:42Z","title":"MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T14:09:22.942238Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2509.18095"},"observation_digest":"sha256:fae6bd90ac48590a9122491f667fa4ab9368f8fe18e2c0a34ddc56defa1f9f26","observation_id":"7a8ae2c0-cb60-44fb-9469-3644af3ce3ea","resolution":{"observed_at":"2026-05-18T14:11:27.506328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-04T13:22:33.874949Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:33.874949Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:60cf8e0d9b0c7411eba897ede23c8a2d612777fc0209f3fd7b80e9914b6a2a78","observation_id":"a56dd022-f6b6-4b89-b253-71bc8c61c996","resolution":{"observed_at":"2026-08-04T13:22:33.874949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-04T09:54:44.073688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.12953","last_updated":"2026-08-03T22:42:44Z","snapshot_observed_at":"2026-08-07T23:09:08.076264Z","submitted_at":"2025-10-14T19:57:03Z","title":"Epistemic-aware Vision-Language Foundation Model for Fetal Ultrasound Interpretation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:54:44.073688Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2510.12953"},"observation_digest":"sha256:9bdb6aad08a21ed5466ec5e76e11259a5184b3d6b70667a866d0f2c2c0bd05f1","observation_id":"107633b8-832d-4086-b8c4-cb1733ce28b7","resolution":{"observed_at":"2026-08-04T09:54:44.073688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-03T22:05:16.428946Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.428946Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:aeeac1fd33876b1fac8b691f488fb51a2e4d1a392b6054e1c4d5fe9384373114","observation_id":"b54e816c-2572-4492-be4c-60f68ca312e9","resolution":{"observed_at":"2026-08-03T22:05:16.428946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2511.18740","last_updated":"2026-04-07T02:21:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T04:10:46Z","title":"Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T06:16:53.140133Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2511.18740"},"observation_digest":"sha256:70e1bd00055b9accb4ecf5fd91cce6ad602cb001dcdc598db31e15c965695715","observation_id":"a20b2645-8f0e-420d-8237-4c5bf9beeb28","resolution":{"observed_at":"2026-05-17T06:19:09.881697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-03T18:15:05.459491Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.06276","last_updated":"2026-07-28T07:07:11Z","snapshot_observed_at":"2026-08-10T17:38:35.603291Z","submitted_at":"2025-12-06T03:59:21Z","title":"RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:15:05.459491Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2512.06276"},"observation_digest":"sha256:f5dd9c2558446cce9aae363033729a31bc6c280206d0b929217560617d4ee196","observation_id":"b3603a2e-65cf-45c4-8f50-e6e53fa82e62","resolution":{"observed_at":"2026-08-03T18:15:05.459491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2512.06673","last_updated":"2026-05-09T07:46:05Z","snapshot_observed_at":"2026-07-06T22:37:59.340166Z","submitted_at":"2025-12-07T06:11:15Z","title":"Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T00:54:53.789523Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2512.06673"},"observation_digest":"sha256:fe75739bb96aef177c2f6a0116a91df380c98409bc56e3d82e202f579168c2e9","observation_id":"3c75648d-0ef4-49e2-b309-a9a3f18588ce","resolution":{"observed_at":"2026-05-17T00:58:46.618430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2512.15977","last_updated":"2026-05-11T17:29:44Z","snapshot_observed_at":"2026-07-06T22:39:23.633419Z","submitted_at":"2025-12-17T21:22:44Z","title":"Are vision-language models ready to zero-shot replace supervised classification models in agriculture?","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-16T21:15:20.717705Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2512.15977"},"observation_digest":"sha256:123fd92632dc1a736e93b4e9787b2eb22b6e2b8794ba93cc124bb6ea20f2e992","observation_id":"c46fbf43-cad5-4e06-b956-1bd23df14fe7","resolution":{"observed_at":"2026-05-16T21:18:32.238282Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2407.07895/citation-record","integrity":"/paper/2407.07895/integrity","json":"/paper/2407.07895/citation-record.json","paper":"/paper/2407.07895"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"3ca5d98b-a694-4b63-929d-dda0b3910472","year":2022},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:1769144c7d0451b6bc235fe085fe4a8567bd29d50a40790e0f785e0e89856348","observation_id":"c1a6b6b4-7f24-47ae-86c6-5852cf912c73","resolution":{"observed_at":"2026-05-11T06:01:54.250547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:9a4b28aa04df0ece41a5d9a13bc5a58e43119ee2bd539a1415e08bc23e11af54","observation_id":"b3738015-9edb-4629-99e0-db936c2425cd","resolution":{"observed_at":"2026-05-14T01:52:01.553388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"b3165c0d-7468-4c48-bdc7-3d9e3495b360","year":2022},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:dcb51fa0c9becee65484a54a02063951d645230f0f4be0587de4eed772a58a57","observation_id":"d201b793-59e1-42dc-ab82-3e001f933993","resolution":{"observed_at":"2026-05-11T06:01:54.111010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:d0f0105e53e40e2715c85b6ebad5185dabfd3e64b2820d9e11a93e22e12e73d5","observation_id":"b68a006c-9eb8-4538-948d-4afe93788c11","resolution":{"observed_at":"2026-05-11T06:01:54.066484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:5318de6ed14a675cda5ec4b1a63643c9975a2b68a0db3b40b4c165939a9d32d9","observation_id":"af82c23b-930a-4fa9-91e7-f1d67e9fa388","resolution":{"observed_at":"2026-05-11T06:01:53.811519Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual question answering on image sets","venue":null,"work_id":"e888d089-1241-4d53-9086-c5340ce91488","year":2020},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:c9d04957df79c1ba59951e8c9b70534963f85fc9029945717aacee7783acd622","observation_id":"61e5f039-a994-4097-8823-244f763dfadd","resolution":{"observed_at":"2026-05-11T06:01:54.118345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-08T23:14:55.595825Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.13292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-07-03T20:18:57.839456Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":"b2dab7c7-a0c3-46e2-99e3-b19a08e2436b","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:3df35c7d00814aa35d8fed6f36c6e90358ef7fb70ba4cb882621600480754222","observation_id":"010363d5-1c73-4422-9399-4cab4a8f1a34","resolution":{"observed_at":"2026-05-11T06:01:53.863823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:adba88e0ac821663825a859870811987ecff609499525e050dbf076d8721b16a","observation_id":"94fa5daa-c824-44f3-8657-ed84d15d231e","resolution":{"observed_at":"2026-05-11T06:01:53.907536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:46b6c8b38aa2ae48d91416ae632d3f542a0c93aea0f85ba05ce366f3cc8cca59","observation_id":"fd569198-e3d3-4481-bf67-08d9ed3c1e28","resolution":{"observed_at":"2026-05-11T06:01:53.941152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:856121cb6d19ad2196dda16b7a9c1c9b6188e763253fcd34b7b1de2431c31ae5","observation_id":"2490bbe3-8e77-4a4e-ae5a-95e5937f0c81","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-06T11:32:00.537531Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2402.05935","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-07-04T15:09:55.058979Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":"dbfa4c97-4580-4acc-b396-499d7de46399","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:7234a8070cf50244ee30b9bfe9d556a994304d9bd0a5010a9c6a840c17bf3856","observation_id":"7be3e54b-3137-42fd-b0d5-754a9281ea62","resolution":{"observed_at":"2026-05-11T06:01:54.007023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:72b7ee6e586dd3adce273c09d7fa55f4c31dbcaaf4ea882f32f72bb9b897b77a","observation_id":"63eae5ec-f086-4854-81d4-29a148cdcf8b","resolution":{"observed_at":"2026-05-11T06:01:54.028270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sciverse","venue":null,"work_id":"6bb8837a-2e83-4648-9276-4190efd479e9","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:14e9d8dbf598a2c2df07f8538586dbd4ef4e1f3e534a8c6ad520e5c8e9f38020","observation_id":"946005f6-d8df-44a3-b154-20715311ed17","resolution":{"observed_at":"2026-05-11T06:01:54.129149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-10T23:05:27.308529Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":"2309.00615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-07-04T03:09:29.321784Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":"99ba2617-dd10-4f2d-bb63-cc88e743aa78","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:2873b8687748e5c059bb7a630983bd80fdb9b4d3bc764f3365c7175378752070","observation_id":"080577c8-4f50-4d7f-a6ab-4f3b2ac2b91e","resolution":{"observed_at":"2026-05-11T06:01:54.075378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-08-08T23:15:31.134799Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2309.03905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind-llm: Multi-modality instruction tun- ing","venue":null,"work_id":"1cdf5dff-7482-43ff-b430-3a3911c5d927","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:48f88faeed9bac7f38b27073ec5d3e737b0fb52293260abab9a269eb72906089","observation_id":"67017df5-c408-44fb-9adc-c9bdeaafe641","resolution":{"observed_at":"2026-05-11T06:01:54.096749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"01d40650-a08a-442b-ba46-32d7fcca4edb","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:4471df3a7bfd1cada35f16f271fb5bf718f971f7ee2e15ba2bba5ecf8ee37b41","observation_id":"6e64181b-a782-4825-9d7e-2cb6cb48973b","resolution":{"observed_at":"2026-05-11T06:01:54.133170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"15452ac2-749a-42db-916f-e0e630c66fc8","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:6357557a2bbcb67ccce0347fd1304b722248bd1b319a5cd01b5eee0cc5896d98","observation_id":"6fc66ded-ac69-4318-943e-02592dd933e5","resolution":{"observed_at":"2026-05-11T06:01:54.137273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14045","last_updated":"2023-03-01T11:04:51Z","snapshot_observed_at":"2026-08-08T05:52:17.343895Z","submitted_at":"2023-02-27T18:55:27Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","version":2},"cited_work":{"arxiv_id":"2302.14045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14045","snapshot_observed_at":"2026-07-04T19:20:06.296460Z","title":"Language Is Not All You Need: Aligning Perception with Language Models","venue":"cs.CL","work_id":"2a1e0563-79f5-4521-8293-b8b1aebf7cee","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2302.14045","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:36df6890b0b50584c05c726dfa29b9db330a18af24ce4445d3cc48a0fdb27f35","observation_id":"a9da7cef-728d-47e9-b72c-d75717c57480","resolution":{"observed_at":"2026-05-15T18:32:23.026112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2405.01483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-07-04T20:40:07.542575Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":"ca7dd196-dc3e-4e3c-af1e-c0b02fc0efed","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:6fa8e9f20692ad28328bc4afb9971ed4c72dda7187b7d81244271d448cbc2e33","observation_id":"92774a09-2243-462e-8c7c-4b0a301e10c5","resolution":{"observed_at":"2026-05-11T06:01:53.834439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09798","last_updated":"2024-10-04T21:51:47Z","snapshot_observed_at":"2026-07-06T18:15:03.339204Z","submitted_at":"2024-05-16T04:02:43Z","title":"Many-Shot In-Context Learning in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09798","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chen, and An- drew Y","venue":null,"work_id":"8ee3d531-9223-41d0-9911-fabfee119f94","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.09798","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:b30cca21867ef693283b690b5038dcdbc8bc6a11f8da5866f300c94f1b4aa0eb","observation_id":"c324eeda-50c0-4d0a-a6d4-63947787e77b","resolution":{"observed_at":"2026-05-11T06:01:53.841270Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09175","last_updated":"2024-06-13T14:37:04Z","snapshot_observed_at":"2026-08-08T00:49:47.881356Z","submitted_at":"2024-06-13T14:37:04Z","title":"ReMI: A Dataset for Reasoning with Multiple Images","version":1},"cited_work":{"arxiv_id":"2406.09175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.09175","snapshot_observed_at":"2026-07-04T19:30:07.769033Z","title":"Kazemi, N","venue":null,"work_id":"3522abcc-ce86-41c5-86c2-d19d03a55c49","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2406.09175","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:d9c2445c41ef74f070ff3531390a9747abc4160230b76f39e1e4372ed893214f","observation_id":"7d6e01e5-b49e-439e-8a6b-de3456d2c396","resolution":{"observed_at":"2026-05-11T06:01:53.858154Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents","venue":null,"work_id":"b1650a7c-014e-400b-8dee-88ebcb0e31d0","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:9adcbdd0469bf41e30f8b0e3b926fa907a0d02b91035910a00622cffc4cc782e","observation_id":"37828504-eb27-4e88-b5c2-83a63acadd62","resolution":{"observed_at":"2026-05-11T06:01:54.144329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":"2405.02246","doi":"10.48550/arxiv.2405.02246","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What matters when building vision-language models?","venue":"arXiv (Cornell University)","work_id":"d774cb51-7f06-48c6-9dea-33285f55ce87","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:cb8077b790bba443f6f6bd8233b3b96ce0d7b41773e07bdabef1bf4802751aa5","observation_id":"535bc872-3868-499a-95b7-224b248aca5d","resolution":{"observed_at":"2026-05-11T06:01:53.879662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, May 2024","venue":null,"work_id":"22d1b287-3b74-436a-87bb-cc4c6fc5b7c3","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:f9741e2ead718e01250a96ce8b5ebb308d86eb63b5aa1b22e19c8d11e8174e19","observation_id":"11bbf476-21f5-4f49-b98f-66392cb90281","resolution":{"observed_at":"2026-05-11T06:01:54.156857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2306.05425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-07-04T19:20:06.537902Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":"17b44aec-3833-47e1-8d2e-e1080a403019","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:c7c7b6e1cb1cf92fcb1c6e1102ffb74906145e7efdd3b8899e5df842fe8a8183","observation_id":"448207a4-f2cb-42c0-9662-5afe17eeae6d","resolution":{"observed_at":"2026-05-11T06:01:53.915342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and genera- tion","venue":null,"work_id":"73063ee0-4666-4625-9db6-d3a30a016039","year":2022},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:7ae156c00058ee39b80349eb452e93a267e03d8847192c115dd458d8ee3f1c62","observation_id":"a52d7edc-059e-43f4-b9f3-2127a1a9817d","resolution":{"observed_at":"2026-05-11T06:01:54.164224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning multimodal llms to follow zero-shot demonstrative in- structions","venue":null,"work_id":"33b33c46-4955-4964-8450-6c62f01f6f4d","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:b35bd11358d590cf0a55c027236747ed28642b8c308f06a86989e37c17b29e13","observation_id":"a31826b8-5e66-4b5c-8384-49bc1a92bb17","resolution":{"observed_at":"2026-05-11T06:01:54.169809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-tuning multimodal llms to follow zero-shot demonstrative in- structions","venue":null,"work_id":"4d50efe2-1cdf-46b4-adf4-739a17727546","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:dcbbd13527c943efce0c0d613791188b68ecec98592f4bafa308cc03f5a7d812","observation_id":"d3fc334e-a87d-4a13-806c-c051054beee2","resolution":{"observed_at":"2026-05-11T06:01:54.177720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:3c691513d06178abca4e21ed1b124c72b371988e448f2371314ceeaf0565eadb","observation_id":"00f85e25-659b-4493-a6d5-69c64df88929","resolution":{"observed_at":"2026-05-13T23:30:00.879549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"33d935d9-254a-4e8b-afd6-7dcfb6764e28","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:f6d71e17aa8e14b9b6b1ed5ff53151faa3a68307d6663846c5ea82a761115550","observation_id":"5d4ff821-c132-445e-b69a-40f3ee6a4f5d","resolution":{"observed_at":"2026-05-11T06:01:54.182237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-10T13:02:01.821606Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.17043","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-06-30T19:35:01.039481Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"895dc295-4d82-4fd4-97d0-bb87df86a585","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:81d85198eab3ac3c83da88da1d595ddee8361d6e04486e88ef89a4d399680b34","observation_id":"075a7d8a-4684-4e04-b3e0-ef9b26d2067e","resolution":{"observed_at":"2026-05-11T06:01:54.037741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"bc6cd8d5-c46c-478d-a3d7-ce7ac1b0934e","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:4e537edaaa6f938fd4b329110c0c3c2ee0e627754f763776b594842204ae8ee8","observation_id":"b5d0cc22-b356-4bb9-b792-ea6e52fb3f52","resolution":{"observed_at":"2026-05-11T06:01:54.185673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre- training for visual language models","venue":null,"work_id":"8806cac7-125c-456b-8d02-088c6c226d2d","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:a18077febfebfe30357a4e7c4b8bb2cc611763c454c1185bdb4e4e88a37a8549","observation_id":"93790b17-d7d6-4ad5-a90f-3c10ec4d9aeb","resolution":{"observed_at":"2026-05-11T06:01:54.193923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07575","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-07-04T06:39:37.554183Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","venue":"cs.CV","work_id":"38f258e4-8974-4ea0-98a8-a336838dcfaa","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:a091812cf49b82dafdf9a819f3fcf136edec5b0440c4cd5f828f5445b9639442","observation_id":"6b8ac181-2c73-4433-8850-b36323159e1e","resolution":{"observed_at":"2026-05-17T03:03:27.047113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tun- ing","venue":null,"work_id":"4af4fc94-cce8-4940-ae2d-2b4b634cc162","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:bc7d667a36b9d6a2acce5e7c55c29935dfcf7ed648f4e1c720a0984492bc3778","observation_id":"be1b695a-bf15-4dc1-8f4a-385e1bdf2ab3","resolution":{"observed_at":"2026-05-11T06:01:54.197203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava- next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"b6915fe0-bb32-4476-ab9a-b5f3fd0756ef","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:434c928a141441cfbd4f532daa9760d571246ee1519d2d3d2af5423c97283492","observation_id":"4b10f6c3-a30e-4f95-803f-6f382f4d8529","resolution":{"observed_at":"2026-05-11T06:01:54.200045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"979cb4ea-b907-422f-9b85-f4fb40bc5eed","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:6e80c3825477f3daf0a3bde0e6b42f5a9a38ddefa0f7af24df3dfe765a291b3e","observation_id":"714843e4-6595-42c8-9ba0-6dfd915c9eb7","resolution":{"observed_at":"2026-05-11T06:01:54.225950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narra- tor via equal distance to visual tokens","venue":null,"work_id":"70a5d59e-df35-4825-9f7f-a6568fcbb5f2","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:ff76a4d75cf29072e6611d45627971fa949e6510e613e3f5526523727594cb7d","observation_id":"a1797f7e-b858-4f8c-aaae-45251b6306fa","resolution":{"observed_at":"2026-05-11T06:01:54.230003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and lan- guage models","venue":null,"work_id":"c08af6e1-b6b6-475f-8688-d7708c4801ec","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:d74a9607eaa86215bd9cfedde74a3693bf0240ce6dd2ced81bf08c4726684746","observation_id":"20a145ad-5579-41ea-9f09-31b4f99eb4c9","resolution":{"observed_at":"2026-05-11T06:01:54.235050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and lan- guage models","venue":null,"work_id":"dd2d1562-d052-430a-9308-d587a731f19d","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:3b04dd67ae2cd4a8b5a9f445d5cb87f5fe5778673c9d738805b66902c5f68000","observation_id":"f2bd38de-4183-4f3c-9720-d52901c0cb0e","resolution":{"observed_at":"2026-05-11T06:01:54.241181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":"2403.09611","doi":"10.48550/arxiv.2403.09611","metadata_source":"pith","pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","venue":"cs.CV","work_id":"378a250e-75a3-4ceb-b9a3-f8a5c2ed1a66","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:928542ad982439c6b30680438a359d2c6ff4568fe90ef1a52817486fb1d7e0bd","observation_id":"1fda17c4-bc48-4651-9e3e-e1407b6fa0ae","resolution":{"observed_at":"2026-05-16T04:09:36.761640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:26:54.787661Z","title":"Gpt-4 technical report","venue":null,"work_id":"388f534c-855a-4366-b933-f07bf3e2db5f","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:f3059680a40fffbac4f602d2eb529ac3377a214cebd12a0a6cedc9cc85233595","observation_id":"631dfacf-4839-4e6e-8a61-3108361a6db9","resolution":{"observed_at":"2026-05-11T06:01:54.244545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT-4V(ision) system card","venue":null,"work_id":"9b3f20ae-98a0-4d57-85f0-f23f2865bd94","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:12a3aaefa61302aa1483eb8618778f434aeece1edc8ba35f6a37cb7553453351","observation_id":"d676ccfd-b323-4818-8343-8ba647e835c0","resolution":{"observed_at":"2026-05-11T06:01:54.106869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:da9aa30544c6dba2b293f667b47aba1896b4ddbc38a7f9c03548e00054d5f141","observation_id":"bcc57d77-533f-44e5-ba13-1e1ea51e6e6d","resolution":{"observed_at":"2026-05-11T06:01:53.869766Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f89e76e1-73f9-46ff-96c9-a2f82ce98ac7","year":2021},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:19cdd66eaeafe330d8dc3907945886777b9a5b621960355d99c3f7e1a2aa2f63","observation_id":"214c4f86-17d6-4c41-8a3f-ef495a50e597","resolution":{"observed_at":"2026-05-11T06:01:54.256195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:bc23143148069211a0b44756dcd12c3273cefaf0e8e043741caf8356bda9bd60","observation_id":"9c977c08-f0f4-4f82-afc6-a88f86a9a316","resolution":{"observed_at":"2026-05-12T10:21:01.130308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conceptual captions: A cleaned, hy- pernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"ed45a70a-5259-4d60-9b62-326ce03ca329","year":2018},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:c8be5304837fd3ac8a60a7f9940847158f8f6f5d3414f8bb30a7ee65d0fa7968","observation_id":"9ae410d6-2a09-4a2e-b1ef-b93d2b6cf2c3","resolution":{"observed_at":"2026-05-11T06:01:54.295762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"b6900368-f271-435b-a014-7330d3c90c06","year":2020},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:19beb32461001163da5d3036d0b27ccfc6a40c48732b558f5e138d4d9c1d903a","observation_id":"7ad6d14b-7f6f-40f8-bc6a-811e9ac20a07","resolution":{"observed_at":"2026-05-11T06:01:54.407700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00647","last_updated":"2024-01-22T18:53:48Z","snapshot_observed_at":"2026-08-04T19:45:40.589703Z","submitted_at":"2023-10-01T12:02:59Z","title":"Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning","version":2},"cited_work":{"arxiv_id":"2310.00647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00647","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond task performance: Eval- uating and reducing the flaws of large multimodal models with in-context learning","venue":null,"work_id":"fc8382e8-d0ac-4eba-b74f-ee77cd6bbc29","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2310.00647","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:a3aac1401766d4bc57f10ad0179795f352775f09d1c94367158c749849294a6e","observation_id":"ca1fe776-dd21-47ac-9020-1be100527f61","resolution":{"observed_at":"2026-05-11T06:01:53.925903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-01T22:56:26.162617Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":"1811.00491","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","venue":"cs.CL","work_id":"a3a33825-9d22-4b44-9b6c-07152b01101f","year":2018},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:cbe3b162e0756786ac23da310d61f5ce110c25af7f528fc6996cf01a723e4209","observation_id":"24010fe4-7d8f-4485-b2a2-5b10a086e7f7","resolution":{"observed_at":"2026-05-11T06:01:53.935043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative multi- modal models are in-context learners","venue":null,"work_id":"7e938caa-b75e-4223-997b-8d8f2430df3f","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:416257393090f49c219c9c0d6fe501e955a9330df672f305e3930377dd57605f","observation_id":"18743191-6eb9-4521-833d-2cf5e4cfd3f0","resolution":{"observed_at":"2026-05-11T06:01:54.420983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:4104fcdb01fe52157e853fa2a1ced3a492197dea9bd3db6a2e232ee143885862","observation_id":"99298421-d2ef-4aaf-bfab-965b5835dc05","resolution":{"observed_at":"2026-05-11T06:01:53.947344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:c7563aac1783f76058de07af12a5adfb37f53b5d7a5c613bf14bd8753e6fb549","observation_id":"5d09921d-82c0-4f35-977c-bc88e19bc222","resolution":{"observed_at":"2026-05-11T06:01:53.954672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-09T15:18:46.301127Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":"2406.09411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-07-04T21:00:08.872451Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","venue":"cs.CV","work_id":"9303f540-1c57-4c25-bed8-4456eb1c7e17","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:6c57bc321815740a7fea801d194f86b8de9e71608e3164225492a655e2ff52dd","observation_id":"40bb0bb5-ad2a-4d50-b8b8-2c999dbfe2b8","resolution":{"observed_at":"2026-05-17T01:09:30.603679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-08T12:09:53.592366Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":"2405.09711","doi":"10.48550/arxiv.2405.09711","metadata_source":"arxiv_reference","pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":"arXiv (Cornell University)","work_id":"6347befe-456f-400c-8986-542b9c1fc388","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:d65f9f6043304496a9ccf1231547737b2cc909fbc523cdc59eb4d71a0aea379f","observation_id":"2c6edefc-924a-4814-96bb-d0ab6ccd99b4","resolution":{"observed_at":"2026-05-11T06:01:53.971264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T14:52:47.118075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-08-09T09:24:00.370216Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":"2309.14181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-06-30T13:34:40.544825Z","title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision","venue":null,"work_id":"5cc0bbca-7cce-4f8c-bd9d-7b44a68d9062","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:2bb809c338894b5935466fa95edc2da2e143e3b5b9ecf138318ba6451cfc3bc5","observation_id":"baba10dc-c7e9-4a1e-9c9f-1e755cfba758","resolution":{"observed_at":"2026-05-11T06:01:53.983850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":"c317e3b8-43f5-49ae-9cd2-656f73731c6a","year":2021},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:0ebc22e1b897c805eb9ef95a2419d5b1b40ed73a77a8fce9168a4763b0728a31","observation_id":"205642d2-b085-413a-b0b3-a6978326b633","resolution":{"observed_at":"2026-05-11T06:01:54.453723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-08-10T23:07:10.208283Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":"2308.16911","doi":"10.48550/arxiv.2308.16911","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2024.doi:10.48550/arXiv.2308.16911","venue":"arXiv (Cornell University)","work_id":"ce992739-1a55-4f67-9b72-a7847c57a23a","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:016ad7118cc922596882034cd43908fe567e3c0ea917f40dc21e7c248985c03b","observation_id":"84121b69-b692-4d17-b069-7a39544b3a85","resolution":{"observed_at":"2026-05-11T06:01:54.002228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"c1e7ce2a-2946-4bfd-992a-5285ed418b1b","year":2019},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:6269688a561e5ca56593dfd52f064cee46dde84d4db5b146d74e321908137c0f","observation_id":"8c17b0ad-8401-41dc-8cbc-5d83bee6f3d7","resolution":{"observed_at":"2026-05-11T06:01:54.536774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A mas- sive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"20287de6-dc5b-4e77-bccf-24a91bf81a14","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:2fad533bbc61f489d1381e96fcd1a6416f341acd7108a14367efd6ff27a3ade7","observation_id":"25010481-2a22-4df9-a3e1-949d351b8806","resolution":{"observed_at":"2026-05-11T06:01:54.544773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:450117234e98121a435501374768b76acc4cca08d420d034752722d1c1cca102","observation_id":"ea90a5a7-a265-4bcd-9651-3cbf7ed84f7d","resolution":{"observed_at":"2026-05-15T05:37:42.029646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T17:38:12.261029+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.261029+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.261029+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language im- age pre-training","venue":null,"work_id":"272237f6-5da6-4d68-bd63-148926dfccf9","year":2023},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:76c7ad077de6b95520239d62c7aedc5e1b0d7dcb9df1c13de14dc973b3c49061","observation_id":"8c7e0da2-81d6-4681-8e2b-2394d3ec103b","resolution":{"observed_at":"2026-05-11T06:01:54.551143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":"2404.01258","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-07-03T10:48:02.987489Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","venue":null,"work_id":"535c0def-a885-4b3e-92ab-cd729cc55a1f","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:689293719a4b669e6c02f04bf35a9b2be0f252b3d4160ff9e2b4ab9df24716e5","observation_id":"2be66cc2-d484-4cb3-b4ac-8e26c01ad504","resolution":{"observed_at":"2026-05-11T06:01:54.032979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLaMA-adapter: Efficient fine-tuning of large language models with zero-initialized attention","venue":null,"work_id":"2eae61f5-a5f0-48f1-b28f-bcd8c17ea3d5","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:3d08b3e7d0cce09dbae266c69a9f3f0df4d08e8d1081d32bee981ab1fdc0d10c","observation_id":"43569bcb-7cd3-4831-8cd6-0334e6dd34c7","resolution":{"observed_at":"2026-05-11T06:01:54.560615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:9d479132276c5866f35f4fea97ebd3f4e7c21e65ce194777d69426f9fe10eafd","observation_id":"9a459fd1-0b51-458c-86c6-7c745aa4bb3b","resolution":{"observed_at":"2026-05-17T01:29:30.364997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08739","last_updated":"2024-11-01T22:14:24Z","snapshot_observed_at":"2026-07-06T18:45:01.801741Z","submitted_at":"2024-07-11T17:59:47Z","title":"MAVIS: Mathematical Visual Instruction Tuning with an Automatic Data Engine","version":2},"cited_work":{"arxiv_id":"2407.08739","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08739","snapshot_observed_at":"2026-07-02T22:47:26.006183Z","title":"Mavis: Mathematical visual in- struction tuning","venue":null,"work_id":"fac73d64-a4a2-4afb-8f45-33d938f9ada7","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"cited_paper":"/paper/2407.08739","citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:1b1d6138b38395dd42dcfd27d09510a0eac74e29cb1fe7a9ab5797f5c0130a07","observation_id":"4a21b82d-8f57-4c5d-8782-6593f43566e9","resolution":{"observed_at":"2026-05-11T06:01:54.061147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: A strong zero-shot video under- standing model, April 2024","venue":null,"work_id":"22c21365-47cc-4c2d-bd6c-01be3578fa38","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:9240c6b920fbc96c1ef25439cf844cc5ebdd30dd3c3f3f45ddb0a3a65dd2355e","observation_id":"a689cc28-8bed-4fd2-a628-1b8e447b91fc","resolution":{"observed_at":"2026-05-11T06:01:54.565998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text","venue":null,"work_id":"6ec500e4-ce2b-43d1-a458-86e90c59a924","year":2024},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:6cb6176556d7bc6e0ae24fd8c3178d29e8ae7ec98bd0657fe28f6e1932152955","observation_id":"d8a579f9-681b-4f3e-847f-f2848bf53902","resolution":{"observed_at":"2026-05-11T06:01:54.573443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"26ab074f-1c7c-438a-a055-2236c7c5fdd2","year":null},"citing_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-11T06:01:53.730356Z"},"links":{"citing_paper":"/paper/2407.07895"},"observation_digest":"sha256:9634784f8257c33c9aa142587a282061dd20e1c09af767a7520c6cf4d9f3dc96","observation_id":"fdf3656d-c70d-46c6-ac01-20c2bc077077","resolution":{"observed_at":"2026-05-11T06:01:54.582702Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":31,"verified_fuzzy":33},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 100 inbound Pith citation observations for arXiv:2407.07895."}