{"as_of":"2026-08-20T22:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:354a3a3456c89da159279f860683345d4bcf655ec6fc974b53479ba41ba9ad5e","coverage":[{"denominator":235,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:19:36.917814Z","state":"measured"},{"denominator":132,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":132,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:35:44.870369Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-08-11T19:32:15.215968Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:87d359f69c75a1ac5fe102e5cf87304d4e0191e79e09e49afe11550ee3d1e66a","observation_id":"f51e9682-09fb-47b3-8924-32619f16dc8f","resolution":{"observed_at":"2026-05-13T22:21:15.817065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-07T10:25:36.240386Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding.arXiv preprint arXiv:2504.13180, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-17T07:18:25.954325Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.240386Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:23a251fd51accfd675191a17e2417fb96857dfa42d5a7a17cec9b3431be9e298","observation_id":"36bbce6e-2e67-485a-90eb-aae6f5bd0c0e","resolution":{"observed_at":"2026-08-07T10:25:36.240386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-07T10:35:44.870369Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:44.870369Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:5784f13b509f3bc51b07a7a9e85ca37c7688e335f04cc74238a9dba28742f613","observation_id":"feb10324-1938-47ff-a4ff-fc8f6981218f","resolution":{"observed_at":"2026-08-07T10:35:44.870369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-07T04:44:59.009056Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09943","last_updated":"2025-06-11T17:10:36Z","snapshot_observed_at":"2026-08-13T03:47:33.871757Z","submitted_at":"2025-06-11T17:10:36Z","title":"CausalVQA: A Physically Grounded Causal Reasoning Benchmark for Video Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:44:59.009056Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2506.09943"},"observation_digest":"sha256:2ca856728b585f1b6f175d720fd6bf4e3e417850de78c4007b447c98abe64cfe","observation_id":"ab285409-aff3-450c-b2d9-708aa346803f","resolution":{"observed_at":"2026-08-07T04:44:59.009056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-08-15T13:40:01.739055Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:8c5b299c2df53912d9cd0d758800dec2def188d9b79201ea5871cb2a29294968","observation_id":"5481e072-022d-4fb6-974c-a1f73ccbf903","resolution":{"observed_at":"2026-05-11T00:33:50.751197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-06T12:55:37.435979Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21353","last_updated":"2025-07-28T21:46:05Z","snapshot_observed_at":"2026-08-14T07:48:31.491308Z","submitted_at":"2025-07-28T21:46:05Z","title":"Group Relative Augmentation for Data Efficient Action Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:55:37.435979Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2507.21353"},"observation_digest":"sha256:1176599820a9ae2e3de8a28f9eec1aa7b6e0d8a76fb16d56998d41e2ae2bc96b","observation_id":"254383df-acec-4f27-a082-f36dbfe6d5b6","resolution":{"observed_at":"2026-08-06T12:55:37.435979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T10:58:15.783270Z","title":"Per- ceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03501","last_updated":"2025-09-03T17:33:20Z","snapshot_observed_at":"2026-08-19T05:29:31.281211Z","submitted_at":"2025-09-03T17:33:20Z","title":"Strefer: Empowering Video LLMs with Space-Time Referring and Reasoning via Synthetic Instruction Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:58:15.783270Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2509.03501"},"observation_digest":"sha256:4476cfbc419b4149727057794bb44dd1fd1b6ae891c4733717c3c5fa562adeed","observation_id":"048c6c3c-bdd1-4fc5-86b3-6ebce32f8450","resolution":{"observed_at":"2026-08-05T10:58:15.783270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T20:22:46.220021Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2511.16719"},"observation_digest":"sha256:4bcccaab55b87607a5a01dc2e6989d1a07202c3f0785441283af48c68814d727","observation_id":"9b872af4-c4ba-4404-9fd9-9132e9fe6cae","resolution":{"observed_at":"2026-05-17T20:25:11.567661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-03T13:01:57.744137Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-19T18:00:21.944637Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T13:01:57.744137Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:44010d0f0e7b093229bc9ba59db75377105101b4b56be1e4083d8922b524faaf","observation_id":"28b1ff73-f9ff-4cb7-8a2a-d35a64972510","resolution":{"observed_at":"2026-08-03T13:01:57.744137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-04T06:36:33.788629Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-19T18:00:21.944637Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:36:33.788629Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:a507163d92697c2a61be6632b02ed6fad738e6d8dccc0eb915b6103cd210ee9c","observation_id":"c87468a0-646d-48e9-baee-b10aa5b2c2b6","resolution":{"observed_at":"2026-08-04T06:36:33.788629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-16T00:44:08.264820Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:f7bc549968f199936af4489bf81db99d6f84722dfd3073a48c144fd33f7c0826","observation_id":"5638f5c9-e25e-49de-bf42-b0e8b754930e","resolution":{"observed_at":"2026-05-16T04:21:29.849841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2604.08762","last_updated":"2026-04-09T20:51:13Z","snapshot_observed_at":"2026-08-12T17:35:21.049919Z","submitted_at":"2026-04-09T20:51:13Z","title":"InstrAct: Towards Action-Centric Understanding in Instructional Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:49.334104Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2604.08762"},"observation_digest":"sha256:8bf2023604dc911cb9186b3c4cf9e837fcb88c2ec9a9dea26df87c62f60aef6a","observation_id":"3ab36bd7-1861-4b62-bfd4-6b1b14d6faa5","resolution":{"observed_at":"2026-05-11T07:35:56.793965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-14T18:20:32.782574Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:f74e00fe41a0312dee5346dcb181dccc767ae4d1d89f9a766606e2d3991ef465","observation_id":"303a81e6-0a18-414c-a1da-9dcd0f3f3662","resolution":{"observed_at":"2026-05-11T10:26:02.000635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:eaf699232289e981462a3e65f521ef38ee5edccfcba840200bd2cea406210f45","observation_id":"90b75ce0-2758-4e5f-b709-91725c335095","resolution":{"observed_at":"2026-05-11T13:46:04.390564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2604.24317","last_updated":"2026-04-27T11:07:03Z","snapshot_observed_at":"2026-08-16T19:20:53.035767Z","submitted_at":"2026-04-27T11:07:03Z","title":"Don't Pause! Every prediction matters in a streaming video","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T04:32:01.379605Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2604.24317"},"observation_digest":"sha256:462b0c106834068e66a1abe6200f1794c97542b04641b0b53a3332f28ed2dffe","observation_id":"f0a3f67e-6673-468f-b957-ee4e6c81beb8","resolution":{"observed_at":"2026-05-11T21:41:17.822135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-15T12:35:11.807336Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:2478e7e922f0ed7a418faa05666c42bf32c34d598de3d205c52136990e18aa8c","observation_id":"d1335f95-8139-4879-9e57-123cf6c50c59","resolution":{"observed_at":"2026-05-12T08:21:23.368911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-14T19:51:28.986213Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:3abda8ca59f3d5c1462056abf824747b0c33fdffcfd57a4e5dee54d7afff7b10","observation_id":"8542f057-34bb-4891-9e1f-a8d89a7d3f16","resolution":{"observed_at":"2026-05-14T20:19:28.521335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2605.21625","last_updated":"2026-05-20T18:36:57Z","snapshot_observed_at":"2026-08-19T15:02:57.748522Z","submitted_at":"2026-05-20T18:36:57Z","title":"Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T09:20:32.920925Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2605.21625"},"observation_digest":"sha256:2bab41162defb1a20af984327471cfbbd63d2d9c70782cda155c879cfa4e83e0","observation_id":"a1e13608-5d35-46fa-88cf-ec4009c487b9","resolution":{"observed_at":"2026-05-22T09:21:20.656335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2605.21988","last_updated":"2026-05-21T04:38:02Z","snapshot_observed_at":"2026-08-17T18:30:53.616813Z","submitted_at":"2026-05-21T04:38:02Z","title":"Learning Spatiotemporal Sensitivity in Video LLMs via Counterfactual Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:45:56.473188Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2605.21988"},"observation_digest":"sha256:df8a9db3a016bef75aa63900361e3b83b54726cda2de2a8ee734c1f8653ca801","observation_id":"883c0a7a-fb6d-484a-9887-2490acff76e2","resolution":{"observed_at":"2026-05-22T07:46:14.843460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:c113c95ef8988fc50cc17bbebf5b4507ee391a8fa63d9471a6e7b30fa64b047c","observation_id":"fcf13a7e-7ada-4806-b127-201796c1e010","resolution":{"observed_at":"2026-07-01T19:26:00.682259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.02569","last_updated":"2026-06-01T17:56:35Z","snapshot_observed_at":"2026-08-14T11:36:56.209518Z","submitted_at":"2026-06-01T17:56:35Z","title":"AdaCodec: A Predictive Visual Code for Video MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T15:20:48.248576Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.02569"},"observation_digest":"sha256:27e312db8e2764fa143ccea92733d054cee4ff32481de4dfc36b8adf8c049027","observation_id":"df891798-c9bd-4693-95c3-3f58cc7d1c13","resolution":{"observed_at":"2026-06-28T15:22:19.555545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.19100","last_updated":"2026-07-01T09:15:37Z","snapshot_observed_at":"2026-08-16T18:16:29.642736Z","submitted_at":"2026-06-17T14:11:41Z","title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T21:22:53.792778Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.19100"},"observation_digest":"sha256:b6dd1ea77a24b66cccb999f59b512b48ffc8d28f416f260be95849fc900af619","observation_id":"1765e026-7c55-4e84-8cd2-5ce4315e9981","resolution":{"observed_at":"2026-07-04T00:19:12.972644Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.19100","last_updated":"2026-07-01T09:15:37Z","snapshot_observed_at":"2026-08-16T18:16:29.642736Z","submitted_at":"2026-06-17T14:11:41Z","title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T07:34:37.974692Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.19100"},"observation_digest":"sha256:de4883a66fd6e5360ee2978b843ed41916230507b167e14fee077a893903786c","observation_id":"84eb08e2-7c7b-4151-adec-6a76caa51cbb","resolution":{"observed_at":"2026-07-01T07:35:28.798366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.19100","last_updated":"2026-07-01T09:15:37Z","snapshot_observed_at":"2026-08-16T18:16:29.642736Z","submitted_at":"2026-06-17T14:11:41Z","title":"AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T22:15:14.561596Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.19100"},"observation_digest":"sha256:5021026b0255016b3b2353d18da824c5f0878638fb6b1dad96eeceacec1403c9","observation_id":"256df914-618f-4b03-9e49-28a8ceef1490","resolution":{"observed_at":"2026-07-02T22:17:25.000055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.24888","last_updated":"2026-06-23T17:59:55Z","snapshot_observed_at":"2026-08-08T16:38:03.178919Z","submitted_at":"2026-06-23T17:59:55Z","title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-26T00:06:11.951205Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.24888"},"observation_digest":"sha256:4b4912a705d32131bf843162ea21eee82d6f04510c94d0da25911714dae2053e","observation_id":"73f2b3c5-bdef-455f-ac15-b2fe8c5fe847","resolution":{"observed_at":"2026-07-04T16:59:58.135042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.25634","last_updated":"2026-06-24T09:38:27Z","snapshot_observed_at":"2026-08-15T05:32:19.948965Z","submitted_at":"2026-06-24T09:38:27Z","title":"SSMNBench: Diagnosing Image-based Cross-View Human-Object Understanding via Single-View Sufficiency and Multi-View Necessity","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-25T21:02:44.441202Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.25634"},"observation_digest":"sha256:921b957f04c5c6fbc68af8118373d9fd90d255695b95954ab72d22e11346006d","observation_id":"479012f2-b78e-486c-b73e-fc149cfee7d5","resolution":{"observed_at":"2026-07-04T19:50:10.224238Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.25842","last_updated":"2026-07-02T12:05:36Z","snapshot_observed_at":"2026-08-07T13:16:29.055704Z","submitted_at":"2026-06-24T13:55:45Z","title":"Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T20:58:01.925342Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.25842"},"observation_digest":"sha256:1ef87f3d7ce547b5301b6589b14b26377f698e6a7a5ee06265dcdec235c1e2d4","observation_id":"9bc7a457-a71c-40a0-b29b-1d5a706ad9e7","resolution":{"observed_at":"2026-07-04T19:50:11.284082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:a295bce127c4ae877664a6f17773f75026e1f683dc1c68c89cd4888f3d4a3f1f","observation_id":"070e822c-dcc7-4a43-8b9f-8a33109367ae","resolution":{"observed_at":"2026-07-01T15:45:47.690264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-08-10T01:17:41Z","snapshot_observed_at":"2026-08-13T23:28:37.542175Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:bb144347bd256ab24afc884ab67f3cfe28177d952624f49af6e48fb0b3f12790","observation_id":"115430e1-3ed7-4c6d-be2e-554e0056aa28","resolution":{"observed_at":"2026-07-02T21:17:24.161656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2606.30288","last_updated":"2026-06-29T13:30:17Z","snapshot_observed_at":"2026-07-07T00:04:10.492340Z","submitted_at":"2026-06-29T13:30:17Z","title":"VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:49.904752Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2606.30288"},"observation_digest":"sha256:b9807dd881d9c649057ae395d46589ec9d7c2107fdbcd8ca5b5c7b39f8a66e0f","observation_id":"22c24511-54df-4f63-ba2a-427fe098fd85","resolution":{"observed_at":"2026-06-30T06:04:21.260794Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2607.01117","last_updated":"2026-07-01T16:04:24Z","snapshot_observed_at":"2026-08-11T23:11:25.942277Z","submitted_at":"2026-07-01T16:04:24Z","title":"MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-02T13:44:48.250838Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2607.01117"},"observation_digest":"sha256:3aa07f150375e9c35975cd15f3dd0499884ad95f5288fdde937d51426b633b33","observation_id":"0d9a6198-a0f5-4191-9a08-107af9fc74e1","resolution":{"observed_at":"2026-07-02T13:46:58.655990Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-02T00:44:40.660990Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14935","last_updated":"2026-07-16T12:47:59Z","snapshot_observed_at":"2026-08-19T11:37:45.224155Z","submitted_at":"2026-07-16T12:47:59Z","title":"VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:44:40.660990Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2607.14935"},"observation_digest":"sha256:5b6bac8e0bc40a706dc6eca6295ddb7d9852f63d2a32710db258b492148d165d","observation_id":"e667046c-a725-4642-b587-c2328b08047c","resolution":{"observed_at":"2026-08-02T00:44:40.660990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13180/citation-record","integrity":"/paper/2504.13180/integrity","json":"/paper/2504.13180/citation-record.json","paper":"/paper/2504.13180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.433312Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.433312Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:b06b7c79971c7103a2fb5f5a77695e629e54d93307c5a7490ec7700cf0effdac","observation_id":"16ca75ab-6316-46f7-87ef-10347eaf7f55","resolution":{"observed_at":"2026-08-16T12:19:36.433312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.439892Z","title":"Sharegpt-4o: Comprehensive multimodal annotations with gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.439892Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c5b49312fa3c65133f5a5a6f278d68372f977444462ed727ee7cfa9b124efc4d","observation_id":"3a048876-d40d-4740-97ab-02b68cc5099d","resolution":{"observed_at":"2026-08-16T12:19:36.439892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.444904Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.444904Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:1a623ef8f2512cf9f99035c6c651ea17facad6749f7c85330e4806970cfc9565","observation_id":"b611945f-069b-4791-9049-12a434cfeff1","resolution":{"observed_at":"2026-08-16T12:19:36.444904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.449728Z","title":"Finevideo: behind the scenes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.449728Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:8be2b839e72aacd2e6e960b71bf7f42b12689bd97548c9afb0ce943b949f4f2b","observation_id":"8a525e0e-bb21-4904-b92e-29df26792509","resolution":{"observed_at":"2026-08-16T12:19:36.449728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.454622Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.454622Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:bf23ee2f8fd519a02eecba7cc80c2f7017bbd935f8a41e026be8a1ec2082a8b2","observation_id":"c492a6bb-b5d3-4bc5-87e5-ac11f57d5a76","resolution":{"observed_at":"2026-08-16T12:19:36.454622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T12:19:36.459440Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.459440Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6e08d61a40cac83c9a135860f143264d7009483755efe84f05578e20c684e459","observation_id":"c44d3654-2579-4e20-b1e4-fb6f56135dc3","resolution":{"observed_at":"2026-08-16T12:19:36.459440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16858","last_updated":"2024-06-30T15:03:25Z","snapshot_observed_at":"2026-08-19T20:26:05.724045Z","submitted_at":"2024-06-24T17:59:11Z","title":"EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16858","snapshot_observed_at":"2026-08-16T12:19:36.465422Z","title":"Eagle-2: Faster inference of language models with dynamic draft trees, 2024b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.465422Z"},"links":{"cited_paper":"/paper/2406.16858","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:0f39b1d655f3070633d4cd1fce4eba90a5b35b5500b8948ba3842e28d8304597","observation_id":"325ab784-ef84-425f-92c9-a3c7369a4249","resolution":{"observed_at":"2026-08-16T12:19:36.465422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-13T09:35:23.538598Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-16T12:19:36.470416Z","title":"Hero: Hierarchical encoder for video+ language omni-representation pre-training","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.470416Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:8165faab8842e126ec753fd722427fa7ac6d30c105021407eb4323ff2d72c126","observation_id":"43398dab-a72d-4441-b1e2-55da1f3df5d2","resolution":{"observed_at":"2026-08-16T12:19:36.470416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.475449Z","title":"Where does it exist: Spatio-temporal video grounding for multi-form sentences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.475449Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:7efe6059ee17f80ff6637cd77c74f6d38592eb00d571842f77f5e1739681d128","observation_id":"14f6e097-9e1a-4291-9a8a-0ac7eeac1f9e","resolution":{"observed_at":"2026-08-16T12:19:36.475449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T12:19:36.479853Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.479853Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:0e66c46a23a430165679ea2c58d3a1fdeb2877a42405e90098428d2ed22a1e1f","observation_id":"d1af8518-3d95-479e-8906-9f88ae1a770f","resolution":{"observed_at":"2026-08-16T12:19:36.479853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-16T12:19:36.484457Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.484457Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:8020ce150a04f9f5490b46fdb24085a93f7567abc6f9d51cb1faba17b5d772cc","observation_id":"f1a6f1ea-4eb4-4391-b086-a6c76dc81130","resolution":{"observed_at":"2026-08-16T12:19:36.484457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.489108Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.489108Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:b4caae8e5d2dba49c456c418fb783e9c757fae39094a0f85fccfac40dc5fe628","observation_id":"67cfed3d-5642-4c01-a041-1649df3fb22f","resolution":{"observed_at":"2026-08-16T12:19:36.489108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:19:36.493417Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.493417Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:f78308c845531b534110087da5923218dddb59e59480bafa1c6f7f919d772ea5","observation_id":"142ca518-f2e4-4386-9f7b-9f524b8f3bb6","resolution":{"observed_at":"2026-08-16T12:19:36.493417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.498151Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.498151Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:02fe447b27ad1e7bb8a3e49b636f5faa00e1900d3a78490e48d018de1a236072","observation_id":"92330894-b3d3-4abe-b053-4f782f2550dc","resolution":{"observed_at":"2026-08-16T12:19:36.498151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-16T12:19:36.502746Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.502746Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:5671c20788ff7b2d8de68eae69c8f5382399fca6387a64b780d23feae2542b97","observation_id":"108f75cf-f89d-4de6-8385-6eba40d76e9c","resolution":{"observed_at":"2026-08-16T12:19:36.502746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-16T12:19:36.507718Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.507718Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:5304e3757132f22f0ab1014a41da15288a5e7a84b80113924a0e8a8e33bc3c64","observation_id":"b337e501-00b9-4dd9-b1d4-deac0b119bbe","resolution":{"observed_at":"2026-08-16T12:19:36.507718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.512477Z","title":"Vila: On pre- training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.512477Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:da47162ef21392c6c7f0ce2237e10cbb265adf58a9ebd12763d2b1d25069c5e5","observation_id":"27fea407-90ae-4867-a924-29b541458a28","resolution":{"observed_at":"2026-08-16T12:19:36.512477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-16T12:19:36.517413Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.517413Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:75d259197658a19ebec407e80d779bd54f66abec482d1d84c770e190fa47f573","observation_id":"830a7ec6-e930-45ed-9711-0f60cdbed056","resolution":{"observed_at":"2026-08-16T12:19:36.517413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-16T12:19:36.522967Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.522967Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6d516222b2ff5ec1603e93842b9613286c15ff2b965034040e962628254b734a","observation_id":"d3988dee-b4ee-4bf1-ad25-ca63bd140d40","resolution":{"observed_at":"2026-08-16T12:19:36.522967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T12:19:36.527507Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.527507Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:8b0232552d5d75bc27ff096624248f2ac1d6b7c76e36a87d9d145282dd6514b4","observation_id":"83d3b4f6-dbe0-4ad2-a728-7944bf161e53","resolution":{"observed_at":"2026-08-16T12:19:36.527507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T12:19:36.531929Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.531929Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:df9233416ab8a2b6ccabff5dc5a865d75acbb39946559f850aee5cb74b93c5e2","observation_id":"15a44779-8703-4016-99c9-c504bc4ec177","resolution":{"observed_at":"2026-08-16T12:19:36.531929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-19T08:26:06.209110Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-16T12:19:36.536792Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.536792Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:fcb5569dd03e92dc3ea23727c009164eaf31e4caac87885a594c9e20ee9910c7","observation_id":"6aa03cf5-150d-41a0-bfb9-9eb7bdf42f01","resolution":{"observed_at":"2026-08-16T12:19:36.536792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-16T12:19:36.541708Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.541708Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:12701446c6be9876be86f1f1590e2ecc83767add0224b203186b32eab25fd3d1","observation_id":"aa8098cc-cf6b-4254-ad36-9324668d7b77","resolution":{"observed_at":"2026-08-16T12:19:36.541708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15542","last_updated":"2024-08-28T05:34:14Z","snapshot_observed_at":"2026-08-16T13:23:18.747171Z","submitted_at":"2024-08-28T05:34:14Z","title":"Kangaroo: A Powerful Video-Language Model Supporting Long-context Video Input","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15542","snapshot_observed_at":"2026-08-16T12:19:36.546578Z","title":"Kangaroo: A powerful video-language model supporting long-context video input","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.546578Z"},"links":{"cited_paper":"/paper/2408.15542","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:f7dcff7f28cbd154b0af1c511cfe229faebbb5fb992a57d0219fb0e5a80129ee","observation_id":"c9767c1c-77f6-449e-8e2b-03b2b93abe5d","resolution":{"observed_at":"2026-08-16T12:19:36.546578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-16T12:19:36.552155Z","title":"Longvu: Spatiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.552155Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:620795f233d66edad75e6c232c91d4ee064d5a483be30a6db1ad2365476cb9d1","observation_id":"59e0e807-d82b-402a-842e-9e2b9a188f77","resolution":{"observed_at":"2026-08-16T12:19:36.552155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.557090Z","title":"Longvlm: Efficient long video understanding via large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.557090Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c1c4c169dc72fede56b3f740825e6502aa0931efb432b1b40a56307038ba9ce9","observation_id":"cf7b1ea1-0e59-4378-bfe5-814968b28754","resolution":{"observed_at":"2026-08-16T12:19:36.557090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10517","last_updated":"2024-03-15T17:57:52Z","snapshot_observed_at":"2026-08-16T14:09:21.368307Z","submitted_at":"2024-03-15T17:57:52Z","title":"VideoAgent: Long-form Video Understanding with Large Language Model as Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10517","snapshot_observed_at":"2026-08-16T12:19:36.561597Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.561597Z"},"links":{"cited_paper":"/paper/2403.10517","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:23d5ed1b21ff4cb4b27e3a464741708ebb2043bcbe094eb507a5cfebfb28d8fa","observation_id":"2e779e7f-4f47-466b-9110-9869485177f9","resolution":{"observed_at":"2026-08-16T12:19:36.561597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T12:19:36.566251Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.566251Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:038eb6c845bdd02ba7c510215646e0a227071ee90144efbc028da6e28594fa31","observation_id":"3c5dbe1b-4619-4bd7-a977-98491a6aab08","resolution":{"observed_at":"2026-08-16T12:19:36.566251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.570808Z","title":"Anymal: An efficient and scalable any-modality augmented language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.570808Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:74e92dc883988a646898461fc542790cae063b7057f7a577dd705f2cd05eea39","observation_id":"1fab2509-b331-4909-a6cc-0558d4851560","resolution":{"observed_at":"2026-08-16T12:19:36.570808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T12:19:36.575302Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.575302Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:0dc3ef0db7a7a2d3637595e54776d16147e4c53e7a924c5b86b54c81d1c33c18","observation_id":"000576c0-9e8e-48ab-b6e4-9586afe5f8b4","resolution":{"observed_at":"2026-08-16T12:19:36.575302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05222","last_updated":"2024-11-07T22:32:12Z","snapshot_observed_at":"2026-08-16T13:01:55.068590Z","submitted_at":"2024-11-07T22:32:12Z","title":"Don't Look Twice: Faster Video Transformers with Run-Length Tokenization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05222","snapshot_observed_at":"2026-08-16T12:19:36.579952Z","title":"Don’t look twice: Faster video transformers with run-length tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.579952Z"},"links":{"cited_paper":"/paper/2411.05222","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:379ef89ac17c56c1cc35434f71c93122e75deedc3ef015da346a3b39f69755a0","observation_id":"0c0bb014-6a46-406a-a79a-3156e534898d","resolution":{"observed_at":"2026-08-16T12:19:36.579952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.584792Z","title":"Gpt-4v(ision) system card, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.584792Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:9c9aa8128adc5bd86e51e54b111c753b9d58a85cc8c01d4ac8327a3372564041","observation_id":"d1862ffb-7313-4922-bce3-aaba6a4eda55","resolution":{"observed_at":"2026-08-16T12:19:36.584792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.590068Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.590068Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:00d42a91adab0b1f0637d2a1528312948394a23580aa04fabe76599571a0096d","observation_id":"338771fa-3acd-446f-bf72-03e0d55cbdb9","resolution":{"observed_at":"2026-08-16T12:19:36.590068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T12:19:36.595350Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.595350Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6e23922550181f3462e2e48451ba2197f5fd3604467b17bf13a45db4d7b98fe1","observation_id":"78f2af48-f529-42b6-9720-0c198ed5e422","resolution":{"observed_at":"2026-08-16T12:19:36.595350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T12:19:36.600023Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.600023Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:15a29de53f5c93d4f43fc6f181a17bb192ad73e145f66c70deb847cadf607d2c","observation_id":"940f928e-1b35-4234-b7db-4386b4679e9c","resolution":{"observed_at":"2026-08-16T12:19:36.600023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.604511Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.604511Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:91cdb4bdc7dae7847eeabc4649056ae62062906486e46f4e67b9fb1ab6696270","observation_id":"11900aaa-fc6c-4aa7-a5d1-174a2b804596","resolution":{"observed_at":"2026-08-16T12:19:36.604511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.609122Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.609122Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6deae271c972c9847b43e02032ffe4d587bc247ccc92c4e778b4fdb83e4c3e5a","observation_id":"f7c513db-7dfc-4a03-8fb9-0c44daddaa26","resolution":{"observed_at":"2026-08-16T12:19:36.609122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.613585Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.613585Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:0a13dd39e28c15aa7fe6eddc761db1932a4c49a287306e0cd5b82a81970e1a2a","observation_id":"1480b762-335e-4750-93ba-9af59537700a","resolution":{"observed_at":"2026-08-16T12:19:36.613585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.618270Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.618270Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:688481e9a5a9d960b6f8e4a6cfdef69753b887b9562d21d6f1cfce846814a301","observation_id":"a66b0859-6aa2-4deb-a6c8-7dbe8c9448bb","resolution":{"observed_at":"2026-08-16T12:19:36.618270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.623425Z","title":"Vizwiz: nearly real-time answers to visual questions","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.623425Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:ace4d5d4df7b7626ef7d551c898dbb25fc9ff698e431dbf6b2e3afe9412cc4f6","observation_id":"b8a069c1-855d-4703-92cf-de4b0b2154bd","resolution":{"observed_at":"2026-08-16T12:19:36.623425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-16T12:19:36.628596Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.628596Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:4628455ca92146667a31f6d8ff0877f42bae83592bbc810e439085c14d51e4c6","observation_id":"fec5040a-9dd1-4619-b2ac-7cee39082a1e","resolution":{"observed_at":"2026-08-16T12:19:36.628596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-18T03:16:44.825874Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-16T12:19:36.633434Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.633434Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:9a372c4d2e566fafca2cebb7f98b58ba21a6d5db99f8b1acb40477b310034d1c","observation_id":"f68a8351-1612-4a5a-87ae-24d735c84c96","resolution":{"observed_at":"2026-08-16T12:19:36.633434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-16T12:19:36.638288Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.638288Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:2b37a6e446dc25af866e4c5d26ba6b4b3486b2c14ca93cad15a29ca425f95236","observation_id":"c5d40bcc-f888-44b8-b6f0-c21f3066f810","resolution":{"observed_at":"2026-08-16T12:19:36.638288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.643074Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.643074Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:2bc5a6c468583019563f1a371b49a9cacaeeb07aa2f1fee5aeb2dbb920dbdecc","observation_id":"5b666324-d314-4bcb-9635-c0a985489d67","resolution":{"observed_at":"2026-08-16T12:19:36.643074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.648271Z","title":"Realworldqa benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.648271Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:a80986354a9dd119e709239848b79775646e7fab7b6e5e535aab11346a5d4e6f","observation_id":"524002db-2b40-4b4e-9d14-50f16a6f5e8a","resolution":{"observed_at":"2026-08-16T12:19:36.648271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-19T12:21:16.378825Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-16T12:19:36.653521Z","title":"Wildvision: Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.653521Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:3e54b24a9c9a60d2ba3ad930c8df7c17af2d3f982bd86741106e59d434f11526","observation_id":"11cfde4b-e409-404d-a7fc-9fa47b040793","resolution":{"observed_at":"2026-08-16T12:19:36.653521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-19T00:16:42.047230Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-16T12:19:36.658561Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.658561Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6eda6f9cc7ea573dba606022ef123f5c31ea1230accd4dda6822ab35d5f9e1fe","observation_id":"c2c25d4d-1d58-473a-98bd-914753cb556f","resolution":{"observed_at":"2026-08-16T12:19:36.658561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-19T13:30:10.420864Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-16T12:19:36.663697Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.663697Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:53b0bb9f41ae705f379f6c380945eb58b6921f00baf4e3dbcb6db58cce6c551d","observation_id":"369c0858-dd28-4ac2-9d44-11c325b56693","resolution":{"observed_at":"2026-08-16T12:19:36.663697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.668535Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.668535Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:b8028cadd20e503db9bd5aaf67ee986bc03160b6d789d7dd96b47eaa5e565c50","observation_id":"3f6672c5-1ff3-480b-a74f-fa1c8e916947","resolution":{"observed_at":"2026-08-16T12:19:36.668535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.673236Z","title":"Nocaps: Novel object captioning at scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.673236Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:67086d68df5eb6dd9755d7b9223c15c1cfbff208a6b197994ae00de579111d55","observation_id":"e1506e30-27c7-4c7b-bfb5-cc69f77f826d","resolution":{"observed_at":"2026-08-16T12:19:36.673236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.677990Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.677990Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c86893f18e42e707e2a6929dfeba00f782c9bf3398d4f879dd69d99562cc8cef","observation_id":"a73ebd77-8a9d-4c79-99f3-48a282097279","resolution":{"observed_at":"2026-08-16T12:19:36.677990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.682652Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.682652Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:21ffabdf7b9596dfd9a0beaf363f348de03c95d8d8d1e54736a550adc5feb26f","observation_id":"c714fac2-7c3c-4f18-bb3e-05cdaa8dee75","resolution":{"observed_at":"2026-08-16T12:19:36.682652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.687155Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.687155Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:2e605a78c6e1a4f397f9604e041601fb197e0efa3b2de3911b001b7237c4ef30","observation_id":"0d7a51e6-8026-4ef4-8dc2-1d0433f71800","resolution":{"observed_at":"2026-08-16T12:19:36.687155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21038","last_updated":"2024-07-19T20:55:06Z","snapshot_observed_at":"2026-08-19T08:31:13.153503Z","submitted_at":"2024-07-19T20:55:06Z","title":"Advancing Chart Question Answering with Robust Chart Component Recognition","version":1},"cited_work":{"arxiv_id":"2407.21038","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21038","snapshot_observed_at":"2026-08-16T12:19:38.532313Z","title":"Advancing Chart Question Answering with Robust Chart Component Recognition","venue":"cs.CL","work_id":"7181d7f3-4d17-4d96-9e05-ca940d6d86a2","year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.691634Z"},"links":{"cited_paper":"/paper/2407.21038","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:292848f1169de37bd08580388581ca688047d8ee33717f81c283d18e4f2c9cdb","observation_id":"4c43630a-20ec-4d84-a900-3e0e80d9c64f","resolution":{"observed_at":"2026-08-16T12:19:38.537693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.698287Z","title":"A diagram is worth a dozen images, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.698287Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:25e1a6bdd4732ec082ad461897a2d6667d07c8380a56e996a2f595d29c40f6e2","observation_id":"de527b50-6dbc-42b0-b065-316309f9b995","resolution":{"observed_at":"2026-08-16T12:19:36.698287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.702889Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.702889Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:4373785be37dc9b49303e528531918309c00c376db159fafe60e31af1b357d66","observation_id":"06f64dd8-f3d2-46e3-923f-499ee0a04cf9","resolution":{"observed_at":"2026-08-16T12:19:36.702889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.707440Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.707440Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:8f446b9452b72f963b212b9420e61ccbdf04153e0d055802807614bfcbbcf925","observation_id":"9be40560-095c-491e-9eea-0e5f9b3b3599","resolution":{"observed_at":"2026-08-16T12:19:36.707440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-16T12:19:36.712171Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.712171Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:22398e420de6971994420269b23514aefb2181878597cd94c31c027a7e892e3b","observation_id":"150637a6-f450-4ba0-88be-2bbf45db1a25","resolution":{"observed_at":"2026-08-16T12:19:36.712171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-16T13:39:20.937460Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-16T12:19:36.716754Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.716754Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:8179bd53effdeede68567647fa768d2778d54b9ad8ab03f948cb80b64a081b92","observation_id":"6bd37f51-f0fd-4f8b-8147-8f7e4cecb931","resolution":{"observed_at":"2026-08-16T12:19:36.716754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.722779Z","title":"From recognition to cognition: Visual commonsense reasoning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.722779Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:5b34cdc4c9d7925595779877292023d617463c6614385441845753c607327874","observation_id":"aceb6ef3-34d4-49b2-8196-2d1aea9d99f3","resolution":{"observed_at":"2026-08-16T12:19:36.722779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.727449Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.727449Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c245226fe8a179d73df706562594998810960ab6db7ccb7d788a877ee9d78d31","observation_id":"b70de624-4752-41e8-b45b-e32d1a8f81e0","resolution":{"observed_at":"2026-08-16T12:19:36.727449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.732217Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.732217Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:215febed242ddba592c8e5071286e4ad8eac575cbeab25b68ebe59adb2a97f97","observation_id":"4246225f-b79b-4929-995e-e7f9123c6bc3","resolution":{"observed_at":"2026-08-16T12:19:36.732217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-16T12:19:36.737233Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.737233Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:83c5bb62315f386a54d8ad47f03f17e29fe6d8b4c46daafa2b9c1c22562a6429","observation_id":"1f3ceeac-ffca-461d-8a67-d4095ac5b3b1","resolution":{"observed_at":"2026-08-16T12:19:36.737233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-16T12:19:36.742450Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.742450Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6c85457c3e46ecdf3281f671d30bb9fae05237847ea176a687a15005c8015a52","observation_id":"2ed44cf2-e708-48a7-b235-535dcb997b59","resolution":{"observed_at":"2026-08-16T12:19:36.742450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-17T23:37:39.032985Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-16T12:19:36.748237Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.748237Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:6c42387dbbe71b958382270c206739f69b7b5fcc89478edf3bbb9a9402dfef22","observation_id":"750f8264-b226-4935-b8ae-ca15a37c60bd","resolution":{"observed_at":"2026-08-16T12:19:36.748237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.752963Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.752963Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:b6cedcc8f7edfd60ed904854fede9fa625fb415a14d97024bda02bb45edb3cb1","observation_id":"8f746fb6-72f7-48a5-9544-af59859f16b3","resolution":{"observed_at":"2026-08-16T12:19:36.752963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.757707Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.757707Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c5248194da9b01efc6e38a48bab0b48a56b4f8a36562973b21c745f0bf008d5b","observation_id":"80f32b7c-508a-4a05-88fe-ca0109527ca1","resolution":{"observed_at":"2026-08-16T12:19:36.757707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-16T12:19:36.762319Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.762319Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:05a9dfe3e86ddef8ee537df73a0af32c04ef0661af41b68fed6032d16f3a9453","observation_id":"5822dbea-4472-43ad-af67-ebd6fc50fbd3","resolution":{"observed_at":"2026-08-16T12:19:36.762319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.767843Z","title":"Next-qa: Next phase of question-answering to explaining temporal actions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.767843Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:d96dacd02a29eea6e0ccb1d12eb314f59774832b897c837196ea7d767d14d310","observation_id":"a92d91a9-eed8-4b6e-bb55-8b476e87e987","resolution":{"observed_at":"2026-08-16T12:19:36.767843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.773067Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.773067Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:4ecf187469334455e30d18e1d1bb1cf9900678fdbe9a97974e25830aa87b7ea0","observation_id":"13d48eb5-8296-4901-9411-78349347a32b","resolution":{"observed_at":"2026-08-16T12:19:36.773067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.777598Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.777598Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:d7e4af01796eb34a6d08aeddd23eff69c3a872c8c0eeb29f67f0e41c293bdbc7","observation_id":"9d399e52-fd78-4879-af69-ec2ca6b00792","resolution":{"observed_at":"2026-08-16T12:19:36.777598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.782318Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.782318Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:d8259b313c1ebf3e7be8d31df067e6edb71f4ca0766405a9207c0197293ae933","observation_id":"b6c9ba23-dfd0-416a-86bc-897eb47a4de9","resolution":{"observed_at":"2026-08-16T12:19:36.782318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.786825Z","title":"Tgif-qa: Toward spatio- temporal reasoning in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.786825Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:f04e31be5f17bf9a0de5234783a6849b3db96654287e8173b3a4a07227386f99","observation_id":"c749c94c-1f2b-4c7f-9d96-db90b140502c","resolution":{"observed_at":"2026-08-16T12:19:36.786825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-08-14T18:32:30.931998Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-16T12:19:36.791298Z","title":"Tvqa: Localized, compositional video question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.791298Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:7eed75fb03f770338ac1b91da2352646656240223464d0f0dca029d693e4b277","observation_id":"950d872f-70aa-491e-ab8b-9a6241880bdd","resolution":{"observed_at":"2026-08-16T12:19:36.791298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T12:19:36.796176Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.796176Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:b9eb5968331223b076f77a1cfafe090c4b14f46b5c21ae5cbf060a7a4a5e2650","observation_id":"a16e8d0c-ca51-4034-9d34-8f68480ce1d5","resolution":{"observed_at":"2026-08-16T12:19:36.796176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.801127Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.801127Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:7c895b084e2f2510214abe4cf976f1fbea877cd2d877181fb3e30d0710ccf1f1","observation_id":"a8843b2a-2896-4094-b6ea-0a3e5c1062b1","resolution":{"observed_at":"2026-08-16T12:19:36.801127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-16T14:39:55.654977Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-16T12:19:36.805570Z","title":"Video- bench: A comprehensive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.805570Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:dc550cf17e8f4972995f5baa58b465b68a1d2eb6e9d3ebe0e5126b64f87a24ee","observation_id":"99046912-b16a-4197-9d4e-81770bcf636e","resolution":{"observed_at":"2026-08-16T12:19:36.805570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02763","last_updated":"2024-10-03T17:59:58Z","snapshot_observed_at":"2026-08-19T00:09:59.911458Z","submitted_at":"2024-10-03T17:59:58Z","title":"Vinoground: Scrutinizing LMMs over Dense Temporal Reasoning with Short Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02763","snapshot_observed_at":"2026-08-16T12:19:36.810695Z","title":"Vinoground: Scrutinizing lmms over dense temporal reasoning with short videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.810695Z"},"links":{"cited_paper":"/paper/2410.02763","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:22f35ca45055343cee46bf02c6b71d48a43f673dca677b85181ff9f473b9b72b","observation_id":"a6f04011-2e93-4114-a36c-edf06bd2dc7b","resolution":{"observed_at":"2026-08-16T12:19:36.810695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-08-20T09:26:58.158819Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-16T12:19:36.815801Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.815801Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:a7b11e444034e8c9652d3db4f396c235c988459054fe849ffaa360e07ae55511","observation_id":"bab3da26-6402-45d4-aecf-bf17ed42d31b","resolution":{"observed_at":"2026-08-16T12:19:36.815801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-16T13:10:47.063439Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-16T12:19:36.820475Z","title":"Tvbench: Redesigning video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.820475Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:94e139ab1128aaec4fb409a9425d3ba44472acef9bbeded5f479333922d296c4","observation_id":"eb4cdb90-95e4-4514-9f5a-af4e447517b5","resolution":{"observed_at":"2026-08-16T12:19:36.820475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.825402Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.825402Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:73d1fb9421e116ce9d0e2f1aea12efcea19ae87c61443c33e4fcfc06f6291b0d","observation_id":"e3cb6c5c-ddec-4d68-8ebf-7798c51c6767","resolution":{"observed_at":"2026-08-16T12:19:36.825402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.830109Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.830109Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:41d7bc1977f43e4354359783f0210fd4c44e8d7175cbe576f17fc0e3f00560e2","observation_id":"14823033-ad53-4c92-9094-18d84c93a1ae","resolution":{"observed_at":"2026-08-16T12:19:36.830109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.834759Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.834759Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:3316f507b59a796e519b096968e8ebe48d163dac499ca3dfa069a73ac96941f8","observation_id":"ab77670a-6332-4abf-91d1-a345d88ece21","resolution":{"observed_at":"2026-08-16T12:19:36.834759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.839341Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.839341Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:0e07d4a5eb75121f684a91a0b0fb50f36667098504027334da938018ba25c641","observation_id":"d279b101-bf4c-4bd8-94ac-18a0610e604d","resolution":{"observed_at":"2026-08-16T12:19:36.839341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.843968Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.843968Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:145092fe01836fc46b9a11095db6b7327c816bfd8cb6d696384a58d067559d3d","observation_id":"c503fa1c-0df3-4971-b880-a5973c11678d","resolution":{"observed_at":"2026-08-16T12:19:36.843968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-16T13:38:25.179414Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-16T12:19:36.848557Z","title":"Tarsier: Recipes for training and evaluating large video description models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.848557Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:85e5057bb9a5eb4241b28306b0f81beb2d26f8d421cf9ab4bc307c27f38a1dad","observation_id":"5bc87307-2b8a-4df9-b86e-d9a42f27b391","resolution":{"observed_at":"2026-08-16T12:19:36.848557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-16T13:12:45.748381Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-16T12:19:36.853647Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.853647Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:f39b83f5e38d69cca8184a1741f05a90d354bde240ed47f94afc423ed16a2ea4","observation_id":"24faaf20-db2e-40d4-8566-e87b52a3e902","resolution":{"observed_at":"2026-08-16T12:19:36.853647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-18T08:00:43.892091Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-16T12:19:36.859384Z","title":"Videohallucer: Evaluating intrinsic and extrinsic hallucinations in large video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.859384Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:94e96744bb554a3b352a63c1dd07515bb1b2a4288cba94c045b0bfd7dca06a04","observation_id":"39150a31-3698-4398-b3eb-dc88c042dacf","resolution":{"observed_at":"2026-08-16T12:19:36.859384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.864178Z","title":"Eventhallusion: Diagnosing event hallucinations in video llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.864178Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:31725d4352b1f1a71a81cd7edafc1303796a395e068e28c46c343bafd3193ee7","observation_id":"ec2fe659-1e9f-4afc-8c91-c673d2b17594","resolution":{"observed_at":"2026-08-16T12:19:36.864178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.868641Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.868641Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:a4a70bae27ea6f560446592ce752fca76ae39e64925a86bf852f480c570e94ea","observation_id":"22f2f325-5907-4713-8906-369d2cdd9d25","resolution":{"observed_at":"2026-08-16T12:19:36.868641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-17T14:14:30.066593Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-16T12:19:36.873240Z","title":"Cinepile: A long video question answering dataset and benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.873240Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:2ee9ce718b636bc8d62832e4f47ff8fef3ea3c7071a4a289663b81473014cd5b","observation_id":"5d9bd916-b723-42d8-add9-51debe881cef","resolution":{"observed_at":"2026-08-16T12:19:36.873240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-16T12:19:36.877967Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.877967Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:d68268464952a9f7d151b3a1b808d6fa92b8fe043776bfd8abd796dfcd4685fa","observation_id":"8f7aaed4-1cf8-4b8d-8b51-692555e12207","resolution":{"observed_at":"2026-08-16T12:19:36.877967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.882703Z","title":"Movieqa: Understanding stories in movies through question-answering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.882703Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:d9450b14533575f01b98d7797c47a82bd97350a34ecb6af45465d2f2b005f7ea","observation_id":"da3c861c-1a44-475d-9f38-e90afe065029","resolution":{"observed_at":"2026-08-16T12:19:36.882703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.887130Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding.Advances in Neural Information Processing Systems, 37:28828– 28857, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.887130Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:a8aa37c2644c67133668e36db4c382f9e9099b06c6a81ba3fa6a91d11a6b046f","observation_id":"2c6d55e2-6d24-42ea-b596-0d77650b80a5","resolution":{"observed_at":"2026-08-16T12:19:36.887130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:19:36.892235Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.892235Z"},"links":{"citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:06eec7ccd73b1aea8fe098d45b463f9db2f66ac364c486f79898297e0921b667","observation_id":"b0cc2070-28b6-4b01-a9d2-7f5f2fd686ac","resolution":{"observed_at":"2026-08-16T12:19:36.892235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-16T12:19:36.897692Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.897692Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c9a53fe165692705b2e5491b7f5c771096bbed8a15e3e6e12b43b2eec9892505","observation_id":"80e9632d-b4d5-4aaa-9e94-687a4322bdcf","resolution":{"observed_at":"2026-08-16T12:19:36.897692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-17T01:38:26.232918Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-16T12:19:36.902360Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.902360Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:c5968aba4838f566b7352fe00eaad29290eed65239a60ee3444d3d990edda673","observation_id":"e4cd5b5c-dcb8-464a-b26e-baa7c1ec1267","resolution":{"observed_at":"2026-08-16T12:19:36.902360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10360","last_updated":"2024-12-13T18:53:24Z","snapshot_observed_at":"2026-08-15T17:40:10.309874Z","submitted_at":"2024-12-13T18:53:24Z","title":"Apollo: An Exploration of Video Understanding in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10360","snapshot_observed_at":"2026-08-16T12:19:36.907103Z","title":"Apollo: An exploration of video understanding in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.907103Z"},"links":{"cited_paper":"/paper/2412.10360","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:a1ca36f6bb2bfc0e69390c088883bcc7c71b03c52afa687e89ab8529ee00ee01","observation_id":"d565190c-c7ad-4575-ad02-0d6476b5a4a0","resolution":{"observed_at":"2026-08-16T12:19:36.907103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-16T13:09:28.872428Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-16T12:19:36.911916Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.911916Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:1d5771389c7f5229440ac2a3b0383447d2b7c8d7689df60802c459966f8be0ab","observation_id":"9658c1c3-82cd-45bc-8251-b58c942b3496","resolution":{"observed_at":"2026-08-16T12:19:36.911916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-08-18T19:21:05.491159Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-16T12:19:36.917814Z","title":"Tomato: Assessing visual temporal reasoning capabilities in multimodal foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:36.917814Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2504.13180"},"observation_digest":"sha256:eaec2f23fb5818d64a38b2bb8760d7bd6752181c0c81a2a8aaf9507535a7e868","observation_id":"37b008b2-5910-4ab5-a082-1123a2b09afa","resolution":{"observed_at":"2026-08-16T12:19:36.917814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:09:47.854491Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":235},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 235 outbound references and 32 inbound Pith citation observations for arXiv:2504.13180."}