{"as_of":"2026-08-11T14:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f48a4f7bb7540da9943b9d4dd77433526491fe0f3da76d05430b677276c1bfe5","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T05:19:22.423762Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":78,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:18:36.456092Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:14eee9fb1601f8d849098054390ec4317a02627ba2fe509bdde6098fdc116575","observation_id":"edaf3815-d97d-40ae-83b6-143507c5c40f","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:b897c74661680678d1bafec232a0674f93197c76af6b938ddca12aed32df9b02","observation_id":"fcf13dd4-e536-4b33-b2be-418a60ae91cd","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-22T09:27:43.919941Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2412.14171"},"observation_digest":"sha256:9be75050d01212fc00260b675e6667714a213c1761a0889bbeb7747176480b56","observation_id":"7f8d7f30-ef47-4ce8-b292-ded9b4ed6754","resolution":{"observed_at":"2026-05-22T09:27:44.058528Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-11T11:18:36.456092Z","title":"A.; Hu, K.; Liu, S.; Zhang, Y.; Yang, J.; Li, C.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15650","last_updated":"2024-12-20T08:06:00Z","snapshot_observed_at":"2026-08-11T11:11:31.780440Z","submitted_at":"2024-12-20T08:06:00Z","title":"Beyond Human Data: Aligning Multimodal Large Language Models by Iterative Self-Evolution","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:36.456092Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2412.15650"},"observation_digest":"sha256:b605affe2fbc0f78894d0ef9b78696e2d4b607b52559236a694372fa8a36c85c","observation_id":"cf216f6b-b51c-4645-b2ec-7e950c3592e3","resolution":{"observed_at":"2026-08-11T11:18:36.456092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-11T11:09:13.599554Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-08-11T11:01:03.492003Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-11T11:09:13.599554Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2412.15838"},"observation_digest":"sha256:4e017e474a8f9ebd12fc9052db1dfefd973bb19ff487d27926340e629c8643de","observation_id":"6e6626fc-1f65-4b5d-9adc-9ceb86d3813c","resolution":{"observed_at":"2026-08-11T11:09:13.599554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-10T21:34:35.657096Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04568","last_updated":"2025-05-19T14:15:00Z","snapshot_observed_at":"2026-08-11T09:47:15.811386Z","submitted_at":"2025-01-08T15:32:12Z","title":"Feedback-Driven Vision-Language Alignment with Minimal Human Supervision","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-08-10T21:34:35.657096Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2501.04568"},"observation_digest":"sha256:e700ecc239e5af1723ffa2afc4d6423c402b840c696cb7fd8d3fb7a25fb48e14","observation_id":"31d738d5-6381-4128-8300-1446b21f4267","resolution":{"observed_at":"2026-08-10T21:34:35.657096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-10T18:53:21.329427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10967","last_updated":"2025-02-12T08:10:06Z","snapshot_observed_at":"2026-08-10T18:44:08.299248Z","submitted_at":"2025-01-19T07:00:46Z","title":"Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T18:53:21.329427Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2501.10967"},"observation_digest":"sha256:890bea707a314440e4325e994b87dc02c7e321fc6bebbe66ab2cbe1ddfa71852","observation_id":"86ea2dec-3ff0-4369-8491-984c2e3211bb","resolution":{"observed_at":"2026-08-10T18:53:21.329427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:28c782741c0e842a12b0f9fc884ff7ef77566b8479a9570bf927a395a0dcd15e","observation_id":"8525a6ab-88cd-4869-90a4-a9bd1a23a7bd","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-10T15:35:30.301738Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.301738Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:2f8bced25c97e5884b5c5b8af72737aef9b9b04240a6517a6d2ebc8a5b01b473","observation_id":"5b9854d1-d8a6-4e5e-b9a3-3af0b15ddcbb","resolution":{"observed_at":"2026-08-10T15:35:30.301738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-09T19:46:19.974377Z","title":"A., Hu, K., Liu, S., Zhang, Y ., Yang, J., Li, C., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00241","last_updated":"2026-06-16T02:11:50Z","snapshot_observed_at":"2026-08-09T21:52:32.849041Z","submitted_at":"2025-02-01T00:41:29Z","title":"Mordal: Automated Pretrained Model Selection for Vision Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T19:46:19.974377Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2502.00241"},"observation_digest":"sha256:ad0174eab78ef57d323cb23c98b11f086a615469eebc37f79accb9ec9f7219ac","observation_id":"22a8c01b-60d0-4d79-9f99-e02db2c23309","resolution":{"observed_at":"2026-08-09T19:46:19.974377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-08T14:25:56.014437Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:56.014437Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:141fc03d1f5e86fe150ce3a09879899828d443ea85a16f8c78ca649638fef264","observation_id":"6dde0cbd-6c00-4a84-a005-0ae1a1f197c0","resolution":{"observed_at":"2026-08-08T14:25:56.014437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T22:43:59.496502Z","title":"A., Hu, K., Liu, S., Zhang, Y., Yang, J., Li, C., and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09093","last_updated":"2025-02-13T09:04:28Z","snapshot_observed_at":"2026-08-09T14:14:17.759366Z","submitted_at":"2025-02-13T09:04:28Z","title":"From Visuals to Vocabulary: Establishing Equivalence Between Image and Text Token Through Autoregressive Pre-training in MLLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T22:43:59.496502Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2502.09093"},"observation_digest":"sha256:03a855589319552cf92a625c732196c86e084fb10cae28f7447fa1ac78cb1f2a","observation_id":"ace4d7a1-6410-4a39-b4fc-15bec714d7f4","resolution":{"observed_at":"2026-08-07T22:43:59.496502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T20:06:00.974895Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09927","last_updated":"2025-02-14T05:36:32Z","snapshot_observed_at":"2026-08-10T18:50:32.127116Z","submitted_at":"2025-02-14T05:36:32Z","title":"Granite Vision: a lightweight, open-source multimodal model for enterprise Intelligence","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-07T20:06:00.974895Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2502.09927"},"observation_digest":"sha256:56bc7e55de5205112dd2f9bb74d5729ad10f25b62c06466dbb8fbe17d66cf471","observation_id":"c1624128-ec7a-482d-8661-7f01e487293e","resolution":{"observed_at":"2026-08-07T20:06:00.974895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:3a1820789895655dc0893d6a96e69100eb23b94076c7ccd7508d1a74dc1fdc86","observation_id":"9959d856-1575-44aa-aef0-cd26b4beca69","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T15:20:48.289056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.289056Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:3676a5268724de16cf1d761a82860f075a4c6edf113350487b5c0ff8d9065291","observation_id":"cdfe6a61-b8c6-4b66-8526-ef453138e929","resolution":{"observed_at":"2026-08-07T15:20:48.289056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T15:09:02.207599Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.207599Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:490773169414c1df4b72429f9d53d13d572cb959d967f17cee7e8d8f83a796ce","observation_id":"a1a68158-024f-4428-8b46-b41501f1b8a0","resolution":{"observed_at":"2026-08-07T15:09:02.207599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:e9135712a4d13d3c3f57aa75ef678f1ec139c13d209a367f626d320f818933d9","observation_id":"541fab43-345b-4c5e-af52-0c0dcbfe5899","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T14:27:45.026613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18855","last_updated":"2025-05-24T20:09:04Z","snapshot_observed_at":"2026-08-09T21:52:56.657385Z","submitted_at":"2025-05-24T20:09:04Z","title":"Inference Compute-Optimal Video Vision Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:27:45.026613Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.18855"},"observation_digest":"sha256:55c3aecd3784b22af63595aa6812c50d08c84884e71b245313a941952fa1f55d","observation_id":"665b20c0-642a-4749-adce-bb09dbca8641","resolution":{"observed_at":"2026-08-07T14:27:45.026613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T14:08:10.490334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-10T18:54:11.396770Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:10.490334Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:2439a40316e9766a95af1045edbbf20af336bdd853d2e4ba7e782aa229c3bd90","observation_id":"94ea1965-e3a7-4fd4-9eec-5b6d1d628f21","resolution":{"observed_at":"2026-08-07T14:08:10.490334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T13:33:58.047950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21465","last_updated":"2025-05-27T17:36:23Z","snapshot_observed_at":"2026-08-07T16:43:25.522882Z","submitted_at":"2025-05-27T17:36:23Z","title":"ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:58.047950Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.21465"},"observation_digest":"sha256:ba9437c4f7c613c6ecdce5ecf4915a8f93932418616c8a4b84f255be871a9492","observation_id":"b4a2bfdf-d0be-4e4b-bf84-6059ee7d55e2","resolution":{"observed_at":"2026-08-07T13:33:58.047950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T13:10:45.965589Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22457","last_updated":"2025-05-28T15:13:34Z","snapshot_observed_at":"2026-08-09T21:52:56.063992Z","submitted_at":"2025-05-28T15:13:34Z","title":"Fostering Video Reasoning via Next-Event Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:45.965589Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.22457"},"observation_digest":"sha256:bc6c2d7af0ac5b307e79ca327e1b23938bcd2240f814a7e7cc7edfeaabd21633","observation_id":"154b2e67-dfd9-49d3-8247-306637013fb2","resolution":{"observed_at":"2026-08-07T13:10:45.965589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:52:43.377377Z","title":"LMMs-Eval: Reality check on the evaluation of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23308","last_updated":"2025-05-29T10:06:48Z","snapshot_observed_at":"2026-08-07T21:49:28.223898Z","submitted_at":"2025-05-29T10:06:48Z","title":"Spoken question answering for visual queries","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.377377Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.23308"},"observation_digest":"sha256:2e4ed802fb33b80d152eb9e110cda9ec61c10a7aed8b381917a7ff2305fde0ff","observation_id":"c1de9b23-f463-4c5c-a580-d41614ee40de","resolution":{"observed_at":"2026-08-07T12:52:43.377377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:37:50.123928Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-09T00:48:58.339159Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.123928Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:49bce17ee58782e2cbeb99dc245e03b464eeb28e4854acdb78c50464ce09e50e","observation_id":"cb348a27-c885-4a0a-9667-9fb0ed96adda","resolution":{"observed_at":"2026-08-07T12:37:50.123928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:19:33.786626Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-10T23:34:59.915060Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:33.786626Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:4793c60dd710fa69e9e4bcd2c7026ee10e3e679fc53509c597189ec122bfc294","observation_id":"743b0234-2b6f-4c89-a45c-ca3607796007","resolution":{"observed_at":"2026-08-07T12:19:33.786626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T12:09:10.660378Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:10.660378Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:104b8d3434add5f613cb898ed143b194f32ef734ba7164cf12b0c36557efb11d","observation_id":"f780789c-d041-484f-bd98-f944e3e6b659","resolution":{"observed_at":"2026-08-07T12:09:10.660378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T11:59:10.390042Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.390042Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:3da2bdca981f8b01d7fc563889bf01c4196535335b1fcf3acb8b3c01849956ba","observation_id":"8826dfff-bcbe-4a51-859c-962a6a42fd2b","resolution":{"observed_at":"2026-08-07T11:59:10.390042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T11:04:14.284762Z","title":"Zhang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-10T00:26:12.133363Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:04:14.284762Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.03569"},"observation_digest":"sha256:b411ec4baa2fb3165864c6b89501fa1470a0f0752148dd1bd0c0f1b9afcc822a","observation_id":"399f54ee-1809-460e-a0d9-df04827b9876","resolution":{"observed_at":"2026-08-07T11:04:14.284762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:56:05.407052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.407052Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ac72b8622d55f1401fd40c03d677cf7e64c91ac3f0e011029642bb3e00cd683d","observation_id":"29db3ad9-d287-4e59-8754-7cbb96c444d0","resolution":{"observed_at":"2026-08-07T10:56:05.407052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:25:36.338942Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-07T23:48:12.277994Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.338942Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:2a5005aa64879b3392d2f1f223d0e9a735a08afdd2be1762bce4ae3117c6230d","observation_id":"1b5cad25-5993-4d34-a0d1-5e6058d88cee","resolution":{"observed_at":"2026-08-07T10:25:36.338942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:50:53.641537Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05414","last_updated":"2025-06-04T19:11:20Z","snapshot_observed_at":"2026-08-09T06:09:58.091457Z","submitted_at":"2025-06-04T19:11:20Z","title":"SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:53.641537Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.05414"},"observation_digest":"sha256:621cdf0296351ecf77e110ed0535fb20ffe76a3ef7a9005685bb3bcd1b6e4a48","observation_id":"aa89350e-5ea6-4487-b41b-6fccf2ed5fd6","resolution":{"observed_at":"2026-08-07T10:50:53.641537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2506.06856","last_updated":"2026-05-06T17:36:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-07T16:37:46Z","title":"Vision-EKIPL: External Knowledge-Infused Policy Learning for Visual Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-19T10:34:48.849524Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.06856"},"observation_digest":"sha256:99a03879d17991334c2a748ffcf3cb7ba1cfd4b6649d87da0b2475e1ed100777","observation_id":"e976c28f-cb3f-4be5-afc5-2c4129af7882","resolution":{"observed_at":"2026-05-19T10:37:14.950898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T05:14:45.044853Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09081","last_updated":"2025-07-28T19:31:25Z","snapshot_observed_at":"2026-08-09T21:52:44.527128Z","submitted_at":"2025-06-10T04:19:02Z","title":"FlagEvalMM: A Flexible Framework for Comprehensive Multimodal Model Evaluation","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.044853Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.09081"},"observation_digest":"sha256:0ca2cc62d82daa24607a9597250a3673fd0c2cc31c019d949631e8d643d24d16","observation_id":"0b2d9593-f06e-45e2-a843-0a5d394ef7e1","resolution":{"observed_at":"2026-08-07T05:14:45.044853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T00:33:50.471804Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.09985"},"observation_digest":"sha256:1c8543c758723526d414da14d505012e779ba67a0340d2eaa877b2d85dc12a81","observation_id":"15bd45bc-a1b8-4c77-8dd8-83626e44a128","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T04:08:41.016343Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-11T00:20:44.418480Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:41.016343Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:f1293f0f577c6e9dab97510330271674b8258d424439385afbf51d0a0c1597f5","observation_id":"1b0053e0-2ad7-40d6-9e37-341dea810c36","resolution":{"observed_at":"2026-08-07T04:08:41.016343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:4396b93132b8dd2c0252a0e34bc85c01016e4ee037a55958c79ca831464ef7dd","observation_id":"842f749f-59b3-4d5a-96e5-45f2ff031e20","resolution":{"observed_at":"2026-05-19T09:12:14.504288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T00:42:53.728937Z","title":"A.; Hu, K.; Liu, S.; Zhang, Y.; Yang, J.; Li, C.; and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13166","last_updated":"2025-06-16T07:21:11Z","snapshot_observed_at":"2026-08-08T08:38:39.497266Z","submitted_at":"2025-06-16T07:21:11Z","title":"GreedyPrune: Retenting Critical Visual Token Set for Large Vision Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T00:42:53.728937Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.13166"},"observation_digest":"sha256:701bf728300477a884e3e7078679bb901ff7903e4e645a03c7c593248d75b61f","observation_id":"1805c7fa-a03b-4a40-92f1-0c7d95361a3f","resolution":{"observed_at":"2026-08-07T00:42:53.728937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T23:42:13.967404Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models.arXiv preprint arXiv:2407.12772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-11T00:54:41.191381Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.967404Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:fb3d83b446fdf5595b0fe7070b14236a6094ccfbd5284fc745a3affdb65927f3","observation_id":"ed01f621-792c-4699-afb1-f54e0c1f7f6d","resolution":{"observed_at":"2026-08-06T23:42:13.967404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T15:27:04.228144Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.20670"},"observation_digest":"sha256:dff537a8b1a0bcc1b7cddd91f75025efcb2171c912aa1afe4ee385b6a419476c","observation_id":"3ca77f38-1b04-454e-b51f-3d1e2a2bf5e2","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T22:15:04.686714Z","title":"Lmms-eval: Re- ality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.686714Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:101b7806f71b7b9992ddfe31fc97c437bc669f273c3d0c14c65f151fcbebae7c","observation_id":"5d985fbf-4b73-481f-b255-2b737e68829e","resolution":{"observed_at":"2026-08-06T22:15:04.686714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T16:34:00.823567Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-10T11:05:10.491989Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:00.823567Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:04cca014a414ff813add90dacaa4130b109a0f1cd2850203e7bf8b4d8428174c","observation_id":"94ef0cc7-fe5a-4dab-97df-7275881dcd82","resolution":{"observed_at":"2026-08-06T16:34:00.823567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T15:38:45.376369Z","title":"A.; Hu, K.; Liu, S.; Zhang, Y.; Yang, J.; Li, C.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15428","last_updated":"2025-07-21T09:27:45Z","snapshot_observed_at":"2026-08-08T22:42:41.641573Z","submitted_at":"2025-07-21T09:27:45Z","title":"EgoPrune: Efficient Token Pruning for Egomotion Video Reasoning in Embodied Agent","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:38:45.376369Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2507.15428"},"observation_digest":"sha256:c557bf8b856b02f0872cc499617d78b2c0863c0290ad658f50f2761d32e5c998","observation_id":"20eedbe1-69b8-46a6-adc3-00dd90e4df93","resolution":{"observed_at":"2026-08-06T15:38:45.376369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T14:19:39.360265Z","title":"Lmms-eval: Reality check on the evalua- tion of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:39.360265Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:55db6fcd0dc04c77c01add3bb6a32c7d02a23416bef6490ff48e9e660a5993fa","observation_id":"99f4e4f6-d6ea-447e-b0c2-7f198124978f","resolution":{"observed_at":"2026-08-06T14:19:39.360265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-06T05:37:35.543694Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01548","last_updated":"2025-08-03T02:15:43Z","snapshot_observed_at":"2026-08-08T11:58:42.307183Z","submitted_at":"2025-08-03T02:15:43Z","title":"A Glimpse to Compress: Dynamic Visual Token Pruning for Large Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:37:35.543694Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2508.01548"},"observation_digest":"sha256:6daba25e0d4af27b16bd6aefac475f752dd8dbdcd3b8bce748c7c275f239adf7","observation_id":"932c4614-d28b-4ef2-a0e8-434d0e20d706","resolution":{"observed_at":"2026-08-06T05:37:35.543694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2508.06038","last_updated":"2026-05-18T14:51:17Z","snapshot_observed_at":"2026-08-02T14:57:47.919020Z","submitted_at":"2025-08-08T05:49:42Z","title":"Fourier Compressor: Frequency-Domain Visual Token Compression for Vision-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T22:40:39.892802Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2508.06038"},"observation_digest":"sha256:270d2456982ab3795e8eca10a865654084c69c4ef20fe0aae95b7ed46106ca57","observation_id":"76b552cb-916f-41ca-8550-ba8edc57693f","resolution":{"observed_at":"2026-05-21T22:40:43.085060Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-04T13:27:58.447481Z","title":"Mllms know where to look: Training-free perception of small visual details with multimodal llms.ICLR, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-10T21:44:39.000633Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:58.447481Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:b3733de6b08b6265239041d7c68f6ddd1d555ec805837b26935ae53415f05023","observation_id":"63e2b82f-acc5-4c00-8289-ba68f89b3760","resolution":{"observed_at":"2026-08-04T13:27:58.447481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-04T08:44:42.346164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.19496","last_updated":"2026-05-31T09:39:34Z","snapshot_observed_at":"2026-08-05T03:14:18.623813Z","submitted_at":"2025-10-22T11:44:31Z","title":"CARES: Context-Aware Resolution Selector for VLMs","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T08:44:42.346164Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2510.19496"},"observation_digest":"sha256:5c338c16e76b4fefe154b98edd6e0c646f79701137074fbedd30a12a07e32611","observation_id":"bf9bcb6f-9776-4003-bce1-4caf79ab00a9","resolution":{"observed_at":"2026-08-04T08:44:42.346164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-04T08:15:59.137719Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.21978","last_updated":"2026-06-18T16:29:38Z","snapshot_observed_at":"2026-08-09T00:06:37.608642Z","submitted_at":"2025-10-24T19:08:48Z","title":"Beyond Reasoning Gains: Mitigating General-Capability Forgetting in Large Reasoning Models","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-04T08:15:59.137719Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2510.21978"},"observation_digest":"sha256:29a7a4495ba1a296966a50b9bf6c0bd32fd661e49b44dc97677fb482667fa9d1","observation_id":"28787986-459a-4880-a23e-3f02b73298fa","resolution":{"observed_at":"2026-08-04T08:15:59.137719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-02T18:23:40.241140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.12262","last_updated":"2026-07-17T07:23:56Z","snapshot_observed_at":"2026-08-09T09:42:44.258435Z","submitted_at":"2026-03-12T17:59:51Z","title":"Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T18:23:40.241140Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2603.12262"},"observation_digest":"sha256:d7272e86e19ec0e7c2705b808bd0b49750285e7ba810768ff4902a22a214bd2c","observation_id":"c767cd13-4442-4d46-b57d-9660c9126f67","resolution":{"observed_at":"2026-08-02T18:23:40.241140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2604.04500","last_updated":"2026-04-06T07:51:59Z","snapshot_observed_at":"2026-07-30T06:32:02.248567Z","submitted_at":"2026-04-06T07:51:59Z","title":"Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T19:59:19.379119Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2604.04500"},"observation_digest":"sha256:95aa507b49e5c09c145eaa7b19d666b19f4f6869ba769cf08188dce1342e5229","observation_id":"7105cd42-cab5-4b37-be49-c3e4845aee6e","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2604.06912","last_updated":"2026-04-08T10:12:30Z","snapshot_observed_at":"2026-08-04T18:58:19.981225Z","submitted_at":"2026-04-08T10:12:30Z","title":"Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T18:46:26.869644Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2604.06912"},"observation_digest":"sha256:0291437e9a5c0011d17f47e8f4f5b0649a260efa8388311b1f39225047bb07e9","observation_id":"a8e958b3-6d7f-43fb-b5f6-152514e0a3a3","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:1d9bd3c41fdc413f74240cbf480a54dd39cfa2f45f7c169dd65fae5b11f37f88","observation_id":"021f215b-5ac0-45ff-8bbe-e86e3050de45","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2604.21343","last_updated":"2026-08-04T21:50:05Z","snapshot_observed_at":"2026-08-08T23:09:28.589207Z","submitted_at":"2026-04-23T06:58:08Z","title":"Latent Denoising Improves Visual Alignment in Large Multimodal Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-09T23:07:54.806529Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2604.21343"},"observation_digest":"sha256:c63c542a996df80b5c8c0e57666212e7d19cca3b08994bb70074eeb8629b2a59","observation_id":"2b15b9c2-f787-4df8-89e7-779273ebab8d","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.00789","last_updated":"2026-05-01T17:11:39Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-05-01T17:11:39Z","title":"Make Your LVLM KV Cache More Lightweight","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-09T19:04:48.058450Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.00789"},"observation_digest":"sha256:e326b346b83966cfaa6e97a9ce17abefe9b181e344290723ce3c521488ba91f2","observation_id":"26688c78-7c09-4b62-989d-fbb5ea9ea4f3","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.05225","last_updated":"2026-06-05T13:47:55Z","snapshot_observed_at":"2026-08-02T06:50:35.896043Z","submitted_at":"2026-04-19T07:25:39Z","title":"MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-11T01:29:26.298131Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.05225"},"observation_digest":"sha256:a2b7da1568ee62b35add4e2b3ff22e407179ac406b5ea5e5f866f5dbfc6e18e4","observation_id":"bf4e9218-4dad-4245-9199-d5f63af42156","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.07355","last_updated":"2026-05-08T07:08:54Z","snapshot_observed_at":"2026-08-10T21:26:10.490587Z","submitted_at":"2026-05-08T07:08:54Z","title":"TTF: Temporal Token Fusion for Efficient Video-Language Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-11T01:55:32.319344Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.07355"},"observation_digest":"sha256:cabf96f6a3e391c43814eb2cd5270b2c0027b55b95b80856fd304d274ba5f6d3","observation_id":"cf12b96f-50c3-4149-9f93-35282714eba7","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.09649","last_updated":"2026-05-10T16:47:50Z","snapshot_observed_at":"2026-07-06T23:21:44.900680Z","submitted_at":"2026-05-10T16:47:50Z","title":"Make Each Token Count: Towards Improving Long-Context Performance with KV Cache Eviction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T05:02:25.513351Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.09649"},"observation_digest":"sha256:7cae87e4302c8bba2724bdcb0694265c2084ba297b4370971de9b2ce64c999cb","observation_id":"b425d45b-25d9-4bef-9270-e7c6144f21a2","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.11477","last_updated":"2026-05-12T03:45:11Z","snapshot_observed_at":"2026-08-11T08:47:04.831847Z","submitted_at":"2026-05-12T03:45:11Z","title":"LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T03:20:42.684286Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.11477"},"observation_digest":"sha256:4eb9a72c50e10bdbbdaa353d83248ee2faf97f02bd0c625db58e791be2f0c912","observation_id":"2e62e037-cf04-4ccb-a348-883acdead27f","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-08-11T09:26:13.392012Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T02:14:59.487486Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:f12cdf02658b7ab8578f54e1ad18cdc50ec48f53785378ab5baef091fdf30482","observation_id":"d05303f5-c25a-488e-a908-46996715e73e","resolution":{"observed_at":"2026-05-17T05:19:22.513527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.14530","last_updated":"2026-05-19T00:58:43Z","snapshot_observed_at":"2026-08-11T09:26:13.392012Z","submitted_at":"2026-05-14T08:11:32Z","title":"Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T21:47:32.112057Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.14530"},"observation_digest":"sha256:551beb9e7e658ee05f6265de0362837e8bbf3f9a123f857a919ecf9ee23b50b4","observation_id":"e017fd1d-6aff-4637-954b-26390dba5d66","resolution":{"observed_at":"2026-05-20T21:49:05.337919Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.17093","last_updated":"2026-05-16T17:33:24Z","snapshot_observed_at":"2026-08-02T15:06:51.029252Z","submitted_at":"2026-05-16T17:33:24Z","title":"HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T15:37:09.899037Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.17093"},"observation_digest":"sha256:eb2617c502675a2fdd194897d04e23bdc3ead4493d6d00edc54293a65912e0e4","observation_id":"7988e842-18e9-4f63-b1ae-ed6ec22bf443","resolution":{"observed_at":"2026-05-20T15:38:26.650745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.24019","last_updated":"2026-05-20T06:11:25Z","snapshot_observed_at":"2026-07-06T23:34:08.786038Z","submitted_at":"2026-05-20T06:11:25Z","title":"MGVQ: Synergizing Multi-dimensional Sensitivity-Aware and Gradient-Hessian Fusion for Vector Quantization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T17:36:45.807397Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.24019"},"observation_digest":"sha256:320da18114eefdcbbfa084a653c6b0ed914cb82b0ff5cd115172cb2bc829f500","observation_id":"9027b91b-4234-4f59-8c08-7ef4be21959f","resolution":{"observed_at":"2026-07-01T15:05:48.308600Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2605.30010","last_updated":"2026-05-28T14:36:44Z","snapshot_observed_at":"2026-08-02T23:58:30.012302Z","submitted_at":"2026-05-28T14:36:44Z","title":"EarlyTom: Early Token Compression Completes Fast Video Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:02.536341Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2605.30010"},"observation_digest":"sha256:096c93c134f13f369c9778959fde995922bdd030118b616868568e13e68d2a5a","observation_id":"7554c83d-76c5-4e2f-b847-a6e4214fc8af","resolution":{"observed_at":"2026-06-29T08:23:15.627356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.03089","last_updated":"2026-06-16T07:22:07Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:17:56Z","title":"Constitutional On-Policy Safe Distillation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T11:47:14.135793Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.03089"},"observation_digest":"sha256:b82017dc7f5135ca0c29d7366cf4f5588d1537d7dde58a05852a946b65b07a53","observation_id":"b0d9029e-a6ab-4bb5-8edb-ee27f65f0453","resolution":{"observed_at":"2026-07-02T01:36:25.475965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.03920","last_updated":"2026-06-02T17:12:05Z","snapshot_observed_at":"2026-08-02T12:14:20.077142Z","submitted_at":"2026-06-02T17:12:05Z","title":"Benchmarking Visual State Tracking in Multimodal Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T10:43:06.811228Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.03920"},"observation_digest":"sha256:4d0f1bd73c8d33bc2bfa14aa8f8dc6ae02ab00471b4577471de477e3007cb1b0","observation_id":"b0c5ba65-a2a4-4f37-85f6-555d4489fb76","resolution":{"observed_at":"2026-07-02T02:46:27.940892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:d497275561d9ad8ce8d11cd62f272c173745b2515d1c38ef4f6d67364224f23a","observation_id":"25dea9a0-2b8d-43d4-bc26-20d6e5324640","resolution":{"observed_at":"2026-07-02T16:27:09.395340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.08952","last_updated":"2026-06-08T02:55:05Z","snapshot_observed_at":"2026-08-09T18:31:01.297970Z","submitted_at":"2026-06-08T02:55:05Z","title":"AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T17:08:22.609095Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.08952"},"observation_digest":"sha256:9694364d2e26724b9efb2e53a831bf63d36e5527afa7be5db9a3b2693ca6700e","observation_id":"f58c7104-7043-41d5-b609-a74fcb6bb294","resolution":{"observed_at":"2026-07-03T00:27:29.711529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-07-14T18:07:09.018997Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-07-14T18:07:09.018997Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.11324"},"observation_digest":"sha256:996739580fb2cefa3ee0c5aeca3202d4d2bd50765fe848867203f685e08e2f57","observation_id":"513f496d-5795-4876-94d8-c4824a7a44ef","resolution":{"observed_at":"2026-07-14T18:07:09.018997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.12300","last_updated":"2026-06-10T16:35:04Z","snapshot_observed_at":"2026-07-06T23:51:13.191639Z","submitted_at":"2026-06-10T16:35:04Z","title":"Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T10:01:09.933880Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.12300"},"observation_digest":"sha256:02a98127f47f388498cba2ecfff927386c38c007d8db8951d9dcc63776d25fcc","observation_id":"3b30af51-9153-4c97-b9f3-d65627d76d8b","resolution":{"observed_at":"2026-07-03T10:27:56.654197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.17574","last_updated":"2026-06-16T06:22:09Z","snapshot_observed_at":"2026-08-02T05:34:30.444420Z","submitted_at":"2026-06-16T06:22:09Z","title":"DeepInsight: A Unified Evaluation Infrastructure Across the Physical AI Stack","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T01:28:59.297634Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.17574"},"observation_digest":"sha256:580ee0d065b209d7eb899f4fb668bf418ebe4dbb3ff24534e9402b18e3aae30e","observation_id":"d84ed359-c4f1-4ecf-b189-b9f9f51441fe","resolution":{"observed_at":"2026-07-03T20:18:56.562509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.18273","last_updated":"2026-06-05T11:38:30Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-05T11:38:30Z","title":"Continuous Audio Thinking for Large Audio Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T21:52:49.839901Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.18273"},"observation_digest":"sha256:0e207ba229333ac568609f22097af2f91f6359e2247b9f52ff8e2db4b70d4d69","observation_id":"ea526200-d7d3-4e92-ab09-a14509d6a1b8","resolution":{"observed_at":"2026-07-02T17:47:18.020004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2606.20419","last_updated":"2026-06-18T16:03:26Z","snapshot_observed_at":"2026-08-07T12:52:25.605649Z","submitted_at":"2026-06-18T16:03:26Z","title":"Spectral Query-Key Product Weight Steering for Training-Free VLM Hallucination Mitigation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T18:14:49.763342Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2606.20419"},"observation_digest":"sha256:b7251c18d9eace165a0104c1e3bacd0e823f7d1ea094ee35c9958ec7da50ff17","observation_id":"9dade975-ceed-40d6-bbad-1505b43310fe","resolution":{"observed_at":"2026-07-04T03:19:30.594837Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.12772","doi":"10.48550/arxiv.2407.12772","metadata_source":"pith","pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","venue":"cs.CL","work_id":"257da118-790b-4686-87d7-92321d7e1ae0","year":2024},"citing_paper":{"arxiv_id":"2607.02484","last_updated":"2026-07-02T17:50:57Z","snapshot_observed_at":"2026-07-07T00:07:56.573640Z","submitted_at":"2026-07-02T17:50:57Z","title":"Combating Textual Noise and Redundancy: Entropy-Aware Dense Visual Token Pruning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-03T14:47:35.377391Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.02484"},"observation_digest":"sha256:3bd4dd12e8895a74bdabad60ed2fdc61e57d778ae33c61ced4f0b7682d5324e9","observation_id":"f951c9da-9086-4aab-ad72-8ca7c16096a0","resolution":{"observed_at":"2026-07-03T14:48:32.411859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2407.12772 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:3cf953b08f4d161f6b57ea1e49592bf109f00c6c87ce6187c0b9f796f34dda52","observation_id":"cc30a3b0-f8c9-4a67-a617-7fb151d37661","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-07-11T08:59:46.244502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05089","last_updated":"2026-07-06T13:50:15Z","snapshot_observed_at":"2026-07-11T08:59:45.751461Z","submitted_at":"2026-07-06T13:50:15Z","title":"TimeThink: Reasoning with Time for Video LLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T08:59:46.244502Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.05089"},"observation_digest":"sha256:fb4c8b0208fdad4943196db8802862084f318c552fc0ad8085ffe28c52643cd5","observation_id":"a9d82b80-c7ac-41c8-8d1e-595ae626c567","resolution":{"observed_at":"2026-07-11T08:59:46.244502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-07-13T02:39:58.984385Z","title":"arXiv:2407.12772 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09488","last_updated":"2026-07-10T15:05:21Z","snapshot_observed_at":"2026-08-06T01:56:09.982388Z","submitted_at":"2026-07-10T15:05:21Z","title":"SigLIP-HD by Fine-to-Coarse Supervision","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-13T02:39:58.984385Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.09488"},"observation_digest":"sha256:c79fee10c5d229da7fa0bb26e33544bcea6a8ec2791b9d9aa49ae5818fd3d53d","observation_id":"ff51fd54-0a23-4d99-b4b1-10d00fe0095c","resolution":{"observed_at":"2026-07-13T02:39:58.984385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-01T07:15:04.870137Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21552","last_updated":"2026-07-23T17:35:56Z","snapshot_observed_at":"2026-08-07T05:31:06.665189Z","submitted_at":"2026-07-23T17:35:56Z","title":"MIRROR: Learning from the Other View for Multi-Modal Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T07:15:04.870137Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.21552"},"observation_digest":"sha256:8de4cf5f38bbec023a3c2f1d4959eb296ae0a8fb4860588233751a42b0e00f00","observation_id":"5c055d66-f9a4-428b-9b63-1a7351e0fd91","resolution":{"observed_at":"2026-08-01T07:15:04.870137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-02T11:58:31.210800Z","title":"LMMs-Eval : Reality Check on the Evaluation of Large Multimodal Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22586","last_updated":"2026-06-09T04:56:59Z","snapshot_observed_at":"2026-08-06T10:04:16.098099Z","submitted_at":"2026-06-09T04:56:59Z","title":"MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-02T11:58:31.210800Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2607.22586"},"observation_digest":"sha256:d9716a4182ff52d93851600f66e93578763baad14b90b31d79eed6e81268027d","observation_id":"40bbf5e9-7530-4ceb-950b-f498f214554d","resolution":{"observed_at":"2026-08-02T11:58:31.210800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-04T23:23:38.908542Z","title":"Qizhe Zhang, Aosong Cheng, Ming Lu, Renrui Zhang, Zhiyong Zhuo, Jiajun Cao, Shaobo Guo, Qi She, and Shanghang Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01665","last_updated":"2026-08-03T03:56:33Z","snapshot_observed_at":"2026-08-09T21:05:15.058403Z","submitted_at":"2026-08-03T03:56:33Z","title":"Allocation Before Ranking: Decoupled Token Compression for OmniLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:38.908542Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2608.01665"},"observation_digest":"sha256:700859416ffeb18476b869c5547387533b5d13b3b1e417af42640a5e8eca5228","observation_id":"6b8813a0-05ca-4779-8278-e01d2d41057c","resolution":{"observed_at":"2026-08-04T23:23:38.908542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.12772/citation-record","integrity":"/paper/2407.12772/integrity","json":"/paper/2407.12772/citation-record.json","paper":"/paper/2407.12772"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2305.06500","doi":"10.48550/arxiv.2305.06500","metadata_source":"pith","pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":"cs.CV","work_id":"f3aac728-ded0-4e55-aa9e-4a1635d4313d","year":2023},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:7b1f334c154cdfc6c283a6d9991fb2a59465a9604226d5bad221ecc1f234d98e","observation_id":"41a065a0-33ba-4505-96d7-c12348c473d8","resolution":{"observed_at":"2026-05-17T05:19:22.442626Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:51.838916+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":"2404.06512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-07-04T08:19:44.167431Z","title":"Internlm-xcomposer2-4khd: A pioneer- ing large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"799b1f12-2edc-4b09-a83b-dbd87e1404e7","year":2024},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:c4c547e58f887a7481215476a051866a2f60039c2331bf237c763d3b05eeae89","observation_id":"ac237b95-9dcc-430d-8a2e-a64a6f60f2d4","resolution":{"observed_at":"2026-05-17T05:19:22.446753Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:bf72952efb8317c225dea34b45f8fdd274e45a01104a8976b72946ca39844c97","observation_id":"4eaf4965-7af9-469c-bf9b-d742213b2150","resolution":{"observed_at":"2026-05-17T05:19:22.453887Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":"2310.01218","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-07-09T20:16:29.588718Z","title":"Making llama see and draw with seed tokenizer","venue":"cs.CV","work_id":"9453feaf-a19d-4603-b9de-da50593c5d43","year":2023},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:df4297146f7042cc4be3ca162fa6e46b644cdbed60828fee94d01f83acda1471","observation_id":"46622577-559c-4ea9-afda-31666510f829","resolution":{"observed_at":"2026-05-17T05:19:22.459326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-07T19:22:55.853637Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":"1603.07396","doi":null,"metadata_source":"pith","pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-07-04T00:49:19.064422Z","title":"A Diagram Is Worth A Dozen Images","venue":"cs.CV","work_id":"3cc7177d-7f05-4d4d-8066-04b7d589017f","year":2016},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:c794e1f467df5909347df4901898a5086ccb8f88453b5f301bf96ca5fbfd8167","observation_id":"61f9941a-f4a7-4bd6-99a1-144fd10c0c72","resolution":{"observed_at":"2026-05-17T05:19:22.463601Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01827","last_updated":"2020-11-16T20:58:39Z","snapshot_observed_at":"2026-08-11T14:34:05.326714Z","submitted_at":"2019-06-05T05:10:37Z","title":"Coresets for Data-efficient Training of Machine Learning Models","version":3},"cited_work":{"arxiv_id":"1906.01827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.01827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coresets for data-efficient training of machine learning models","venue":null,"work_id":"6294e816-3c4b-4eef-9b3b-147f58028f86","year":1906},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/1906.01827","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:636aebf1da13a783a6bc12afc7b1d8ebc7d07a81ef1bafd77cb497d37d993b09","observation_id":"da6a5df2-38fc-4d4c-9498-99235737c321","resolution":{"observed_at":"2026-05-17T05:19:22.468240Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-05T12:01:06.707349Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":"2402.14992","doi":"10.48550/arxiv.2402.14992","metadata_source":"pith","pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"David Rein, Betty Li Hou, Asa Cooper Stickland, Jack- son Petty, Richard Yuanzhe Pang, Julien Dirani, Ju- lian Michael, and Samuel R Bowman","venue":"cs.CL","work_id":"1aaa40b4-1321-4f79-85a8-e296eaa2b732","year":2024},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:ba2d4f33fc4244372691116fec957f697eabb19d0e7a7f559b5362904f2375bc","observation_id":"a858ae38-1d42-40f8-a4b0-022b15c8c58e","resolution":{"observed_at":"2026-05-17T05:19:22.473153Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What are the key points in this news story?","venue":null,"work_id":"e68c96cb-bb7e-449f-a119-cd597fb996c5","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:f8045946b476abcd5a6b74332c8b3534d7495f6345c198d45edbf2dae826c528","observation_id":"99525b92-fa84-4b7b-b28d-7c7188b2ea32","resolution":{"observed_at":"2026-05-17T05:19:22.476018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What are the factors that led to this event?","venue":null,"work_id":"7b76250b-2531-47bd-895e-bdda6b05f684","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:d818e330259efe7ef41bf5b1ef7e94df71438488d2dc61404b25e725f6fce322","observation_id":"f0f44743-f5e5-43c0-8f27-41cc25480f27","resolution":{"observed_at":"2026-05-17T05:19:22.478515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How could you create a new headline that captures the essence of the event differently?","venue":null,"work_id":"b7a3b807-f4d2-477c-a253-be4bf759fa53","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:1f42f1f1f30e26fde92606571ced380ac4aa944d60da35ec8ea18a70b9d14194","observation_id":"3a96d9ad-e6f5-4fc5-b812-2740fede8ed1","resolution":{"observed_at":"2026-05-17T05:19:22.481198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Please present this news in Arabic and output it in markdown format","venue":null,"work_id":"50e8050b-b81f-4d11-a5b0-65bff22103d2","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:790619d6b0081860a5cdfc4b8654969092d3127422cbd17c7b85539d960088f4","observation_id":"93846a10-9fcd-4507-87b2-4941b3b630a5","resolution":{"observed_at":"2026-05-17T05:19:22.483602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"09fdb662-6f23-49a8-a3aa-8af43c286e0e","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:1ca44cb5b3fefa62293147d213c201201bba3ef8dcacbe87588b9ad08c0d767e","observation_id":"c2f125d4-5c36-471f-a3ce-7f7e6e922df5","resolution":{"observed_at":"2026-05-17T05:19:22.485651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"However, you should not change the original question's subtask unless the original subtask is not one of these five","venue":null,"work_id":"3f4ccbdc-6608-4883-ae6e-e0a76a745b8a","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:959a283bc6a5c0531e09b6a3ea1cfdbd7a92585fc41c7c23acb6bba50f09b74a","observation_id":"407d8bbd-82cb-46f0-b4c0-b6721acb82b8","resolution":{"observed_at":"2026-05-17T05:19:22.488064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"562a8f76-5fe3-498c-8a7d-bb64f24c1497","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:64e79ad7253928fbf9ddf57e2263101b323e1190954b0348fa817a3d5c44d81e","observation_id":"5fd5be42-25f9-49ad-9ba7-988414396e6c","resolution":{"observed_at":"2026-05-17T05:19:22.489979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"But don't use python−like format","venue":null,"work_id":"1b73e503-e4ed-4927-bb0b-5113f794e510","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:89f8aa6e255071280d943d8a205bf92380d4b478eb96e0b1151de2028cde9b0f","observation_id":"97641f0d-0d6d-48e0-9837-50841ceb6d36","resolution":{"observed_at":"2026-05-17T05:19:22.491916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"726e9bab-bb50-4136-98b6-6c233e17565c","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:10c2c019bb0ef8cc746773e90ee0ae0dce89f04a2b28d316f55318e72e3d349e","observation_id":"b1524ccc-abb8-46ab-90db-695baa3ae091","resolution":{"observed_at":"2026-05-17T05:19:22.494384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"But if you think some words should be in other language, you can keep it in that language","venue":null,"work_id":"efb85db3-bf32-4b09-8584-befac0154e62","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:6a1f8b88c4e02c0b09f474f5ed48258da83465accce800cf9702deece6eb516f","observation_id":"9c4ebe4c-e8df-49a9-9a55-24e8c8704085","resolution":{"observed_at":"2026-05-17T05:19:22.497093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f4c6c978-d50d-4b0c-b201-e0682d73d400","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:573e82fd183eb968e849dda547732bec183eb73f0f6f3763f15fa3c13b883931","observation_id":"afde4456-461d-4bb1-bd93-9931c860ad57","resolution":{"observed_at":"2026-05-17T05:19:22.499178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f0902494-b81f-4e27-9289-adde859fd340","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:b98564c0165318600124b8aeab731d2c0115ab15a423ca68009ee18b6a4f1829","observation_id":"38f1f065-e613-4cca-8aef-84769a6ff0c5","resolution":{"observed_at":"2026-05-17T05:19:22.502067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1ef95f1c-c993-40f9-bca8-23ceeee95ebf","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:75e09500520aea7ba16a40c5fe3f6d291f03e1280b85453e88e7d141bbd220da","observation_id":"085a2ac6-cff5-4219-98d2-f4d184ffc838","resolution":{"observed_at":"2026-05-17T05:19:22.504065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some tips","venue":null,"work_id":"4758cd2b-188a-4cad-b4f2-86a499edb65f","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:a013017a5e0f83e4aefe4b041532c19bb52b1fff9b65809503de6705d7c0aa88","observation_id":"bda072aa-ad67-4127-b2c9-a50814044507","resolution":{"observed_at":"2026-05-17T05:19:22.506116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In such cases, you can relax the criteria slightly","venue":null,"work_id":"c6ce5aee-1eb0-4fcd-8cec-24a9a1d77bb1","year":null},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:ee9a79c523bc33745d9987472814b0f3ef72454496d9818f25db61ab4d3ba339","observation_id":"e406d34c-a761-4cdd-82ff-faf783f8f100","resolution":{"observed_at":"2026-05-17T05:19:22.508398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Explanation","venue":null,"work_id":"cba58378-3f24-4491-b8be-35ef4c70e993","year":2014},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:183f3d50a721d26ccb29d5ae48e999228df054bf91f43d9bbc0a82c443ca8083","observation_id":"6762720f-b6fc-4931-9d4f-e91c876f3a3c","resolution":{"observed_at":"2026-05-17T05:19:22.510562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This kind of systemic shift often results in skills becoming obsolete, leading to higher unemployment among professionals who cannot quickly adapt to new technological paradigms","venue":null,"work_id":"f778ffb3-d239-4e82-ab25-c207600483f1","year":2016},"citing_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T05:19:22.423762Z"},"links":{"citing_paper":"/paper/2407.12772"},"observation_digest":"sha256:d1035515c5aab7121d43e3f777d367b80d462a17fb83735fc62671daf99d45ca","observation_id":"68a4ab78-6909-40d3-9419-bd66816e0b28","resolution":{"observed_at":"2026-05-17T05:19:22.512802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 78 inbound Pith citation observations for arXiv:2407.12772."}