{"as_of":"2026-08-08T21:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1435851c3b579d6ae6dfbbc330f6fd18fbb0d72b00b1256cfed059485d4bd5a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:04:14.254349Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03916/citation-record","integrity":"/paper/2507.03916/integrity","json":"/paper/2507.03916/citation-record.json","paper":"/paper/2507.03916"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:19.096877Z","title":"Docvqa: A dataset for vqa on document images,","venue":null,"work_id":"d2558d6a-af37-435d-bbcf-1fd0add03dd3","year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:09.955672Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:7d5e0b8a2f39187c10b0eb1ddfa8ee24f8a405072b974f72b738f903f3d7640e","observation_id":"c395a067-53ef-4ccb-b30a-dc08fa59f74d","resolution":{"observed_at":"2026-08-06T20:04:19.199956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.820752Z","title":"Infographicvqa,","venue":null,"work_id":"bdd4070c-fdf1-4e15-8ef2-3251a9af48d0","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.072039Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:6d708daca12ff8d56c03b6edfb85e80dac362e0a19471ce5b6490ee63e9e9d92","observation_id":"1b28438b-a3fe-4128-8c23-9f9353e9a0cb","resolution":{"observed_at":"2026-08-06T20:04:18.920954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.593254Z","title":"Slidevqa: A dataset for document visual question answering on multiple images,","venue":null,"work_id":"43417f57-a163-44bc-9018-aa4c4a505ca7","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.189362Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:fb97777ad8944190d5fd8f3cfb22b54d712f293c9498d0492c0ae956b4d98e58","observation_id":"2df9f805-09b6-4fb0-a073-b514c5a137e0","resolution":{"observed_at":"2026-08-06T20:04:18.704656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.380198Z","title":"Msr-vtt: A large video description dataset for bridging video and language,","venue":null,"work_id":"65218183-6cd4-47f7-b883-49c4da419db2","year":2016},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.342478Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:1d319311976669dc535965c1f90956eab25ac33f7ca7700eace1fbf8137292db","observation_id":"f4563e43-4b88-4be2-8990-a3fceb74b5aa","resolution":{"observed_at":"2026-08-06T20:04:18.495421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:18.191108Z","title":"Dense-captioning events in videos,","venue":null,"work_id":"a37ae335-51b3-46c4-bcd9-821e58e257f9","year":2017},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.475082Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:cdbf49a51d2f1d39177cbc34be811d29cf1cb9adfa73f1ff47431b63aa401fbc","observation_id":"08d47dbe-8fcf-45b2-995e-772c54db6ee1","resolution":{"observed_at":"2026-08-06T20:04:18.280657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.892377Z","title":"Towards vqa models that can read,","venue":null,"work_id":"32d97b11-fe15-44dc-8849-2e171308a1be","year":2019},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.636457Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:76327c5fba06938abdf2010a86ea7e3d8181563c8d92c8e6e0b89c3cb8156f74","observation_id":"5e442f33-eac8-4dd1-8aa5-3fc047c20570","resolution":{"observed_at":"2026-08-06T20:04:18.037729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:04:10.751674Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.751674Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:db54a40c8ce2c11bc408566877b803780bc1466a79964980a7ca8bbcf8b83858","observation_id":"8f1a2db1-2a3a-4add-82ed-3acfec3fd233","resolution":{"observed_at":"2026-08-06T20:04:10.751674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.571250Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"ba747f2a-0a47-44b5-9445-c1f1d0c236aa","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.850014Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:ac63289f4a4f1802e5d7d553004e6a3f3dc441c1279a1ad76a278048092cfb32","observation_id":"afb972a4-28be-4dd1-8bba-bf8a6557453c","resolution":{"observed_at":"2026-08-06T20:04:17.727409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.318162Z","title":"python-pptx: Create open xml powerpoint documents in python,","venue":null,"work_id":"26e091b3-aafa-4097-95a4-d3b15fa73218","year":2019},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:10.980238Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:f233f9d48cce3b93f3d8552489b4a3e572cb741df44e5651147d6c44d8ea879a","observation_id":"b5a2dbb4-ea70-4edf-a9e3-95b4227a3f6e","resolution":{"observed_at":"2026-08-06T20:04:17.400977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:11.119793Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.119793Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:9788c6693de7fb2634364500043c8ec8836f7cfc5e3b8dfbf6913631cc193896","observation_id":"33776ba4-c58e-4dfe-86d9-32512bd56db7","resolution":{"observed_at":"2026-08-06T20:04:11.119793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:11.237427Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.237427Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:8a9a215ce892f5059ab63c4ebfe496975f87c0076c7f6df5f9671da193b1f272","observation_id":"7e77378b-d7c8-4df0-bdf9-81e1c5430b33","resolution":{"observed_at":"2026-08-06T20:04:11.237427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:17.077281Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":"45e97226-54bc-43e1-bfac-4a55568b518f","year":2016},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.361447Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:d7c5b5957cf2eee73e50a11911f1935169f7681fa633eaea8c0cebccd0428f06","observation_id":"4fc245fc-f4d6-41aa-bc62-5fa3879789f2","resolution":{"observed_at":"2026-08-06T20:04:17.185503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-06T20:04:11.505717Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.505717Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:a8b7ba27e078245bd88afd9f620c619bc154328fabde8c4689dcc88e23a2f364","observation_id":"c8eb1cfb-6104-433e-9f23-ed5f6634ba94","resolution":{"observed_at":"2026-08-06T20:04:11.505717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.793821Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"5b66f6ed-6ece-4992-8ee7-439e0f1edd0e","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.654830Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:c16c4aa31303e3ce63858e248e551a8bb6faf3d676e0f0e0db8abe12d4825efb","observation_id":"f3d8a2c0-3142-4172-9299-1b0e655d37b1","resolution":{"observed_at":"2026-08-06T20:04:16.918071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19552","last_updated":"2025-05-21T19:12:41Z","snapshot_observed_at":"2026-07-06T19:39:42.675941Z","submitted_at":"2024-10-25T13:26:32Z","title":"GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19552","snapshot_observed_at":"2026-08-06T20:04:11.787732Z","title":"Geollava: Efficient fine-tuned vision-language models for temporal change detection in remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.787732Z"},"links":{"cited_paper":"/paper/2410.19552","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:e3e20b3c83f8abc4f7e2949994a186cee202618cfb4cbc34a11437461af165ee","observation_id":"25579411-a4fa-4a53-8687-69c83adccef3","resolution":{"observed_at":"2026-08-06T20:04:11.787732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T20:04:11.888949Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:11.888949Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:a1132a7b5980d194b74ec5f29b52360b9393cf0e4d5343bb92941cc355c93c4f","observation_id":"ea5f9202-a5dc-4ec1-b97a-393df857d521","resolution":{"observed_at":"2026-08-06T20:04:11.888949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:12.035982Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.035982Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:85ae2da92964ffb89e8e08e49467e182c609354b228d8f1cb65301b1af77d903","observation_id":"b39d791f-4869-43b5-95af-3875843b3abc","resolution":{"observed_at":"2026-08-06T20:04:12.035982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.507441Z","title":"Layoutlm: Pre-training of text and layout for document image understanding,","venue":null,"work_id":"0556ab42-82ab-49fc-bddb-f8594d93fc8c","year":2020},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.156363Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:efbdf9b68493e6205a61748335ce494946812eddc7b24dbd5fea4c572a2153c5","observation_id":"32d36aad-f476-499a-bdc2-7e0f6b44d1e6","resolution":{"observed_at":"2026-08-06T20:04:16.638138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-06T20:04:12.315928Z","title":"Layoutlmv2: Multi-modal pre-training for visually-rich document understanding,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.315928Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:b7a5494c5d2bbdf3cf1535842a6d0d1bff779349650910689e0c551f90be1138","observation_id":"3ceb7149-7d64-49fe-b295-13df1a98afe5","resolution":{"observed_at":"2026-08-06T20:04:12.315928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-06T20:04:12.416233Z","title":"Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.416233Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:493e95b990598975810c2847d68e7403ee13f8718cfe63968519c0e33d3b74fa","observation_id":"3a9ecb96-d720-4380-80fc-6464a625a2d8","resolution":{"observed_at":"2026-08-06T20:04:12.416233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.294795Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking,","venue":null,"work_id":"365d0e29-1d69-401f-8c0e-df6d0c96ccdd","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.517861Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:17ce5ab9d828275d1dd0fee0527044b26e06b1275f378d4514c588c3ba449c75","observation_id":"93069f4d-ff76-4b0a-a1f6-fc35d3299d62","resolution":{"observed_at":"2026-08-06T20:04:16.381185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:16.090182Z","title":"Unifying vision, text, and layout for universal document processing,","venue":null,"work_id":"c5d6914a-09a7-4bd8-976b-6783a27569ba","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.637123Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:4e8116c762c591795cd8e65a39338ebc91d57816c6dcf5f061b134a4bf2c6cd5","observation_id":"5d641d5f-7ee8-4f4f-80cb-971c6b5ceb37","resolution":{"observed_at":"2026-08-06T20:04:16.189850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:15.817077Z","title":"Towards automatic learning of procedures from web instructional videos,","venue":null,"work_id":"dcf595c2-36d8-4754-8a35-a13976813eae","year":2018},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.751843Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:fe06cf41fbaebfad8dcb1cd6d393315f1f438d439fd8c4e2b0ad1f6a301b1c7d","observation_id":"ab129cd5-8c04-4f1b-875a-cd566038aa19","resolution":{"observed_at":"2026-08-06T20:04:15.953547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T20:04:12.865362Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:12.865362Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:7063a428706286ea8d71f3db9c2298f26a35fe3cad4734dd626b931d85ba96fc","observation_id":"ce4ed28f-4ecf-4329-80cf-bd6c990a50dc","resolution":{"observed_at":"2026-08-06T20:04:12.865362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T20:04:13.002034Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.002034Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:92a565a08dfe5f799e56991741bd703ced62ee6d86cb08463ec258ab9b436a19","observation_id":"28e60d0b-1127-4e64-9a6c-cc9b0317ddf2","resolution":{"observed_at":"2026-08-06T20:04:13.002034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:15.517669Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval,","venue":null,"work_id":"a5830dde-d93b-4ed8-aa1a-ba6b42049134","year":2022},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.153091Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:e175c76495421358ae02ef23c8a493a1f635c57b0f8bc66e2010fe7d765456b7","observation_id":"9d6141b0-04e1-40ac-91a3-b340e99843a4","resolution":{"observed_at":"2026-08-06T20:04:15.646879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-08T18:14:10.573428Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-08-06T20:04:13.314128Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.314128Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:1548e310fb391fa789027267e360bd2c54e1ab4de02771e55ab5c8335971377c","observation_id":"8f9c5f80-2681-4dc3-aed7-67647c00322f","resolution":{"observed_at":"2026-08-06T20:04:13.314128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-06T20:04:13.425644Z","title":"Llama-adapter v2: Parameter-efficient visual instruction model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.425644Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:acf4066c6ce4783c5a4d08729f1dcfd09f64eab0edd1f04ba0a9e8ea930dcbac","observation_id":"b633c2c2-2d2e-4609-b6f5-f9cef1479bbb","resolution":{"observed_at":"2026-08-06T20:04:13.425644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-06T20:04:13.503234Z","title":"Adalora: Adaptive budget allocation for parameter-efficient fine-tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.503234Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:4ead2ef525f0ceaea1b7b2ff88532346a88bdfb0e732649fadc62d9d1b98a037","observation_id":"e2191883-4d52-4f65-9ef9-e8cb41d415a1","resolution":{"observed_at":"2026-08-06T20:04:13.503234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:13.548641Z","title":"Qlora: Efficient finetuning of quantized llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.548641Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:404f827ed9a318743e5e7caad28c94f9f7f114398bdfee9b6d46ec271cf24b34","observation_id":"a41c1694-56cf-4873-a39a-98715f7f79ea","resolution":{"observed_at":"2026-08-06T20:04:13.548641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-06T20:04:13.653416Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.653416Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:05a7a2ad733b9280d6394cd0d51360374129e2b6b7b88fea6400a7e76414decc","observation_id":"241ac941-1d25-4a6f-9925-8e59ec464c91","resolution":{"observed_at":"2026-08-06T20:04:13.653416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07602","last_updated":"2022-03-20T15:13:08Z","snapshot_observed_at":"2026-08-08T11:15:37.346201Z","submitted_at":"2021-10-14T17:58:47Z","title":"P-Tuning v2: Prompt Tuning Can Be Comparable to Fine-tuning Universally Across Scales and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07602","snapshot_observed_at":"2026-08-06T20:04:13.722971Z","title":"P-tuning v2: Prompt tuning can be comparable to fine-tuning universally across scales and tasks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.722971Z"},"links":{"cited_paper":"/paper/2110.07602","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:d01342d8becda5fdad5c49a1a2ee6e4609606a4ffdb03ccac321148864aefe93","observation_id":"516f1b29-e1f9-4c7b-89f5-87d015388132","resolution":{"observed_at":"2026-08-06T20:04:13.722971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:15.222565Z","title":"Evaluation metrics for video captioning: A survey,","venue":null,"work_id":"0672d399-66ca-479c-a2c8-700d0540e2f9","year":2023},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.815372Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:0e95fd79cb8b2ff316ac46abddb55bbe36cbfe3653f4daa69485fbf21e1a729f","observation_id":"ffec0415-ea13-4779-ae3b-7ebd73c1e1f9","resolution":{"observed_at":"2026-08-06T20:04:15.358915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:14.887123Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":"f00ff782-7fa5-4f56-93f2-0eddd19d6ea2","year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.893403Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:5a6bc061893d87824f9f1d48fc7aa0d270ed1ca1a18ae89c25b189e3ecaf35c8","observation_id":"18ef3acb-5841-415a-b5a1-f8a70a19b3d7","resolution":{"observed_at":"2026-08-06T20:04:15.061021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:14.761579Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"6e2d2814-42c7-4acc-8f48-6bd71a1504f4","year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.974323Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:9c209f613d8ca57cf212baccb6e579b256cdb5d769df80acd7f319f7655697e5","observation_id":"2f4cd553-01dc-4ddb-a5b0-af92db97c562","resolution":{"observed_at":"2026-08-06T20:04:14.812717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:04:14.634543Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding,","venue":null,"work_id":"3e704a4d-f017-466a-8e96-dae3727413d0","year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.050908Z"},"links":{"citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:4aeb9739a889c8609cddac31017b8c4dbfe741452d98aa38c15aaac64b970f4b","observation_id":"0a774904-43d6-4660-b4f7-18abba67c15c","resolution":{"observed_at":"2026-08-06T20:04:14.672111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-06T20:04:14.128716Z","title":"Tempcompass: Do video llms really understand videos?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.128716Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:8e08ac8b270cdddb3eda80e68c1e2c3c3da6d0e02003e0fd1d0971f8ec2245d0","observation_id":"618594b0-6d38-4c7e-a528-0ed42817d561","resolution":{"observed_at":"2026-08-06T20:04:14.128716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T20:04:14.186124Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.186124Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:0e50f4bc46d456e4d20bbb3719e89f7974ec36c0c51f8784f6ee27f7d17a8f51","observation_id":"0b657244-8cae-4f8c-bbd8-ae81bfa0b2b9","resolution":{"observed_at":"2026-08-06T20:04:14.186124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T20:04:14.254349Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:14.254349Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:b0ca1e52ae37a2c5ad7ff092b8ef8cb1359635312f1175a2712a5ef2e77975c2","observation_id":"cbae45d3-4c04-40d1-9178-959b0eee45f9","resolution":{"observed_at":"2026-08-06T20:04:14.254349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T19:57:16.481903Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.03916."}