{"as_of":"2026-08-07T17:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7125fb7989b87091462e31ab1c69858a10cd2d8cff076c2c5a3da1068a959cc","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T11:18:03.535674Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10494/citation-record","integrity":"/paper/2607.10494/integrity","json":"/paper/2607.10494/citation-record.json","paper":"/paper/2607.10494"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Requirements engineering in the year 00: A re- search perspective,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:f28b1ea3b0bb6993697d1774a153bef2a8496766cc58bdfb904acd24553a7416","observation_id":"0a8ab4a2-e731-47df-b90e-54cb496faa4c","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Effectiveness of elicitation techniques in distributed requirements engineering,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:fd9bdcfa68d7a68b3a0742c017e0bd9a7f78bf8cc45516fcddfcd145245f5db5","observation_id":"5f8f91bd-c0c8-4080-9329-930c1b7d9868","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Hy- perMeeting: Supporting asynchronous meetings with hypervideo,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:27d6870c608adf2df0ff5f58a6c51ea0903f89704f49dfc61a3121565408d18a","observation_id":"f0719824-b31e-4a15-acce-38a3271a010a","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Turning asyn- chronicity into an opportunity: asynchronous communication for shared understanding with vision videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:a08464832da1940046434163f4229d6212b2fef430d94cf70f5fc4f1a856acb8","observation_id":"28b0f599-a679-48b7-bdd9-f31ce9995041","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"A comparison of asynchronous online text-based lectures and synchronous interactive web conferencing lectures,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:04e30dff77f444614d3d5a85b0fc159fc6ab26ac19b8771bee7d75d99d39be51","observation_id":"b0faeb59-163f-4525-8c89-36752d919462","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Team-based learning in asynchronous online settings,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:44f64b5a97ee9984e4234a7c3b033b3c70c8df05796ff7d208fbf92243c868c1","observation_id":"9a2ccbe7-f962-4618-95d8-acd86d9e9198","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"CodeTube: Extracting relevant fragments from software development video tutorials,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:bc326cdfe3e2227ac7eb67fdbe302e34c39bdb110b861a3aa61e93ff12a3bd59","observation_id":"a7cdb65f-7d1b-4fbb-a39a-d86b685a453e","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Text retrieval-based tagging of software engineering video tutorials,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:b8689a07707bf90530cb248c0fb854a03c664314fca3887980a34ab8c18d51eb","observation_id":"41cdd7c6-394e-440f-8853-1ca3cc144874","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Automatic tag recommen- dation for software development video tutorials,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:2079b5abb6d40ca7ceacf2b8df94eabb227f528fd040516af471bd1d3be740af","observation_id":"5f1fb1ee-f18a-4b6e-bfef-3eefd17ecd02","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"psc2code: Denois- ing code extraction from programming screencasts,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:4f048dfc55f28f23a237f1213a0c060a78ebe68bc48eb98abc9044037d5930f8","observation_id":"1ff50a4a-4eca-4f4e-ac4f-4f660a2f2a97","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"VT-Revolution: Interactive programming video tutorial authoring and watching system,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:7867925867e60b5a1fb137f0ea429082f664698ad4320117704c42e4fd4d067c","observation_id":"f82d7c36-5df4-46d3-8176-14fa15dad1dc","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Improving code extraction from coding screencasts using a code-aware encoder-decoder model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:a69511c97729a680f0fd5a3de8d09a5d2984a4b2317059c899aa851150b9751f","observation_id":"6ab463b6-2180-43c2-9c7b-a5283520ef5b","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Efficient search of live-coding screen- casts from online videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:2aa10ed0b80db2e207905d5964901e235bf317f812aa8be8712531c25cdae874","observation_id":"316f4ffe-43cd-4849-a4f5-30f1846e3dbe","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Semantic GUI scene learning and video alignment for detecting du- plicate video-based bug reports,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:7d9137a81c994d26fbb6e16c8998fd447fac0c43e025456554e7c4384e259e31","observation_id":"61b73085-4dfb-4887-9bbf-ca17af374fec","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Question answering for multi-release systems: A case study at ciena,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:d285e9642671f879b3e41fc8784a4bcf1b9020b92487e8cde0dbbd8c6e382d8c","observation_id":"00ff2e3a-5eab-42c1-b8e6-831cf12401d9","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Developing a llama-based chatbot for CI/CD question answer- ing: A case study at ericsson,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:f7e82ebce522eb96960618ca7e126f98bf9f2528e8e45775556c79078d5b7b5d","observation_id":"4566be2e-7321-4248-be72-f5c9a2f06a57","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Experiences developing an AI chatbot in the pharmaceutical industry,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:0aaeb613a3ef93696cf0403fe1a38371b15d472e627145ceb627fbb36ede8ac5","observation_id":"ae4d2485-96f7-4453-81b9-32689cfb1d6f","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Evaluating large language models for requirements question answering in industrial aerospace software,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:8b48395b44efa62aba4763e285462ef3afbfaa75f025b3903a6c32c2f0bbf182","observation_id":"985e0d00-3c15-4ca6-9e84-b6b50f1eecbb","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:b0bdfae932bb223e5dac3b4e5c7914625ae1e4029654fe77fdcf423f2ee9aaeb","observation_id":"c37f6bc6-5dc8-4f97-908e-d03970107a58","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:0a05de322e9202ea04789f782a4efdeb8d2f10c0d073d93a9086f0990bc8ec3b","observation_id":"7411e653-c222-47b0-a647-dee8e509545f","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Video- LLaV A: Learning united visual representation by alignment before projection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:3a635582ea6bdbb05096f8f439812958db646d7f47a1b434eef32ec79be1c23b","observation_id":"da5b67d3-f8aa-4364-80f4-51a8edb1614b","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:4a6eb7a199877aebd6eb13ec949fb8fbe4eae1b797a11465ca5ebd335383c869","observation_id":"4653a386-0d96-45eb-9710-ca91719658ed","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"DrVideo: Document retrieval based long video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:4ea03d6dbd265b48a28c363db177c8ce2d432a21de07bc833e10ab1ab67110d7","observation_id":"e8b7154d-d853-4d53-9750-9072cc73c1ea","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"A simple LLM framework for long-range video question- answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:b7778baa435f3289ff8de57e5d5919d6288f61c9d015b3dd9bf4127926c0e4f9","observation_id":"7795e9dc-b4dd-44c0-8e8f-4b22a3eec4d0","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03384","last_updated":"2024-07-20T07:17:00Z","snapshot_observed_at":"2026-07-06T17:55:36.748672Z","submitted_at":"2024-04-04T11:33:29Z","title":"LongVLM: Efficient Long Video Understanding via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03384","snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"LongVLM: Efficient long video understanding via large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"cited_paper":"/paper/2404.03384","citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:d78807daa4cca262da1efe663662c1e79b79eaa1ff6b9a377a3db61bf53f77d5","observation_id":"51b8ce65-072e-45b5-80fa-82884c1c442e","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"LMVQA: Prompts, resources, codes, and interviews for the LMVQA system,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:09310ed765d1c04bf4b48bb9ab319a48421a53293b48919d8103e16311b40f0d","observation_id":"4da5208d-d192-44f1-9397-632441809cd9","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Frame rates explained: Why FPS matters in broadcasting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:09b8d7ed40364750b767c9ee5f88955fcf88ac767b2b652480e562cce0d1eda9","observation_id":"d8f8c2a2-b2fe-401d-b809-5ba8526daf98","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Image quality assessment: From error visibility to structural similarity,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:3969261c2b1d40f8a6421633f11fd0c596fe813453e9b44e3ab01410c38f40d0","observation_id":"94c416d5-1c0d-4809-8a02-b5165cb3b679","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:4c25f750abdb56aa97bb56e0e6e928dba30ad5c083c42ac8616d005783a47108","observation_id":"f5759fef-7f49-4806-bb2c-f4327b4a8acc","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:804fa73db98c480c829f4a12f73425fc73281c6235d8944383845368c701e6c8","observation_id":"d7ea6fc4-e6b4-4763-a36b-a4557003818b","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:c11277952a4548d3fc4d48c2e2a46b07478bad9affd9bb968d3791c2713a06d1","observation_id":"6c3e4a53-fc1b-4854-8d30-545962f1e2d5","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"A vector space model for automatic indexing,","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:9940bdc6039467e7f55fd505555e635b0315951147554489cf82a8143cb2a02b","observation_id":"332e1848-e64a-41fc-8f79-5005d589733e","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"The measurement of observer agreement for categorical data,","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:74d49e6c14582f4157723ac111c752f07a930ad779f1c7e56447ceeed731a648","observation_id":"d902558f-71b3-41ac-a61e-01c07847b527","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"PlotQA: Reasoning over scientific plots,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:3f545dd86fb73ce38060e261b59a024c6264a74b5bf199b4574726f15f384227","observation_id":"61e9759e-486a-4f14-b756-c277fc6745e4","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:042e12caddcb1b819f14596282df2b9cef3810d90a160582bec3084dbcd515af","observation_id":"b0b46faf-e64a-49c6-ba2c-2b02fa9bc7aa","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"ChartVQA: A benchmark for question answering on charts using visual reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:572bebd6ef03f17c1e320d8a17a8a79234cf2ccf9c0e5b3cc47d1eeca1bf0e50","observation_id":"82db81db-d768-4f53-a087-ca3ca07f51ab","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:3aee02126d177abc43daa67f3e492ddeb946314e0acc39632f1cfa83aa314248","observation_id":"fb1cabaa-f089-414d-a89a-d5c6c26e1447","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"DocVQA: A dataset for VQA on document images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:4f29b2831cbd5c385ff1af4b76c72abc8927a2a4827215b4a3d1e668f8594bc2","observation_id":"3a267bd8-37b8-423d-b29b-afdb86527899","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Test input validation for vision-based dl systems: An active learning approach,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:1fdfb06a1bfcdbdd1603aa2334045341fbc3daeb0cecc0aca07f22d53ae37d32","observation_id":"df79178a-08ea-4ad0-a925-dd872eefaacc","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:18:03.535674Z","title":"Milvus: A purpose-built vector data management system,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T11:18:03.535674Z"},"links":{"citing_paper":"/paper/2607.10494"},"observation_digest":"sha256:05935363adfeba3281d5f5cbba110e7e8d6b102e3935cad6af8060ddae7a6291","observation_id":"83d9cffe-3868-4736-b318-b167dc87a27b","resolution":{"observed_at":"2026-07-14T11:18:03.535674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10494","last_updated":"2026-07-11T21:58:16Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-04T01:08:13.182059Z","submitted_at":"2026-07-11T21:58:16Z","title":"Question Answering for Diagram-Rich Technical Meeting Videos"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.10494."}