{"as_of":"2026-08-13T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09efc898d87337958ee0a8688e8c42976c0d6cd91dc859ecb5a0e8f6f4f1106e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T05:08:20.197862Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28509/citation-record","integrity":"/paper/2607.28509/integrity","json":"/paper/2607.28509/citation-record.json","paper":"/paper/2607.28509"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.25979","last_updated":"2026-05-25T15:54:04Z","snapshot_observed_at":"2026-08-13T08:54:27.019447Z","submitted_at":"2026-05-25T15:54:04Z","title":"LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.25979","snapshot_observed_at":"2026-07-31T05:08:19.737340Z","title":"LLaV A-OneVision-2: Towards next-generation perceptual intelligence.arXiv preprint arXiv:2605.25979, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.737340Z"},"links":{"cited_paper":"/paper/2605.25979","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:59b6f47de1bd57fc39ecf6a5a5c630cbbc57802d92b297af9dfa7b553fd3fed4","observation_id":"9e5ef122-d5b2-4e1c-ac12-b90a3088b2d5","resolution":{"observed_at":"2026-07-31T05:08:19.737340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T05:08:19.750764Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.750764Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:3038673af7b1f98f486340151606452944d30eb6ad1785fbfee7c415bd4dff04","observation_id":"cc44a2e2-fbe3-4938-89cb-ed8987f1fb75","resolution":{"observed_at":"2026-07-31T05:08:19.750764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.763797Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.763797Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:008bd2a38960a0d92e47d173fa45bcdec33b9bf4bb3165c252f69c393a39fbe1","observation_id":"001d8a6d-16d8-4517-a577-0e49064afd8d","resolution":{"observed_at":"2026-07-31T05:08:19.763797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.780721Z","title":"Multi-subject open-set personalization in video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.780721Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:27bd15acc1abc091ff4beb2b390a89e3a6ef7959fa6511a4f9789ba5d5a96fa1","observation_id":"bbb30ee5-66a8-43c3-8085-14267234ec98","resolution":{"observed_at":"2026-07-31T05:08:19.780721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.791672Z","title":"VidCapBench: A compre- hensive benchmark of video captioning for controllable text- to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.791672Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:31b09f285be8d6c53d301dbe8b9a53c3833bbc412eacb6960b7d93af38007445","observation_id":"d96553f7-95ff-41d1-97b1-a146976fc099","resolution":{"observed_at":"2026-07-31T05:08:19.791672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.21949","last_updated":"2026-06-20T08:37:32Z","snapshot_observed_at":"2026-08-13T06:35:27.300526Z","submitted_at":"2026-06-20T08:37:32Z","title":"CapRiCorn-1K: A Comprehensive Benchmark for Video Captioning and Subject Referential Consistency Across Temporal Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.21949","snapshot_observed_at":"2026-07-31T05:08:19.804511Z","title":"CapRiCorn-1K: A comprehensive bench- mark for video captioning and subject referential consistency across temporal scales.arXiv preprint arXiv:2606.21949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.804511Z"},"links":{"cited_paper":"/paper/2606.21949","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:b9ef890418a13aaa1d519f0a34ee68b78f3b38c47a2c930cd614e6f3a44ce9e9","observation_id":"7439c6ac-9db8-49f3-b763-50921b4a1af2","resolution":{"observed_at":"2026-07-31T05:08:19.804511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.817785Z","title":"MA- GREF: Masked guidance for any-reference video generation with subject disentanglement","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.817785Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:06a771ba01b93a6786ead69b3fe2b8e41a9c8d078177c8d0119fbbf3cc46fee5","observation_id":"7c3ba9da-2809-43e7-ab9e-ef0315868f10","resolution":{"observed_at":"2026-07-31T05:08:19.817785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-12T22:01:29.230600Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-07-31T05:08:19.828792Z","title":"ARC-Hunyuan- Video-7B: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.828792Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:83762ff1553f7413fcc6ef50e2b84ea5bf02e55474a4fbd4eabc112e6c4215b3","observation_id":"6d25759c-5f23-49ae-9276-95bc2c367031","resolution":{"observed_at":"2026-07-31T05:08:19.828792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.840883Z","title":"Video Re- Cap: Recursive captioning of hour-long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.840883Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:0b065c1529b692232b48e04a1c96eefa92f62f6aebbee0fcfa20eabf6d3c73ff","observation_id":"e930ff39-68a4-4b18-a102-22993e62df74","resolution":{"observed_at":"2026-07-31T05:08:19.840883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.850220Z","title":"Movie Weaver: Tuning-free multi-concept video personalization with anchored prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.850220Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:9cc8475c8807f78b827d56fe9f1c835f210978cde5c654c4fa57fb8e8eee2d59","observation_id":"530a17a1-e33c-4a7a-99f5-0ece07dd6da9","resolution":{"observed_at":"2026-07-31T05:08:19.850220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.864718Z","title":"Video-LLaV A: Learning united visual repre- sentation by alignment before projection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.864718Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:bcadf4ddfcdbf0b7891f0ae2165afef666a9573622ed371825022cc1bb50903e","observation_id":"44944426-2480-4b27-9826-53eead274374","resolution":{"observed_at":"2026-07-31T05:08:19.864718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.874880Z","title":"SwinBERT: End-to-end transformers with sparse attention for video cap- tioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.874880Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:55347673c2c7342a23ef8eef1d14bfdd74559952327953b4a5e23c34806ca346","observation_id":"649bffd7-b00c-4762-8276-9ebe87696f6c","resolution":{"observed_at":"2026-07-31T05:08:19.874880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02175","last_updated":"2026-05-13T06:57:11Z","snapshot_observed_at":"2026-08-11T00:13:26.727625Z","submitted_at":"2026-03-02T18:46:28Z","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.02175","snapshot_observed_at":"2026-07-31T05:08:19.882679Z","title":"Kiwi-Edit: Versatile video editing via instruction and reference guidance.arXiv preprint arXiv:2603.02175, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.882679Z"},"links":{"cited_paper":"/paper/2603.02175","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f8886d61c3fb300553764341244378525855f2e6d279d7d9f829105e742e182a","observation_id":"381b38d9-d150-4018-8fed-6a2b508ea59d","resolution":{"observed_at":"2026-07-31T05:08:19.882679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26244","snapshot_observed_at":"2026-07-31T05:08:19.892043Z","title":"Longav-compass: Towards unified eval- uation of minute-scale audio-visual generation across t2av, i2av, and v2av.arXiv preprint arXiv:2605.26244, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.892043Z"},"links":{"cited_paper":"/paper/2605.26244","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:6798e2afc780d215ac0cc103ee3058505a4bbef0a424bf9a859460b6afa2ce78","observation_id":"936c2fd8-3e98-48ca-8f67-3c4ceecf8b7c","resolution":{"observed_at":"2026-07-31T05:08:19.892043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14681","last_updated":"2026-07-16T07:43:27Z","snapshot_observed_at":"2026-08-10T00:05:33.584146Z","submitted_at":"2026-07-16T07:43:27Z","title":"ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14681","snapshot_observed_at":"2026-07-31T05:08:19.906135Z","title":"ReBind: Multi-reference video editing via structured instruc- tions with explicit reference relationships.arXiv preprint arXiv:2607.14681, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.906135Z"},"links":{"cited_paper":"/paper/2607.14681","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:2c2098134840726e8e0f180d9239e4d11c4e5e0eef0e37d4808450a137371e21","observation_id":"a3f69209-b7f3-4682-af80-3f0d9950324d","resolution":{"observed_at":"2026-07-31T05:08:19.906135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-07-31T05:08:19.913515Z","title":"UniVL: A unified video and language pre-training model for multimodal understanding and generation.arXiv preprint arXiv:2002.06353, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.913515Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:80c09fb0935966dd138453674ea0e1ac7cc769c48668b4d3e8b6cadc5ebe2799","observation_id":"a68f4953-7a95-42ca-948f-95555a8fc5cf","resolution":{"observed_at":"2026-07-31T05:08:19.913515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.920877Z","title":"Video-ChatGPT: Towards detailed video un- derstanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.920877Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:3a8b70ba0dfff282d3a1bb5209504dcad8ca655b798d0c9953fcba8ab9842045","observation_id":"615d3bc5-6a95-4e2d-b61d-a1eebcacc36c","resolution":{"observed_at":"2026-07-31T05:08:19.920877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.928150Z","title":"Mavors: Multi-granularity video representation for multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.928150Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f1a72005235becb4cb8bc9404bba7d5c3c1acbcf4138a462e482372ab50c55e4","observation_id":"f9e5cb05-37fb-4071-bc4d-d9d543497470","resolution":{"observed_at":"2026-07-31T05:08:19.928150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.934415Z","title":"Mme-videoocr: Evaluating ocr-based capabilities of multimodal llms in video scenarios.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.934415Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:9a671da567fc35e6f0cc2bee77c22d824517353bfd27a88f5140aa5f4a0dceb7","observation_id":"bfe5d3fb-b499-4e26-bc43-6dd95317afaf","resolution":{"observed_at":"2026-07-31T05:08:19.934415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.17756","last_updated":"2026-05-04T10:51:05Z","snapshot_observed_at":"2026-07-06T22:42:57.796038Z","submitted_at":"2026-01-25T09:02:33Z","title":"MV-S2V: Multi-View Subject-Consistent Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.17756","snapshot_observed_at":"2026-07-31T05:08:19.942411Z","title":"MV-S2V: Multi-view subject-consistent video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.942411Z"},"links":{"cited_paper":"/paper/2601.17756","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:88b25f5d0280bf7859cf827b3806be639b1aea616fb25c501122dc01381bd48c","observation_id":"e622f811-a402-40e9-a67e-af992d2c6438","resolution":{"observed_at":"2026-07-31T05:08:19.942411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.962027Z","title":"VideoBERT: A joint model for video and language representation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.962027Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:a4f93c47e43d7c72a21ec643f2483dcf7b7d7183258ad657bc425719837c567b","observation_id":"c6eb2ebc-b5d9-4832-800d-c3cb37952d86","resolution":{"observed_at":"2026-07-31T05:08:19.962027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14202","last_updated":"2026-07-15T17:46:12Z","snapshot_observed_at":"2026-08-11T01:48:35.544753Z","submitted_at":"2026-07-15T17:46:12Z","title":"KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14202","snapshot_observed_at":"2026-07-31T05:08:19.970664Z","title":"Keyframe-compass: Towards comprehen- sive evaluation of keyframe-conditioned video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.970664Z"},"links":{"cited_paper":"/paper/2607.14202","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:37316061af9144b13284a44b2f4aad20a90a9dfca647dbc899da1973ec1107c9","observation_id":"0e950d10-d95c-4277-b5ac-2d157881787b","resolution":{"observed_at":"2026-07-31T05:08:19.970664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18984","last_updated":"2026-05-18T18:04:54Z","snapshot_observed_at":"2026-08-06T16:26:18.830320Z","submitted_at":"2026-05-18T18:04:54Z","title":"Artifact-Bench: Evaluating MLLMs on Detecting and Assessing the Artifacts of AI-Generated Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18984","snapshot_observed_at":"2026-07-31T05:08:19.981955Z","title":"Artifact-bench: Evaluating mllms on detecting and assessing the artifacts of ai-generated videos","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.981955Z"},"links":{"cited_paper":"/paper/2605.18984","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:219bc85a7e30fd7f9d0d8384384eb9de480d5ee30748af7963a6c51bc3f8dcd4","observation_id":"b1320625-5011-40a3-83c6-97bb1683d67f","resolution":{"observed_at":"2026-07-31T05:08:19.981955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:19.991054Z","title":"Qwen3.6-35B-A3B: Agentic coding power, now open to all, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:19.991054Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:4e08ef48674c4a8d26f698d85aaadc9e8bcc01def503cc51cf81a39f5b0b8413","observation_id":"5e088145-2503-4500-af3d-d9708d3888b2","resolution":{"observed_at":"2026-07-31T05:08:19.991054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.001766Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.001766Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:94085b1a1d4caee93a3015a1f30bee1c9bb591af56e71480603a3f815d25e47b","observation_id":"d1c040a0-a24c-46dd-bfd9-f94d9c9b30a2","resolution":{"observed_at":"2026-07-31T05:08:20.001766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-12T23:31:58.325076Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-07-31T05:08:20.012837Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.012837Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f4d2706576f72dbadb0fccb827f3fc7c51b07108dd0e79422015263d8db40643","observation_id":"9643093e-bfed-4251-9083-b15b50c20ec5","resolution":{"observed_at":"2026-07-31T05:08:20.012837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.021800Z","title":"Monet: Reasoning in latent visual space beyond images and language.arXiv preprint arXiv:2511.21395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.021800Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:38bca78bc21579acf72398c8f12a2b6c6c1c72512a940ddb091a8377d7463a69","observation_id":"504f917d-82c7-4a01-a168-bbe21f75d59e","resolution":{"observed_at":"2026-07-31T05:08:20.021800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-07-31T05:08:20.031978Z","title":"InternVL3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.031978Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f646765ec5a74d21b5cabe11f5562cf978b53bb36ce2dded06f9b6895657d853","observation_id":"cdb0bcbb-9b50-40f2-9e0a-9b548a1b3769","resolution":{"observed_at":"2026-07-31T05:08:20.031978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.045854Z","title":"VaTeX: A large-scale, high- quality multilingual dataset for video-and-language research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.045854Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:39a22f5debd9c4f638a0f7e28310ac37bb37af9d43832bf4e633d3f03c12b2d9","observation_id":"dd8e0b6b-1218-4c10-b85e-65931206b4b5","resolution":{"observed_at":"2026-07-31T05:08:20.045854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.070937Z","title":"Intern- Video2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.070937Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:438478cdc475dda461422d7675de99259cfbe7120366d18f61e33494757e54ec","observation_id":"832921ac-748d-4087-8db4-f2144980eff4","resolution":{"observed_at":"2026-07-31T05:08:20.070937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15393","last_updated":"2025-03-01T02:06:59Z","snapshot_observed_at":"2026-08-11T16:06:29.545521Z","submitted_at":"2025-02-21T11:40:23Z","title":"LongCaptioning: Unlocking the Power of Long Video Caption Generation in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15393","snapshot_observed_at":"2026-07-31T05:08:20.086437Z","title":"LongCaptioning: Unlocking the power of long video caption generation in large multimodal models.arXiv preprint arXiv:2502.15393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.086437Z"},"links":{"cited_paper":"/paper/2502.15393","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:fcba8efd0a08ec1f11284041c536e319cb7bd8936297f6c4fa62e4c9187b5ebb","observation_id":"e5dae559-0b17-4e16-a728-7434a8665c0f","resolution":{"observed_at":"2026-07-31T05:08:20.086437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-13T00:54:10.064007Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-07-31T05:08:20.095639Z","title":"MiMo-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.095639Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:599584b2f35770e0f2d4292c33cbdc4188fa8c45572b4fa03f07a444a50e91bd","observation_id":"a7a12be9-d250-4a05-8de4-ccfca55f846b","resolution":{"observed_at":"2026-07-31T05:08:20.095639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.106010Z","title":"LumosX: Relate any identities with their attributes for personalized video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.106010Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:2b0c761b554358a99c17126707e8ce513fd939d881da61fa7cd6b57a6ee10bca","observation_id":"75d6403e-93ba-456f-aa11-c6fd1c55050f","resolution":{"observed_at":"2026-07-31T05:08:20.106010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.115431Z","title":"MSR-VTT: A large video description dataset for bridging video and lan- guage","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.115431Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:b9ff08a2174e62241e3ce6e84c9556dfcc1b1ccb5ebcd403434ef6aef6c6fcc2","observation_id":"ebe59067-2732-403c-a53a-3905d0203d1b","resolution":{"observed_at":"2026-07-31T05:08:20.115431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.131232Z","title":"Progress-aware video frame captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.131232Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:3314bb11510fa6cf9365e5116e30cbd1727f7aa905f11bad4c176d87e4d4c044","observation_id":"eff35ee6-1a97-4754-850f-c57dd0aea30f","resolution":{"observed_at":"2026-07-31T05:08:20.131232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-13T01:51:24.874744Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.01563","snapshot_observed_at":"2026-07-31T05:08:20.137192Z","title":"Kwai Keye-VL 1.5 technical report.arXiv preprint arXiv:2509.01563, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.137192Z"},"links":{"cited_paper":"/paper/2509.01563","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:709a27b2e4806046c38f33ff0e1173dd05d3318e83caac334af9bc37faaf8143","observation_id":"e7d57d85-9cea-4001-bb59-f7aac00a37b4","resolution":{"observed_at":"2026-07-31T05:08:20.137192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20292","last_updated":"2025-06-03T10:11:00Z","snapshot_observed_at":"2026-08-13T08:36:31.666971Z","submitted_at":"2025-05-26T17:59:46Z","title":"OpenS2V-Nexus: A Detailed Benchmark and Million-Scale Dataset for Subject-to-Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20292","snapshot_observed_at":"2026-07-31T05:08:20.144127Z","title":"OpenS2V-Nexus: A detailed benchmark and million-scale dataset for subject- to-video generation.arXiv preprint arXiv:2505.20292, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.144127Z"},"links":{"cited_paper":"/paper/2505.20292","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:4f618347e477c913900d145c873827a9fffe1c1f9dbc1b834a4ac1c5314d49e4","observation_id":"1fdba910-7052-43bc-a0ce-292612471ffe","resolution":{"observed_at":"2026-07-31T05:08:20.144127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-07-31T05:08:20.154107Z","title":"VideoLLaMA 3: Frontier mul- 10 timodal foundation models for image and video understand- ing.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.154107Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:de67966072b54dc5ca19802df8474ab74dda459ca3a118e74f994ce7fd982060","observation_id":"58e3c8b7-1217-441c-92a7-d2575c5889ea","resolution":{"observed_at":"2026-07-31T05:08:20.154107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.160261Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.160261Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:ed51c6e1f790e75576fba09c0deb80738be93db8a0c33ffc70599f76be56a2a1","observation_id":"26dda30b-25a9-4516-8989-979dba28bf11","resolution":{"observed_at":"2026-07-31T05:08:20.160261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.170380Z","title":"VCapsBench: A large-scale fine-grained benchmark for video caption quality evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.170380Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f0420e9ed2bf7393014077159c18615c8377ab684fc4af2e02a3c21f8cb48506","observation_id":"9b1d58b1-77ce-4a71-b977-9a7e07eb5853","resolution":{"observed_at":"2026-07-31T05:08:20.170380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14189","snapshot_observed_at":"2026-07-31T05:08:20.178883Z","title":"MultiRef-Compass: Towards comprehensive evaluation of multi-reference-to-audio-video generation.arXiv preprint arXiv:2607.14189, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.178883Z"},"links":{"cited_paper":"/paper/2607.14189","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:622940c3d5023b15740483a655a4709ace456dece9b38e6e576840e5b8570ef0","observation_id":"16ef230b-d319-41b9-8b12-9628295b96e0","resolution":{"observed_at":"2026-07-31T05:08:20.178883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.185599Z","title":"Debiasing multimodal large language models via penal- ization of language priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.185599Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:1f17019d40c29e2b5d781a10901d3973c03af18b16664b462c8a3d4ce814ef55","observation_id":"9799e92a-b957-4f5b-84e3-496b094fb6fb","resolution":{"observed_at":"2026-07-31T05:08:20.185599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:08:20.197862Z","title":"from <Image_N>","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.197862Z"},"links":{"citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:f08e2a693ed000d17fa7bcbc7b9907a13c1c33546b1b313c0da15374fed62715","observation_id":"6e3b8fe5-73e7-4103-9538-2a8d605865c7","resolution":{"observed_at":"2026-07-31T05:08:20.197862Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.28509."}