{"as_of":"2026-08-08T06:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48977192eb89ba9a8ac1536d54f00c11a4a892ce475b19a53f411e1ec6e487ff","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:53:21.073886Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T01:05:26.926438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-08T01:05:27.182138Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2507.01492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01492","snapshot_observed_at":"2026-08-08T01:05:27.182138Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","venue":"cs.CV","work_id":"8b7b8e80-6767-498e-a92d-a3fc0720a761","year":2025},"citing_paper":{"arxiv_id":"2608.03046","last_updated":"2026-08-04T02:55:10Z","snapshot_observed_at":"2026-08-08T00:56:47.615651Z","submitted_at":"2026-08-04T02:55:10Z","title":"CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T01:05:26.926438Z"},"links":{"cited_paper":"/paper/2507.01492","citing_paper":"/paper/2608.03046"},"observation_digest":"sha256:3c5abce85d4c1d14494a8057e3a47fd441a595133927eda1d9dcf90c20577e72","observation_id":"4d026c89-1521-4c95-a135-b6cd914c956b","resolution":{"observed_at":"2026-08-08T01:05:27.188251Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01492/citation-record","integrity":"/paper/2507.01492/integrity","json":"/paper/2507.01492/citation-record.json","paper":"/paper/2507.01492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:53:19.709202Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.709202Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:8749013619ad2100518200d939394d6355ce2588bb03004bcbe2414a6286a718","observation_id":"9fe64d67-b6fd-4161-9c67-9f5f0b0eb188","resolution":{"observed_at":"2026-08-06T20:53:19.709202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-05T07:07:38.309470Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-06T20:53:19.764060Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.764060Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:3baa42ef7b8ed4b1732e4551de042f0796f49723cdde90c9c2c22dff739f8d86","observation_id":"2e94a8c9-1420-4ad4-97ce-400db8aba0f9","resolution":{"observed_at":"2026-08-06T20:53:19.764060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:22.320053Z","title":"Personal- 4 ized video summarization by multimodal video understand- ing","venue":null,"work_id":"7f087580-6be6-40e2-a838-fc70fa906933","year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.833575Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:5d4b43f7a87dda0c1f33d5ea8b7c58fd331de5022b777750d4ef47ad23880212","observation_id":"c4068880-fffb-454c-9764-ff3ea91bdf1b","resolution":{"observed_at":"2026-08-06T20:53:22.379581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:22.164058Z","title":"Sharegpt4video: Improving video understanding and generation with better captions, 2024","venue":null,"work_id":"d3359f1d-c322-4df0-b4e0-6a313ad36941","year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.908823Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:9b7cf1853e694e6662c5a834bb5979eaaf0eb1676ce2b22cad20f3835f9d7a4e","observation_id":"740fe1f0-4bfb-4316-960a-00379e54b628","resolution":{"observed_at":"2026-08-06T20:53:22.208046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:19.971746Z","title":"Versavid-r1: A versatile video understanding and reasoning model from question answering to captioning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:19.971746Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:35307b020030afc764f6c15015a1e72527c8ece56ee12eea472860eda3d6d8a1","observation_id":"8f8b76c6-569e-4441-a756-8921c0ef814e","resolution":{"observed_at":"2026-08-06T20:53:19.971746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00318","last_updated":"2026-04-04T04:38:43Z","snapshot_observed_at":"2026-07-06T21:34:05.672636Z","submitted_at":"2025-05-31T00:08:21Z","title":"Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00318","snapshot_observed_at":"2026-08-06T20:53:20.012906Z","title":"Chain-of-frames: Advancing video understanding in multimodal llms via frame-aware reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.012906Z"},"links":{"cited_paper":"/paper/2506.00318","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:b7c84d4610b9aa32945732111e9e3570b413c90b832e3e3db53d30003faac2e1","observation_id":"42df691b-53f9-4751-a864-fee302343cbc","resolution":{"observed_at":"2026-08-06T20:53:20.012906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T20:53:20.062315Z","title":"Aria: An open multimodal native mixture-of- experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.062315Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:fff221c0b85fd439e860c48f4bbc0d805c7bf6cc74a3ec32f6298f2feb47fedd","observation_id":"81842245-3584-42af-815f-d44d8e3626c9","resolution":{"observed_at":"2026-08-06T20:53:20.062315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-06T20:53:20.138597Z","title":"Videochat- flash: Hierarchical compression for long-context video mod- eling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.138597Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:22f8e5297446f34b9684b450ce8035a68eed6a5fbc9c6ccefdf33fb6188a575b","observation_id":"632099fc-9a4c-47e4-b513-325dddaaf3e7","resolution":{"observed_at":"2026-08-06T20:53:20.138597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-08-07T16:00:09.944765Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-08-06T20:53:20.191292Z","title":"Describe anything: Detailed localized image and video captioning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.191292Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:3f7c9be8741b2384ec1e59134c3afa5e7300f924e1b74051950379e34c3d4023","observation_id":"5e285e60-b5a0-4e43-b69b-06dd47471ff1","resolution":{"observed_at":"2026-08-06T20:53:20.191292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:20.256177Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.256177Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:911296f44a7049282981bbab786da4523890301b0159d01f5c9fb897894e3cf4","observation_id":"aa56aee0-a092-4d00-bf56-8ac3e8d230f4","resolution":{"observed_at":"2026-08-06T20:53:20.256177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.995170Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking, 2025","venue":null,"work_id":"6aa238cb-122f-412d-b02e-052fba4999d5","year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.295026Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:e6f20957a9a4526b28cb44fcbb22cd1b285bf60c3a773bf7675c748894c96129","observation_id":"5a27968d-73f0-4706-a707-88aff6f7073a","resolution":{"observed_at":"2026-08-06T20:53:22.081458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18152","last_updated":"2025-04-25T08:05:32Z","snapshot_observed_at":"2026-08-07T15:59:17.660418Z","submitted_at":"2025-04-25T08:05:32Z","title":"ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18152","snapshot_observed_at":"2026-08-06T20:53:20.338147Z","title":"Ac- tionart: Advancing multimodal large models for fine- grained human-centric video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.338147Z"},"links":{"cited_paper":"/paper/2504.18152","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:db4fc0cc4c56e0f5089217d19b27a3405643d74b312b2a79d0e6f5e371eace91","observation_id":"25fe8ebe-aa16-489f-aea8-7827e1cd60b3","resolution":{"observed_at":"2026-08-06T20:53:20.338147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.824807Z","title":"Cockatiel: Ensembling synthetic and hu- man preferenced training for detailed video caption, 2025","venue":null,"work_id":"31f33147-26b2-4f98-bcb8-15d1259c96e6","year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.381184Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:5d5583d50c7c509f6c5c097741aec264001c1fc2029e9facfe1905a921e12abe","observation_id":"8a90b50f-be42-4b50-b8ce-caff318d76b8","resolution":{"observed_at":"2026-08-06T20:53:21.865289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.721819Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"290bebd2-bff6-49d3-8d8d-162b9153ecf2","year":2023},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.441583Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:01abadd674073e0e7b32669aa1d012a1571d59a97df5a2d7b16e2a99958b54af","observation_id":"9db24de2-15f7-4aee-a32a-5d542f5de9c8","resolution":{"observed_at":"2026-08-06T20:53:21.766181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05541","last_updated":"2025-04-09T02:30:44Z","snapshot_observed_at":"2026-08-07T16:07:46.494762Z","submitted_at":"2025-04-07T22:35:36Z","title":"Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05541","snapshot_observed_at":"2026-08-06T20:53:20.489681Z","title":"Caption anything in video: Fine- grained object-centric captioning via spatiotemporal multi- modal prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.489681Z"},"links":{"cited_paper":"/paper/2504.05541","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:0cf80dd1dc51d2b4e46ef0e771fc78340a8e1c8e9cf77b12380569aa88c72d76","observation_id":"e7e616bd-45a4-4437-83a7-612507711469","resolution":{"observed_at":"2026-08-06T20:53:20.489681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T20:53:20.539317Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.539317Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:5a45dd982ef5259467ac2abd3a72d518668918b29a2d93dd4a7839d4474e79a8","observation_id":"0daa0044-fe45-4da8-873d-8fa6a4394704","resolution":{"observed_at":"2026-08-06T20:53:20.539317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.624133Z","title":"Progress-aware video frame captioning","venue":null,"work_id":"c03c8929-0ec4-469f-b96f-dc42e8122bbd","year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.617223Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:7f92515679dc7be118cec1de5d150c8b8ad20d572d726e7417a87dcba892de67","observation_id":"467c9247-8a1a-4fd7-953e-12fe389bb211","resolution":{"observed_at":"2026-08-06T20:53:21.674173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-07T12:43:01.932268Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-08-06T20:53:20.756229Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.756229Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:eb3b0486d8e4d09d8c213de45680ad1351e1568f268fdd61847c14ba5a247d8f","observation_id":"b44abbe4-452e-4abe-804d-ad4bb0f2d803","resolution":{"observed_at":"2026-08-06T20:53:20.756229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T20:53:21.033536Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:21.033536Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:0c00d3ef727ec1fce6b495c4132887a7f99d0837866a5355403ffc6e94b61605","observation_id":"9d1e3cba-0d00-4e50-a1e7-d1699e39c8d3","resolution":{"observed_at":"2026-08-06T20:53:21.033536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:53:21.482878Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":"407a4fd0-b91d-4941-9767-99414bbb2e97","year":2024},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:21.073886Z"},"links":{"citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:27188719e8b9a42527fedd0810d58fb6554def36ca5330324b19db1191bbf972","observation_id":"f140f3be-3eb9-4c52-a2d4-ff48d67292d1","resolution":{"observed_at":"2026-08-06T20:53:21.559531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:47:37.885961Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2507.01492."}