{"as_of":"2026-08-12T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed78eeb6f7ebdaef874a3fa2f0632a6fc252b89f3f1374771ad28e377f7fcb0b","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:13:44.573450Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06930/citation-record","integrity":"/paper/2608.06930/integrity","json":"/paper/2608.06930/citation-record.json","paper":"/paper/2608.06930"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.001303Z","title":"Avocado: An audiovisual video captioner driven by temporal orchestration.arXiv preprint arXiv:2510.10395, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.001303Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ee25ca1a62c82145f9a563c9893d3b76c639744507d22c1d3ead5d28bffc316b","observation_id":"4eaed5f7-1f2a-4ff8-8f8f-92924844fd08","resolution":{"observed_at":"2026-08-10T18:13:44.001303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.012944Z","title":"Ugc-videocaptioner: An omni ugc video detail caption model and new benchmarks.arXiv preprint arXiv:2507.11336, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.012944Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:91b2e46af62ebb868c4dfe4e7bdd8b981265a5affec61cdabba72b812b60bd73","observation_id":"b695bdef-a788-4514-949d-8065a0a98e1f","resolution":{"observed_at":"2026-08-10T18:13:44.012944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.020242Z","title":"Daily-omni: Towards audio-visual reasoning with temporal alignment across modalities.arXiv preprint arXiv:2505.17862, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.020242Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:54766c16153b4ad9514c0e729317bac299ec1e00eeec9a2d900096f1eb173ddf","observation_id":"ad1b155c-49ef-45af-b7b2-78dea5511969","resolution":{"observed_at":"2026-08-10T18:13:44.020242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12782","last_updated":"2025-05-17T09:49:22Z","snapshot_observed_at":"2026-08-09T00:20:10.216953Z","submitted_at":"2025-02-18T11:42:17Z","title":"VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12782","snapshot_observed_at":"2026-08-10T18:13:44.027540Z","title":"Vidcapbench: A comprehensive benchmark of video captioning for controllable text-to-video generation.arXiv preprint arXiv:2502.12782, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.027540Z"},"links":{"cited_paper":"/paper/2502.12782","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2d4b1a8863e40e8279d57eec8f5a2ee4172a9340471c5d94f901d9bdf8901ccf","observation_id":"f454879b-db8d-4894-b6a7-98084bef545c","resolution":{"observed_at":"2026-08-10T18:13:44.027540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.156141Z","title":"Sharegpt4video: Improving video understanding and generation with better captions.Advances in Neural Information Processing Systems, 37: 19472–19495, 2024","venue":null,"work_id":"1e690184-3f6b-48a3-822f-fd280333a921","year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.035846Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:4a388e2f50f12643bacea00eba837eb4c250058e48c3f25b6967517329175a64","observation_id":"8f6e4ae1-519f-4569-be74-61cf0eed85a9","resolution":{"observed_at":"2026-08-10T18:13:47.162755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.043255Z","title":"Mavors: Multi-granularity video representation for multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.043255Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:c89a50be732d777dcc65be1ad8c682354f7ac95d2eaf8f041f1652e623e2a03a","observation_id":"55a344b0-2078-444f-9837-3581bfcb57db","resolution":{"observed_at":"2026-08-10T18:13:44.043255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.051144Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.051144Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:95149189b9ab6c9c94cc1186fa7d5f1da30910622db4312a48d67152991dee26","observation_id":"5c73a9e0-e967-446c-a679-d61cfd231a08","resolution":{"observed_at":"2026-08-10T18:13:44.051144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-11T06:04:22.773616Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-10T18:13:44.059127Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.059127Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:76d46182a6b1b5b155b3a558c7743ac1a8f64fe331eb146f9390e806c60a0ecf","observation_id":"90db9274-bbf3-46ad-8514-45a615392547","resolution":{"observed_at":"2026-08-10T18:13:44.059127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-08-10T20:27:34.844428Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-10T18:13:44.066103Z","title":"Tarsier2: Advanc- ing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.066103Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:9072e78d05f65fedf444663592311f9b757bbf0f4f317c0621332e8e9ae704f4","observation_id":"b84cf9f9-f405-441b-9a80-a8a0db9a6853","resolution":{"observed_at":"2026-08-10T18:13:44.066103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.074176Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.074176Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e31c22930fd1730606c4c94788ff17e4e2bc4abf660332acee9fb849de40dbaa","observation_id":"ac750a63-35b8-467a-9019-cfa9d9a1d905","resolution":{"observed_at":"2026-08-10T18:13:44.074176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.102460Z","title":"Advancing high-resolution video-language representation with large-scale video transcriptions","venue":null,"work_id":"21a572d7-40de-4004-80f7-b7948e53e75d","year":2022},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.080659Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:4d94f5a23a746d1dd353601e7bde0d185c730ecda453ecd2377a7bdf564db1f8","observation_id":"727dae58-6d8b-4478-bb13-886fcd349312","resolution":{"observed_at":"2026-08-10T18:13:47.108399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.087226Z","title":"video-salmonn 2: Captioning-enhanced audio-visual large language models.arXiv preprint arXiv:2506.15220, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.087226Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:8e7e139f2fee9835dd053b9945cfb359e7a36eb427b2f08218ed8107ec808bd0","observation_id":"6995e3e9-3e81-4806-af86-eef40d176bdb","resolution":{"observed_at":"2026-08-10T18:13:44.087226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18325","last_updated":"2025-03-17T08:14:35Z","snapshot_observed_at":"2026-08-10T23:13:20.183589Z","submitted_at":"2024-10-23T23:36:06Z","title":"AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18325","snapshot_observed_at":"2026-08-10T18:13:44.093438Z","title":"Avhbench: A cross-modal hallucination benchmark for audio-visual large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.093438Z"},"links":{"cited_paper":"/paper/2410.18325","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6afc83cac700eb42236a1ab90f6aeab37b904444825143343137b1b32248673f","observation_id":"7f752d0b-4aad-460d-9aba-c565c4d88bb7","resolution":{"observed_at":"2026-08-10T18:13:44.093438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.081185Z","title":"Longvale: Vision-audio-language-event benchmark towards time-aware omni-modal perception of long videos","venue":null,"work_id":"8f6418c5-b446-40e9-b4e2-9464c13b1583","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.099582Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:58511d367d1339b91163c9b7b587e77dfb9e98363e1ed82b13aeb52c654cd08a","observation_id":"70ff3cbf-52e2-4513-b5d7-e931862558b8","resolution":{"observed_at":"2026-08-10T18:13:47.086591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22045","last_updated":"2025-05-28T07:08:17Z","snapshot_observed_at":"2026-08-10T01:59:43.684934Z","submitted_at":"2025-05-28T07:08:17Z","title":"Mitigating Audiovisual Mismatch in Visual-Guide Audio Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22045","snapshot_observed_at":"2026-08-10T18:13:44.106889Z","title":"Miti- gating audiovisual mismatch in visual-guide audio captioning.arXiv preprint arXiv:2505.22045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.106889Z"},"links":{"cited_paper":"/paper/2505.22045","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:99507cdd9ceac3ac1f960e6ec91bee74138fa78605d99b9b97b57b89a56857ae","observation_id":"8db4405e-fa54-4f54-95d9-ff440f26235c","resolution":{"observed_at":"2026-08-10T18:13:44.106889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T18:13:44.113320Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.113320Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:1e1fa7e8b384428fb5bf18fee9f0f185c9138a9f6b6a4618d480ed78edbc48d5","observation_id":"a402971b-163d-41f1-bf6a-5779e77e4a33","resolution":{"observed_at":"2026-08-10T18:13:44.113320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-10T18:13:44.120212Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.120212Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:75a9bae5cd79bd5ecac3ac7cb06010456ad86523960b8b1f049760850e989bc1","observation_id":"fafedc81-20fb-4608-872c-4b5035d3bde9","resolution":{"observed_at":"2026-08-10T18:13:44.120212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n18-2125","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.626564Z","title":"Watch, listen, and describe: Globally and locally aligned cross-modal attentions for video captioning","venue":null,"work_id":"7453fde5-6d61-474d-b7a2-f1303a1373ad","year":2018},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.126805Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:a132229cb7e6e7e4e60107b0898b00d44ba1f7022bfee7b33fea20f125986cd0","observation_id":"87b8dd1b-90a8-4b20-bc27-6bb85e24b4a2","resolution":{"observed_at":"2026-08-10T18:13:44.635267Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-10T18:13:44.133036Z","title":"Videoclip: Contrastive pre-training for zero- shot video-text understanding.arXiv preprint arXiv:2109.14084, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.133036Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ed048b3a58b2c6d3baadab3fb1d1ba5ec070769cbadd9e2c8a20a9143a55ed1a","observation_id":"e10c871d-faef-49c8-bac8-ad08c41aec11","resolution":{"observed_at":"2026-08-10T18:13:44.133036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-10T18:13:44.140160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.140160Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:5b97030e9b42887f53278502fa42e26466e5c01e27b510e072baa7bd0cc9df04","observation_id":"3a17029f-7952-4eac-a5f8-50f77b513d43","resolution":{"observed_at":"2026-08-10T18:13:44.140160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.146443Z","title":"Glave-cap: Global-local aligned video captioning with vision expert integration.arXiv preprint arXiv:2509.11360, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.146443Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:98e05f0155bdb4d25d54b31322d076b6bc454033571541247757d6afa2ac58ba","observation_id":"2d47876c-b084-4857-a211-94c6eba7760b","resolution":{"observed_at":"2026-08-10T18:13:44.146443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-10T18:13:44.151110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.151110Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b1d04db2dbcfae591b175d23c274f326969372e4283e8a4a86a3d74d844433bc","observation_id":"f8f1a29e-aef0-4ac8-9db6-e8e868898a3a","resolution":{"observed_at":"2026-08-10T18:13:44.151110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-08-07T21:01:40.617151Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-10T18:13:44.157674Z","title":"Omnicaptioner: One captioner to rule them all.arXiv preprint arXiv:2504.07089, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.157674Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:9a9535a13936881bcf9fdfd9158aadce603aeb7fa63de206f15c6fc7d179ac67","observation_id":"ead60c4d-46c1-4950-977f-efa478de054f","resolution":{"observed_at":"2026-08-10T18:13:44.157674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.163332Z","title":"Omni-captioner: Data pipeline, models, and benchmark for omni detailed perception.arXiv preprint arXiv:2510.12720, 2025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.163332Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e5d27314ae0c557343615e895692a7be1d2b47a5bac9f92a6dbba46775f08032","observation_id":"d1c38d65-50d3-4629-b59f-5b52c5a203e4","resolution":{"observed_at":"2026-08-10T18:13:44.163332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T18:13:44.169838Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.169838Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b520dd4391444ff17555bc0bc99963e2235597701916b57b5589eb90fef737c3","observation_id":"aab17aee-273f-41a8-9111-9ea95809ed00","resolution":{"observed_at":"2026-08-10T18:13:44.169838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-10T18:13:44.176917Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.176917Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:cff120f30a5717a057f7762aac87d90725d352dbed887bc12e2eb67fc9a130b3","observation_id":"91ab4e8d-8701-43e7-a6f1-180c2e0142ef","resolution":{"observed_at":"2026-08-10T18:13:44.176917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16918","last_updated":"2026-04-28T12:04:04Z","snapshot_observed_at":"2026-08-09T15:59:03.013255Z","submitted_at":"2025-12-18T18:59:55Z","title":"AdaTooler-V: Adaptive Tool-Use for Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16918","snapshot_observed_at":"2026-08-10T18:13:44.183615Z","title":"Adatooler-v: Adaptive tool-use for images and videos.arXiv preprint arXiv:2512.16918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.183615Z"},"links":{"cited_paper":"/paper/2512.16918","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:406eabd133144023586a2da81e96029250a1b9fda7e6233ca1ed66d4708d08af","observation_id":"1dfeba4d-990f-4466-961f-7991cdc82a8b","resolution":{"observed_at":"2026-08-10T18:13:44.183615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.190682Z","title":"Deepvideo-r1: Video rein- forcement fine-tuning via difficulty-aware regressive grpo.arXiv preprint arXiv:2506.07464, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.190682Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:23b7b392c74602c4fb887f6b9063bf2b530861387ba459e86c76783645bbbef6","observation_id":"0e486e27-48ba-4008-87db-37a63dcf1e18","resolution":{"observed_at":"2026-08-10T18:13:44.190682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.197366Z","title":"Editthinker: Unlocking iterative reasoning for any image editor","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.197366Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d5fd2ccfa2ef60f871ed1ec838b342b1eb7bee85dc187804d50b2055f4a4df7c","observation_id":"89671b3f-be56-4556-bfb1-d94ce96e8412","resolution":{"observed_at":"2026-08-10T18:13:44.197366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.204027Z","title":"Sophiavl-r1: Reinforcing mllms reasoning with thinking reward.arXiv preprint arXiv:2505.17018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.204027Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:0129d3910773759cb19ec4850bfa6fe06d72a3a4653d06fb70061cd5c27704f0","observation_id":"7e3a51c8-22b5-4d13-a606-cc7a0e510022","resolution":{"observed_at":"2026-08-10T18:13:44.204027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09965","last_updated":"2025-06-19T03:46:55Z","snapshot_observed_at":"2026-07-31T21:40:49.363128Z","submitted_at":"2025-06-11T17:41:50Z","title":"Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09965","snapshot_observed_at":"2026-08-10T18:13:44.209331Z","title":"Reinforcing spatial reasoning in vision-language models with interwoven thinking and visual drawing.arXiv preprint arXiv:2506.09965, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.209331Z"},"links":{"cited_paper":"/paper/2506.09965","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:7ff1f12ede54ca287098ab6b8845c04fb2b352e14443a30ee06994248fb5da24","observation_id":"3ec3c7c0-87f4-447b-885a-edc9ca334b31","resolution":{"observed_at":"2026-08-10T18:13:44.209331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-10T18:13:44.215349Z","title":"Time-r1: Post-training large vision language model for temporal video grounding.arXiv preprint arXiv:2503.13377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.215349Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:897083e93f310e7100522890817e3b8113b8ab51ff8b5a6ffe2bea6770dc4173","observation_id":"cf7d5b55-0444-40c4-aacb-a628a9681f73","resolution":{"observed_at":"2026-08-10T18:13:44.215349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-10T21:08:10.223339Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.03043","snapshot_observed_at":"2026-08-10T18:13:44.221576Z","title":"Onethinker: All-in-one reasoning model for image and video.arXiv preprint arXiv:2512.03043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.221576Z"},"links":{"cited_paper":"/paper/2512.03043","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:44469f3995e1104eaf625a0a3e6f4e29723256f212d35d8bbb560aff7c0b28f8","observation_id":"65539722-4660-4024-be93-223a12fa8d76","resolution":{"observed_at":"2026-08-10T18:13:44.221576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-10T18:13:44.228889Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.228889Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:998215df639d54a20bd82b7ec5548874b56b969b79b64c57623bb66e0b82241b","observation_id":"2eb3994f-034a-49ca-a654-13259944ce9d","resolution":{"observed_at":"2026-08-10T18:13:44.228889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01725","last_updated":"2025-06-02T14:30:09Z","snapshot_observed_at":"2026-08-08T07:45:08.111238Z","submitted_at":"2025-06-02T14:30:09Z","title":"VideoCap-R1: Enhancing MLLMs for Video Captioning via Structured Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01725","snapshot_observed_at":"2026-08-10T18:13:44.235558Z","title":"Videocap-r1: Enhancing mllms for video captioning via structured thinking.arXiv preprint arXiv:2506.01725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.235558Z"},"links":{"cited_paper":"/paper/2506.01725","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:f4b8cb7174f6809f55313ee9136fc4b35ad14e0da13ea5d747ceffc92acd60c9","observation_id":"53fcffc3-aa5f-49b5-ac92-20dd6ee28176","resolution":{"observed_at":"2026-08-10T18:13:44.235558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.062066Z","title":"Exploring the role of audio in video captioning","venue":null,"work_id":"43a04fe4-5d56-417d-a2bf-0222480024d6","year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.241601Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:3448d2b0bb5be32df2fab92fa05df4f4fe60b73813e7a9b5c3e4d9e3aab3b5df","observation_id":"d031b374-8983-4f7e-a325-cc8741da424e","resolution":{"observed_at":"2026-08-10T18:13:47.067484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.042673Z","title":"Hybrid transformers for music source separation","venue":null,"work_id":"a3a8b4a6-a13d-41b5-97e8-87d4653c56d2","year":2023},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.247461Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:51ede9069b49188ece6de248e7475684f7e4510c79109acc5e7f6af27a2722bf","observation_id":"81e8b0ea-9029-44e0-8c6e-06c0df6bdacb","resolution":{"observed_at":"2026-08-10T18:13:47.049145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.255613Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.255613Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:3796c790e92144a1b042b5f1b7a837a4cca21ddb75dc5ff8eae867c9f9516a6e","observation_id":"cc0ed116-12d4-4b94-929f-bb14edf82074","resolution":{"observed_at":"2026-08-10T18:13:44.255613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:47.012993Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"5f888f18-0cd2-4d24-bee2-49512d6f2b80","year":2020},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.261995Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2a8979a532adc43bfa1c198009987c37a5fe2246fac1c9b9bcd30dc9ab0d9ce4","observation_id":"f3944060-20a1-4e43-ac79-d894f5e3ef54","resolution":{"observed_at":"2026-08-10T18:13:47.018344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.268021Z","title":"Condensed movies: Story based retrieval with contextual embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.268021Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:c4d659b6f27c83714098e54e12f131d9a0a0ce44838e82730399134661db6061","observation_id":"3ca62a8c-3c7f-419f-b375-76f43901be93","resolution":{"observed_at":"2026-08-10T18:13:44.268021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.276994Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.276994Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:55a5acd8b148acdcec79617ff8ad218bc9772c55436c228cbe826702a77e1b18","observation_id":"a4d9dd4f-6e26-4315-92f0-725f21550be2","resolution":{"observed_at":"2026-08-10T18:13:44.276994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.973927Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"c29f068a-864f-4647-8261-841e8a603ea0","year":2020},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.284058Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b63e7a367a253befc01ebc46b9484f3cb4e7eb2f68c457a71a03c6d6de52b83b","observation_id":"fee2fdf0-5625-4f0b-a12f-fb4d2404f25a","resolution":{"observed_at":"2026-08-10T18:13:46.978977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.957507Z","title":"A dataset for movie description","venue":null,"work_id":"41236320-256f-4add-9c71-50e2cc360eaf","year":2015},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.292387Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:3cf29d93bd9c013399712259ee1188759d1403ec1898242bf5a097394452a8bd","observation_id":"c4d13c8f-2283-41b8-ba93-d06bd766d3e0","resolution":{"observed_at":"2026-08-10T18:13:46.962720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.941415Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"b86b9635-ea7a-49e3-b57a-57777a8a7866","year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.300777Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:2bd101a6df91d82c75417d544676452c813ab93da9d6820e7cd9a94dd4e6803a","observation_id":"09d3fbeb-410e-4146-9ec5-ad05891eb23f","resolution":{"observed_at":"2026-08-10T18:13:46.946632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.924156Z","title":"Time-r1: Post-training large vision language model for temporal video grounding","venue":null,"work_id":"8f217273-0269-43e0-9f6c-f7c45e38a948","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.313655Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:12cc87c9e19058e344d171f18773fa9f93c0d82a2afa8cedba387159cda23207","observation_id":"cdd33149-e7cc-4cc7-89a3-72bc5fc4f766","resolution":{"observed_at":"2026-08-10T18:13:46.929111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-12T04:39:24.530877Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.24164","snapshot_observed_at":"2026-08-10T18:13:44.857313Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","venue":"cs.CL","work_id":"533dbd2e-73c0-4397-9319-9314d0eafa0b","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.320002Z"},"links":{"cited_paper":"/paper/2505.24164","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d9a30ac939be9ac52aab5bde905ea47a73fc6eab1e30c8055bcea8b36c2c5321","observation_id":"41f95256-3d3a-4c1f-a884-73c828d10848","resolution":{"observed_at":"2026-08-10T18:13:44.864443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-10T18:13:44.329322Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.329322Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:581a39bd6cfd19693980095a2c1dec2312501b1eccab65a481d8322d02391a1a","observation_id":"d6ea50e2-06d0-4b15-981a-95988c63ed04","resolution":{"observed_at":"2026-08-10T18:13:44.329322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.336856Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1 (2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.336856Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:3dfb35ca4b6a37279dd4ced8c0b90dc55b5d7ffca3dd2f7052520cd03f8a0578","observation_id":"324bbfe1-68ca-488a-968a-de6c43b9bfcf","resolution":{"observed_at":"2026-08-10T18:13:44.336856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.342904Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.342904Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:64ff2771a4b0ad57321f610917f5c8bd8a98dd9d051e2e9a6535156203deaefc","observation_id":"fa408bef-362d-41bb-b75f-70b2b82f91e1","resolution":{"observed_at":"2026-08-10T18:13:44.342904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.369645Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.369645Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:5ff9ad598240d5f0ffdca23bf4a10e6b319dd5cbaeb2a08d295bebf42a34cd90","observation_id":"455e53d5-8b79-462a-8263-e33b9bceb9df","resolution":{"observed_at":"2026-08-10T18:13:44.369645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-10T18:13:44.376026Z","title":"Vbench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness.arXiv preprint arXiv:2503.21755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.376026Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:09b1a67e691cb90cf1d146b83ebe771697e6f783aa0f5baacba3529b8e2fa31b","observation_id":"367cf444-21a9-45a3-bae8-ce99e94b6814","resolution":{"observed_at":"2026-08-10T18:13:44.376026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-10T18:13:44.385618Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.385618Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:985eff1cd67d192a256842a32a616e571d7639079f186657ab0826edfbceb26e","observation_id":"1074ca18-4c48-469d-a37d-db46b91920bc","resolution":{"observed_at":"2026-08-10T18:13:44.385618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20939","last_updated":"2025-07-28T15:52:36Z","snapshot_observed_at":"2026-08-10T06:10:12.904760Z","submitted_at":"2025-07-28T15:52:36Z","title":"ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20939","snapshot_observed_at":"2026-08-10T18:13:44.392418Z","title":"Arc-hunyuan-video-7b: Structured video comprehension of real-world shorts.arXiv preprint arXiv:2507.20939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.392418Z"},"links":{"cited_paper":"/paper/2507.20939","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:28fb93aac7f5344b131e047715d96622582acc8c5fd916f2b537b0936fc1f4f3","observation_id":"8aeb4fe0-9bc3-4f5c-9714-ed4492a388df","resolution":{"observed_at":"2026-08-10T18:13:44.392418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.871392Z","title":"Minicpm-o 2.6: A gpt-4o level mllm for vision, speech, and multimodal live stream- ing on your phone.https://github.com/OpenBMB/MiniCPM-V, 2025","venue":null,"work_id":"a456a03f-43a4-4923-bf23-3c5b55275980","year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.399890Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:0360c9db37b27c4f8e37239c081c4c804eb82e3f7074831d9bb197062ac572ed","observation_id":"d59819bb-9364-46b4-a338-0f3746d8b9a2","resolution":{"observed_at":"2026-08-10T18:13:46.876062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-10T18:13:44.406841Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.406841Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:7c53ed322688d06f2fbe5b0b0e52e026ba68fcf5899ad6bddb42f3173dc83be6","observation_id":"dc9de645-8519-4180-9fae-51dfd07e6618","resolution":{"observed_at":"2026-08-10T18:13:44.406841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:44.414464Z","title":"Self- critical sequence training for image captioning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.414464Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:eac205431bc0d293a04190cf796b709f12bac84cfe9088a70f18ad422b2e20e3","observation_id":"be280df9-dcdb-4e6d-9846-4a4242ff3b46","resolution":{"observed_at":"2026-08-10T18:13:44.414464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.843379Z","title":"id\": \"sample id","venue":null,"work_id":"538dfaba-5b59-4b32-9f72-48ea3e0bc2b1","year":2002},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.422217Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:b4457f04e529d456f79bb76079cd003ab1f44bba1ed3db4a22e146e2e36fcd2b","observation_id":"c49af00d-fb79-4ee8-ac0e-6cd6f366ea28","resolution":{"observed_at":"2026-08-10T18:13:46.848800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.823618Z","title":"Use the exact terminology found in the text (e.g., if the caption says ”shatters”, use ”shatters”, not ”breaks”)","venue":null,"work_id":"92f76c6a-9b5d-4e11-bfd1-0226838c8644","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.429120Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:27501f7dd9d5c97d843b52976fba1e2f9cadb97983832ba5a06917348e78f616","observation_id":"da44a066-d0cc-4715-a367-9fcfba7c58c0","resolution":{"observed_at":"2026-08-10T18:13:46.829527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.803737Z","title":null,"venue":null,"work_id":"13fa5c9f-779b-438c-9e85-2e7968c12e2f","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.441284Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:fa43492b0d18e27ef7241ecb3946ff55f9b1d1d807c324bb1a134f90db24bc46","observation_id":"31b2fb4b-b1be-4066-88df-0ed9d35bbe6f","resolution":{"observed_at":"2026-08-10T18:13:46.809850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.781773Z","title":"Start directly with the answer content","venue":null,"work_id":"9a6af6e3-e6f1-4354-96ec-3dd56b64ce30","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.450979Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6b3e49c14204ac537abfecb20f792ce96e3098bc86b8367b18bbc89c06b11fc7","observation_id":"06ff5225-4b67-4407-a027-13511abd61a4","resolution":{"observed_at":"2026-08-10T18:13:46.788962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.759415Z","title":"strengths","venue":null,"work_id":"f4f502be-e48f-4d0d-9712-6f93e1a41139","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.457246Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:a0ccea18fc9683e125c0d89057b50ac95c6cb979eb14340ca4b6dc94b0130122","observation_id":"fa9669e6-ff5d-45ad-bb6c-b38be7b63981","resolution":{"observed_at":"2026-08-10T18:13:46.764825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.734773Z","title":null,"venue":null,"work_id":"dc990cea-1c37-4c57-b9d1-5f3a72a75f4e","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.464484Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:12f568dcfd48eef121fe86457fc91503bac70ec7ec19f7b3f5d568bfa209a4c3","observation_id":"4a20e370-b5df-4187-8a70-e124cda1f609","resolution":{"observed_at":"2026-08-10T18:13:46.742112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.711035Z","title":"evaluation","venue":null,"work_id":"8208822b-2397-4d55-88d3-f30d9ae92347","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.473015Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:baa2aa055aa01c5c5fadc429c849b1e245ff9621d0dc065c0c26b511700db1f9","observation_id":"bee123fd-afc5-43ed-bb1d-2bd4514bc827","resolution":{"observed_at":"2026-08-10T18:13:46.717454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.686586Z","title":"Do not add any artistic interpretation, subjective analysis, or infer any character’s internal 23 thoughts, emotions, or intentions beyond what is explicitly visible or audible","venue":null,"work_id":"bc837e3a-708b-487f-9b4c-d1c4c71c299a","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.480978Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:6c7ed43c74d92b60516945f81f47a27d17a13a83f787e504a7dff24921ff7888","observation_id":"6f54366b-2833-4bff-a4bb-38ad54d5fcc9","resolution":{"observed_at":"2026-08-10T18:13:46.692726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.661477Z","title":"While Character A is speaking, Character B simultaneously turns their head","venue":null,"work_id":"53797932-1434-4e3e-9b03-d977f1312781","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.486950Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:8b04d570a79ba4daecb146ab65fbf25f6df35b7a4ea2bd7c72e56b244daa6c84","observation_id":"90a1999f-d774-4123-a162-e1bbae85ba49","resolution":{"observed_at":"2026-08-10T18:13:46.668462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.642292Z","title":"He closed the door,","venue":null,"work_id":"60404918-509a-4bd7-b34b-619b4f3094d1","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.494599Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ca070cccadfa012321e46fafc163b0cf4e6f006a616bde3f711bd26d392fa3de","observation_id":"36b615f7-5d65-48b6-b411-84544350326a","resolution":{"observed_at":"2026-08-10T18:13:46.648814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.622577Z","title":"The camera cuts to a close-up of her face,","venue":null,"work_id":"851b6641-378b-48e6-850a-866e213edf35","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.502462Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:9bcb3e32918b041109735d6a09fc5d7de5adb5ec8e36ef626b694d00e4c61097","observation_id":"a39cd8a8-82c3-4890-ab62-d46deb18892b","resolution":{"observed_at":"2026-08-10T18:13:46.628650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.598173Z","title":null,"venue":null,"work_id":"8a99c806-ad8d-46de-a262-d084532a91bd","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.516642Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:cb3713523fd1b0bf02e94a4c213b37c24eb7867d79943ecb335939fc8a7b7bdb","observation_id":"52b76ef2-21c0-4633-a1fe-87058085ec5f","resolution":{"observed_at":"2026-08-10T18:13:46.608847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.569355Z","title":"Do not use bullet points, headings, or line breaks within the narrative","venue":null,"work_id":"dd77729d-0b13-4cba-a68a-0f29ca9915eb","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.523799Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:fb42e5816e4fb2196727bd0ae5eb2e3970e3311a37d9c032767eafcedf37055c","observation_id":"e8eebfdd-7bb2-4176-9ed5-f3a690bb0f80","resolution":{"observed_at":"2026-08-10T18:13:46.577670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.543177Z","title":"His voice, thick with sarcasm, says","venue":null,"work_id":"1cada282-7a2f-4b04-94a8-cf169ba6085f","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.531066Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:d02be7fe87a3386e766182afa2245908fd92004f2749254dd1a23dbee31931f1","observation_id":"70b54954-8d96-4140-823a-14fdffbda128","resolution":{"observed_at":"2026-08-10T18:13:46.553912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.519979Z","title":"thud\" as a book hits the table, a","venue":null,"work_id":"c1698fd2-3ad9-4a6f-b550-81f44fc37a82","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.543586Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:e3c54c587817a5b9b746f4d7526cb00f58a21b92a11408d8356d2d7b4acce1fa","observation_id":"90c315f3-909b-46c3-93ad-2d8bb8a5336c","resolution":{"observed_at":"2026-08-10T18:13:46.526057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.492091Z","title":"While Person A’s hand reaches for the glass, Person B’s eyes dart to the side, and the music swells","venue":null,"work_id":"91bff0e1-014a-48dc-841e-b15435c1d979","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.557179Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:cceb083a4d00839ab9c9548ceccab6e4649d9fc3cc788deebad1a0b949efbbb4","observation_id":"64b2eb73-aa40-48d3-8df0-360d4fdca671","resolution":{"observed_at":"2026-08-10T18:13:46.499941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.462208Z","title":"Avoid summarizing","venue":null,"work_id":"59dc0b1f-154a-4613-a672-6652fdca6d94","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.563308Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:cf800131c488ce34a50b86452e9b536d5637a0b00e797d4e08104c4a293e9e22","observation_id":"0092d044-e526-435f-8cb0-7f3df378f2fb","resolution":{"observed_at":"2026-08-10T18:13:46.471133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:13:46.437947Z","title":"strengths","venue":null,"work_id":"f8983525-1da8-4260-bd56-a7d81878f60c","year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.573450Z"},"links":{"citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ec8fb46c5d9195822c9ce9d51bd177cbb2ed5cda4101dc550efd6edab8d67d46","observation_id":"8457dc9e-0c4b-4dcb-8fe2-d16d504a83a2","resolution":{"observed_at":"2026-08-10T18:13:46.445294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-10T18:13:44.362349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.362349Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:ba41ff9f8a7064f02eb3308807d8b6c8c7680dc89c55e76eb3d27f3b9a52faec","observation_id":"271c8407-3349-4ac9-8db6-390573dd5ff2","resolution":{"observed_at":"2026-08-10T18:13:44.362349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T11:11:29.983111Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2608.06930."}