{"as_of":"2026-08-09T15:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb059623d0f0bab3856df79641554e581669229b12afe8affcedd84b30a1a06b","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:01:21.032754Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:13:38.580739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17050","snapshot_observed_at":"2026-08-03T12:13:38.580739Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29181","last_updated":"2026-07-31T09:02:33Z","snapshot_observed_at":"2026-08-07T07:51:07.944544Z","submitted_at":"2026-07-31T09:02:33Z","title":"SERUM: State Extraction and Refinement for User Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T12:13:38.580739Z"},"links":{"cited_paper":"/paper/2507.17050","citing_paper":"/paper/2607.29181"},"observation_digest":"sha256:59a344cee55c57b8ca519a2ef03a3982bb1a033d7005945e1ae60094926ea6cf","observation_id":"70d83a25-4c97-4471-8c44-fd8ede4213ab","resolution":{"observed_at":"2026-08-03T12:13:38.580739Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17050/citation-record","integrity":"/paper/2507.17050/integrity","json":"/paper/2507.17050/citation-record.json","paper":"/paper/2507.17050"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.298412Z","title":"Optimizing marketing strategy: a video analysis approach","venue":null,"work_id":"2ade3627-f316-4c84-8db7-2b6c5fb2618d","year":2025},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.947571Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:cbf2de6075125f303fdc27b0d0f1a568ba8b106bb98847dc1b14a2b6875a3632","observation_id":"eba5d90d-1e6b-4e03-803b-235051e41324","resolution":{"observed_at":"2026-08-06T15:01:21.300597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.292196Z","title":"METEOR: An Auto- matic Metric for MT Evaluation with Improved Correlation with Human Judgments","venue":null,"work_id":"f21c0734-c78e-4640-b590-b2ae5241e7f7","year":2005},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.950304Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:5aacce4e17b7cf2f01f4af4f9dba558ec7456015008f0cc00406d45aaaaae4f7","observation_id":"3086b80a-7c54-4933-b054-130272eabcec","resolution":{"observed_at":"2026-08-06T15:01:21.294481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.285587Z","title":"Mm- au:towards multimodal understanding of advertisement videos","venue":null,"work_id":"7dff22c9-8644-43de-be0f-75ce385434bc","year":null},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.952675Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:733cee1bc3c7a87183e3c382dc2bdd4bae76509d67b91883507a176025c6cb7c","observation_id":"f63121dd-c975-455f-a460-2afcb70cbe12","resolution":{"observed_at":"2026-08-06T15:01:21.288029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.275916Z","title":"Blog: E-commerce product videos with examples, 2025","venue":null,"work_id":"5cd219c5-683d-430b-bd25-59768abdb712","year":2025},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.957283Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:d269c0a7516b7e9c8a9686a56592ed92c6ae6e6122b1659fb437963f457bc1a4","observation_id":"117d45b5-b834-4480-99bb-a65dc24eff5f","resolution":{"observed_at":"2026-08-06T15:01:21.278050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T15:01:20.959349Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.959349Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:ae043dd926a7ca60d999405a2a98e0126311ec5020b9ab44d2e1731b8d28b12c","observation_id":"727b0d93-9bae-42ff-bee5-0021c6fa1fa8","resolution":{"observed_at":"2026-08-06T15:01:20.959349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:20.961859Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.961859Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:4ea7426f38a7651c374090cd41b7810c9570459bca2622c4d841ebdcb740c75c","observation_id":"2f87acd8-6b4d-4b05-8db7-23d0659e1b2e","resolution":{"observed_at":"2026-08-06T15:01:20.961859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.265900Z","title":"Yolo-world: Real-time open- vocabulary object detection","venue":null,"work_id":"63204a41-0628-468e-b691-af64da7aca98","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.963956Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:7a16b485f29448b9f1f44fea00641151175cccc7b4d96ef61655d0b4ec7a536d","observation_id":"f5ad6c06-6171-41f0-a505-2ca5f57f794a","resolution":{"observed_at":"2026-08-06T15:01:21.268146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:20.966095Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.966095Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:e320b600658ee5bf0a21b0074635ae5e62e561a6248cb365b27da2202fb4ba49","observation_id":"b71f51b6-6e6b-4d98-ab16-c62e5e6ae583","resolution":{"observed_at":"2026-08-06T15:01:20.966095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:20.968013Z","title":"Deepseek-r1: Incentivizing reasoning capa- bility in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.968013Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:bafa4b922e29ab2428a91dfde0417fa5ce7d4897edfe8e61f825eae7f92fb88b","observation_id":"958d8f7b-fda2-4189-b8d7-be08f4085284","resolution":{"observed_at":"2026-08-06T15:01:20.968013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T15:01:20.969999Z","title":"Smith, Hannaneh Ha- jishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kem- bhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.969999Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:9597363483c97bbcd84b30b6e3e5849e4e0fb30adef51042af9bcdc94734ad85","observation_id":"612a4483-0884-4de4-ba48-09f93e430382","resolution":{"observed_at":"2026-08-06T15:01:20.969999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.251773Z","title":"Sketch, ground, and refine: Top-down dense video caption- ing","venue":null,"work_id":"976a33bc-865c-413d-abef-0e4bd9b431c1","year":2021},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.972296Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:c6431bb90134df45a830600614eb9e5f677e13bc0bfb1000d9d0f5f15772d665","observation_id":"60b03cf5-3ed3-41be-a131-eb254f80051d","resolution":{"observed_at":"2026-08-06T15:01:21.254043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.245597Z","title":"Video-mme: The first-ever compre- hensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"2016edb6-81e7-42c6-8415-d8a5b468362d","year":2025},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.974389Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:3943ab544632f104c3d864a7705370ad19806c2107cdfb437908241439260c76","observation_id":"b451ef04-ecc6-4ebf-9417-15dd9c8e62e9","resolution":{"observed_at":"2026-08-06T15:01:21.247827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:01:20.976339Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.976339Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:d359bfea89a17639d9a2215f5df12b022dfbc8e894b0327071ab019a896545aa","observation_id":"d38fc442-b07b-49da-ab2f-5ce2082f2202","resolution":{"observed_at":"2026-08-06T15:01:20.976339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.238602Z","title":"MiniCPM: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":"d5fa93bc-3428-490e-9903-22f81372ab31","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.978448Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:6767c91c8ee17d0636611c7da4b56774d5701f41f155e09ed274af3fc6362d74","observation_id":"abe00bd2-dd7f-454b-aa97-67645fbf4b99","resolution":{"observed_at":"2026-08-06T15:01:21.241390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.232570Z","title":"Lita: Language instructed temporal-localization assistant","venue":null,"work_id":"bb1feb0a-84c9-4bc0-b634-bead4fe516b6","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.980333Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:e896e3ed394d898291e8d341fba3bb94af1a055ff64ad12e743f613c8f9d8161","observation_id":"5adda0b6-68c2-4ad5-a57d-064b04934878","resolution":{"observed_at":"2026-08-06T15:01:21.234775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.226023Z","title":"Automatic understanding of image and video advertisements","venue":null,"work_id":"ce93e4df-94b5-48ac-8021-80e90cd5b693","year":2017},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.982297Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:3a2069f15996b5ae001659fc0b246eece170d10f79ae1b0bcf4c943094c9d03a","observation_id":"7265ce93-0b36-4462-9633-cd40092fb2a0","resolution":{"observed_at":"2026-08-06T15:01:21.228575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.219409Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","venue":null,"work_id":"b3c0fcc2-12f4-4768-837d-d27e1925406a","year":2020},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.984436Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:af2273ef805a37a155240d9c501ac1a30336424a0b1ba076042f4359c0f2e01d","observation_id":"2f3b36da-67d6-4e87-aaa5-961b35cebf3f","resolution":{"observed_at":"2026-08-06T15:01:21.221739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.212992Z","title":"Multi-modal dense video captioning","venue":null,"work_id":"522a33eb-3964-4251-bdea-001e01af102e","year":2020},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.986346Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:bdf9fc03e1d8d6fb08dcaf049b87c283ff89ae8d9614f3895fb1ae8975008331","observation_id":"f95af62b-679a-4149-a605-ae30d0115040","resolution":{"observed_at":"2026-08-06T15:01:21.215221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.206934Z","title":"Video re- cap: Recursive captioning of hour-long videos","venue":null,"work_id":"94d5ee08-2bbd-4b9e-84de-dfadd97e1fd3","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.988207Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:588949814a13b6036fcabf05975509dcad0eae2c9e30dacb5db77c087f715959","observation_id":"d56f9c4f-cbfe-41c8-90e9-57f9c5b9c2de","resolution":{"observed_at":"2026-08-06T15:01:21.209047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.200652Z","title":"Drive targeted marketing in retail with video ana- lytics insights, 2022","venue":null,"work_id":"c0466c97-dac5-42a1-a482-1264ac57e9ac","year":2022},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.990066Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:c20419b93bc314f8d84046774bc3ed6735e518e1cd27bc0cca05d520e18ea87b","observation_id":"053435b6-fb70-4682-bfb0-3a5909386f8b","resolution":{"observed_at":"2026-08-06T15:01:21.202857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.193976Z","title":"Dense-captioning events in videos","venue":null,"work_id":"459fbbad-0b30-4fc3-aafb-aa484718b3a7","year":2017},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.992028Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:6e5bbc44df386ec8309bd92ea987ed861318fdb0bc88787dab737257518bcfa2","observation_id":"16221969-ee3e-4131-ad09-1d1227d2a7ed","resolution":{"observed_at":"2026-08-06T15:01:21.196759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:20.993917Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.993917Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:a2422092433ffc9368bd00e1146925ddfaf6172018aebbf174046266434337c4","observation_id":"2c9170b1-69de-47f5-8039-3b8022545839","resolution":{"observed_at":"2026-08-06T15:01:20.993917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.184019Z","title":"Development and challenges of object detection: A survey","venue":null,"work_id":"3357dc4a-8c8b-48a3-acd6-1b5809d925de","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.995737Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:3d983fa97f39ffa1715984df67171b6ed1d2382544b4ec10f97904a2ccfd169f","observation_id":"c4d10611-336c-473e-b65e-c957ca7e16e1","resolution":{"observed_at":"2026-08-06T15:01:21.186367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-06T15:01:20.997595Z","title":"Video-llava: Learning united visual rep- resentation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.997595Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:510ac6d78c7cce11fbfaf4be81a5e15698c0c8fc35dc0fb3e19741a33fcc83d7","observation_id":"4a99b57e-5102-42ef-87f4-15f547d55e79","resolution":{"observed_at":"2026-08-06T15:01:20.997595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.000083Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.000083Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:2fc091da209d7c3c9d8ac358cf3625fad8bcab4312d70ba14b11bbc421bfefd9","observation_id":"a2b000a7-c7a4-4477-9912-9fb4940a4473","resolution":{"observed_at":"2026-08-06T15:01:21.000083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T15:01:21.001977Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.001977Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:13bd17768729630b57d98361b457e90e68485046590145f3e6d9e61432df4890","observation_id":"efacaea5-5a1c-49bb-a7b8-7814f71bca7a","resolution":{"observed_at":"2026-08-06T15:01:21.001977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.173103Z","title":"Dense video captioning: A survey of techniques, datasets and eval- uation protocols","venue":null,"work_id":"22c58206-8518-4160-9f07-eb02b0606fbc","year":2025},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.004396Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:c6ea7c25f16cae9155fe32040ce9ceaa97c9c1911fd3ee6178bac5b3ddec4766","observation_id":"5ca176c6-65d6-473b-9254-22bbb358aa98","resolution":{"observed_at":"2026-08-06T15:01:21.175346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.166758Z","title":"Timechat: A time-sensitive multimodal large lan- guage model for long video understanding","venue":null,"work_id":"27e6ca91-4021-40d6-94a2-94d1845ab7da","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.006348Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:7e3c5b8e453052b09a380bfa28760c33341cef29067c8a323f344f0420b2a201","observation_id":"01df04a6-cf88-41fd-94cc-01ab46d00a6f","resolution":{"observed_at":"2026-08-06T15:01:21.169008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.008633Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.008633Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:8948e800c3ee0855365e15d0ed88bf12f7df7655932bc55cc7c32b934b579829","observation_id":"6e6dc0b6-d181-47ce-b5d2-eec2163aa5e3","resolution":{"observed_at":"2026-08-06T15:01:21.008633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.156612Z","title":"Video understand- ing with large language models: A survey, 2024","venue":null,"work_id":"dbb78f4a-fea8-4170-94c5-0317145f0bbd","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.010558Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:3fdf9091eed2bf5ea60c7ea99eb65d8f9da6cc9246408cb6fb8d1f5230b9e90e","observation_id":"66e6dad2-3916-4c63-b8ca-151b68520dbd","resolution":{"observed_at":"2026-08-06T15:01:21.158816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.150800Z","title":"Llama: Open and efficient foundation lan- guage models, 2023","venue":null,"work_id":"94f318f9-9e94-417c-ae09-2b7d2c738595","year":2023},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.012655Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:a42d8b4865538f07824be387a822f37f0ad6f1727df2170fee4d396a5fb8255c","observation_id":"09ebf718-9af9-4545-a0fb-85318b5503e2","resolution":{"observed_at":"2026-08-06T15:01:21.152894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.144813Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"343ff83b-657e-4a6c-a91e-5601a5eee468","year":2015},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.014579Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:e33ce854bd23ed671656ff7f1bdcadb3ac6c7c754f88267a5d6817199947b720","observation_id":"430ded0d-8fda-4b06-a5c0-369f4fd5360e","resolution":{"observed_at":"2026-08-06T15:01:21.146944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.138405Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":"d669f56d-92d3-494f-948e-f6b1166ccd1b","year":2024},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.016571Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:6acf966354d4e06bb67017a96d11afd92c0950b870f9bcb965b1a445b8f3fff4","observation_id":"c38a615f-9637-465c-956a-0d0a52776827","resolution":{"observed_at":"2026-08-06T15:01:21.141023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.131306Z","title":null,"venue":null,"work_id":"f7de89f2-defb-4e4d-a879-ef11476fb82f","year":null},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.018390Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:2bff6bbedad234853a28abe8fe85a8b1fa5698f6602f3b33bd078c4e251205f1","observation_id":"4476f321-8a75-4258-8440-923db242c431","resolution":{"observed_at":"2026-08-06T15:01:21.133792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.123548Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"44d42925-f660-4dd7-9156-82977259289e","year":2021},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.020652Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:b6f67a22aee282a552503ad5dd9ff1afdcb0d5c0ce3f4362b9630de9c0393171","observation_id":"46b28dad-b922-49d2-972b-75cbb8de2139","resolution":{"observed_at":"2026-08-06T15:01:21.125984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.116222Z","title":null,"venue":null,"work_id":"36d99f34-4ca7-41d9-9073-687f15e85f74","year":2023},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.022609Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:710729968738be6d0513b1bc422eaaa41f1440d276921657be7ced46b0e229e2","observation_id":"0b53ed68-c29a-4201-99dd-3bd8ca64f195","resolution":{"observed_at":"2026-08-06T15:01:21.118602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.109033Z","title":"Advise: Symbolism and external knowledge for decoding advertisements","venue":null,"work_id":"1b8269bb-493c-4761-beee-866232b610bb","year":2018},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.024520Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:865b2864a375d1637dcd2f6bc1f76937d7262f3b5479712058a557da85d0ae4d","observation_id":"bfae3521-0115-4d23-939f-5ef65fa177af","resolution":{"observed_at":"2026-08-06T15:01:21.111473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T15:01:21.026368Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.026368Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:8385f2d0305dccf271b4b18497aedbea6847769feaa3206fd82392874c6ddf83","observation_id":"c227290e-e616-4373-acf9-30ac7471b18c","resolution":{"observed_at":"2026-08-06T15:01:21.026368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-06T15:01:21.028640Z","title":"Wein- berger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.028640Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:5179a88691d12de2de1065c1d10a924100d3b32f6f6f6c2b7822cfa7bbabf50d","observation_id":"292164a1-f20b-40fb-be92-cb7a07e7acf3","resolution":{"observed_at":"2026-08-06T15:01:21.028640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.102518Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"2ff1b9fb-f9de-4a06-a430-b0c53d8c7e15","year":2018},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.030741Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:fc6a767e7c1e8c5009c9911a5519d5dc9208a6c59878627371ec15c363ad3c64","observation_id":"65f006a9-25be-4729-ba27-caed35ba339d","resolution":{"observed_at":"2026-08-06T15:01:21.104987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:21.093887Z","title":"End-to-end dense video captioning with masked transformer","venue":null,"work_id":"8b8cece3-4b1f-42fe-b0d8-f1dfb26f753f","year":2018},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:21.032754Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:a4ab82dc320e3ad7d28fd967f4e06b9453eb89179cad284a772e9be8f72c2d1b","observation_id":"b76d694a-719c-482f-9df9-111cba72f2d2","resolution":{"observed_at":"2026-08-06T15:01:21.098048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:01:20.955209Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:01:20.955209Z"},"links":{"citing_paper":"/paper/2507.17050"},"observation_digest":"sha256:d1ed4bff64b9ed4bd0e9c26308dd3ed79733253faf647956cfeae2b25b92f907","observation_id":"4bbfa2c7-ae93-4542-a974-454ca2e2bf22","resolution":{"observed_at":"2026-08-06T15:01:20.955209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17050","last_updated":"2025-07-22T22:16:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T14:55:16.816833Z","submitted_at":"2025-07-22T22:16:37Z","title":"Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2507.17050."}