{"as_of":"2026-08-20T18:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9aa4efc7d5522dd199955a17535f861e26c9f1e22b4fe13f2eff987ba78a52e8","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:24:00.624313Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15509/citation-record","integrity":"/paper/2412.15509/integrity","json":"/paper/2412.15509/citation-record.json","paper":"/paper/2412.15509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.986757Z","title":"Trecvid 2023 - a series of evaluation tracks in video understanding,","venue":null,"work_id":"b76fde73-d218-449a-881c-41cc350b19ab","year":2023},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.512091Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:d3789bd918b00536e96477f01507c7de5c5eaba3755d661784d5e2a55ce54b01","observation_id":"0952f686-a54b-4aee-be77-f2458595612b","resolution":{"observed_at":"2026-08-11T11:24:00.992472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.964018Z","title":"Motion driven approaches to shot boundary detection, low-level feature extraction and bbc rushes characterization at TRECVid 2005,","venue":null,"work_id":"7b440526-00a3-483e-b024-71f442b5d3e1","year":2005},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.521107Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:17f632865e6e4add36725866827423ca86c9d255a9019f5781091ae8b835bef9","observation_id":"a57aa07f-a414-4d17-a4e1-a09ee8d94ec3","resolution":{"observed_at":"2026-08-11T11:24:00.969822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.947714Z","title":"Beyond semantic search: What you observe may not be what you think,","venue":null,"work_id":"1da1d0ca-4891-41ed-a63f-fe97f9b676de","year":2008},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.528283Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:9acf5cdbcd2811246c0bb3a75357e09c795b0791bfe794bb032ea2590fa82973","observation_id":"d3b1223f-7b9a-4829-9107-087534c65df7","resolution":{"observed_at":"2026-08-11T11:24:00.953029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.927411Z","title":"VIREO at TRECvID 2010: Semantic indexing, known-item search, and content-based copy detection,","venue":null,"work_id":"67f0b57b-ece6-4358-aae4-8830f2c06c42","year":2010},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.534726Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:63db4e84687503286aa2f85d8fdd31946a1dd98f558abbf3cc8156ed0081b429","observation_id":"e841fe0f-4cc3-4730-ae12-aa09228f5c56","resolution":{"observed_at":"2026-08-11T11:24:00.933356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.911636Z","title":"VIREO@TRECVid 2023: Ad-hoc video search,","venue":null,"work_id":"8ed9b819-1428-49ef-bae8-5ea1f61ee47a","year":2023},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.540959Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:bce15d99d5fa5cb4daaa494cc7d1f85ca91bf5f5c03b884d92bf893a27f31f96","observation_id":"e62ab536-ff54-41f8-9773-150dcd8d4cde","resolution":{"observed_at":"2026-08-11T11:24:00.916192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.891416Z","title":"VIREO@TRECVid 2022: Ad-hoc video search,","venue":null,"work_id":"e77dbc7f-b623-49db-be93-b1ae176557a6","year":2022},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.546739Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:407d89af656dbc438a41f722b2f67a2927b68031a78992207169c04ce92ee769","observation_id":"3845033d-b1c6-4023-b917-807fadc6ff2c","resolution":{"observed_at":"2026-08-11T11:24:00.896375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.873694Z","title":"VIREO@TRECVid 2021: Ad-hoc video search,","venue":null,"work_id":"e4ec830f-a0cf-47c8-8afd-24372c9cb90e","year":2021},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.554472Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:4093e25d60d240b6483f5bfe5d9bae6205fba661703474f4c7a0cfacd2a3116b","observation_id":"00832043-6535-4a5a-941c-085441af67d1","resolution":{"observed_at":"2026-08-11T11:24:00.878814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.855940Z","title":"Improving interpretable embeddings for ad-hoc video search with generative captions and multi-word concept bank,","venue":null,"work_id":"6ca424fa-3ab7-4e4f-91df-1bdded826946","year":2024},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.559275Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:3a0dd8762f1b9c7797f5ee9e6378eb07f77e3501dfe78b6bb1f43d337dd884b9","observation_id":"272d7590-e842-4cf6-a3d7-6ed271c90cc3","resolution":{"observed_at":"2026-08-11T11:24:00.860709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.840860Z","title":"(Un)likelihood training for interpretable embedding,","venue":null,"work_id":"c4cd3ba5-8355-4f03-a218-b4fe104c0351","year":2023},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.564527Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:d6531c59c31430d30efab110f8cc87e593a3320f19fcb5818dfab87bb69818be","observation_id":"c1c70163-2f1d-48aa-b75f-5aad923e2c80","resolution":{"observed_at":"2026-08-11T11:24:00.845709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T11:24:00.569639Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.569639Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:9322c05585ab828823ad858816fb13e68651e963d372e7edbf42cbea27a6c9dd","observation_id":"88062a10-e92e-4b58-be60-098772b21004","resolution":{"observed_at":"2026-08-11T11:24:00.569639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.825085Z","title":"Visual instruction tuning,","venue":null,"work_id":"ba731e7a-cd30-476a-a4a1-84b1d30d77ea","year":2024},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.576951Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:98da87f550ed7103dea7982ab7cf28d51e52ac8d2dd5dab200ba9d2e90b10e26","observation_id":"e3034e5c-4625-4e19-8925-9b70123f5a56","resolution":{"observed_at":"2026-08-11T11:24:00.830461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.806388Z","title":"Interactive video search with multi-modal llm video captioning,","venue":null,"work_id":"df268f07-2b52-4dec-8d77-45e43697def4","year":2025},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.584366Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:2e67567f2d68e1de8be8a9136dda08a8674f99e0ace64c025b5fe6f6eafd6ca2","observation_id":"f6a2133a-fd79-47cd-9279-a99ecfbf533e","resolution":{"observed_at":"2026-08-11T11:24:00.813077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-11T11:24:00.590366Z","title":"Video instruction tuning with synthetic data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.590366Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:cb4890bce4bd4a2a7133995d1fe2ee597f641d0a8553f670281378fe44d570ac","observation_id":"ebb78dfb-1ae9-4a2a-a40d-bfa9bd502f71","resolution":{"observed_at":"2026-08-11T11:24:00.590366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.789418Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"baee67bc-4e00-4031-a4c9-c5d31432ddd6","year":2024},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.596241Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:eff930e19ce0d3b47631d69dcef04902423166f3aab6d17c606bbe48d2c682be","observation_id":"a2da8ecc-af18-494c-b40d-368f0fddc3c0","resolution":{"observed_at":"2026-08-11T11:24:00.794576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T11:24:00.601226Z","title":"Minigpt-4: Enhancing vision-language under- standing with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.601226Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:6719c19c1df9f478ba5fd5ba150fb41ae579ad4aa1d9bcdc2a44014913c4cec6","observation_id":"6a3ea1f6-7e26-4449-98c2-b39dd02f8ac8","resolution":{"observed_at":"2026-08-11T11:24:00.601226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.773211Z","title":"Llama-vid: An image is worth 2 tokens in large language models,","venue":null,"work_id":"2f9df208-90ad-4a07-ba6b-bf134019029f","year":2025},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.605749Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:733754d59d341aaa3b5942196b2f5c4ca52b093e6dfce475ea9a4015485fd3b0","observation_id":"02abd44f-134c-4100-a72a-0a296d7517ac","resolution":{"observed_at":"2026-08-11T11:24:00.778607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03413","last_updated":"2024-04-04T12:46:01Z","snapshot_observed_at":"2026-08-16T14:03:39.369872Z","submitted_at":"2024-04-04T12:46:01Z","title":"MiniGPT4-Video: Advancing Multimodal LLMs for Video Understanding with Interleaved Visual-Textual Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03413","snapshot_observed_at":"2026-08-11T11:24:00.610637Z","title":"Minigpt4- video: Advancing multimodal llms for video understanding with interleaved visual-textual tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.610637Z"},"links":{"cited_paper":"/paper/2404.03413","citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:c57f293a2730591f16dd0a50e103b85061fb04631849d3ef9c81185668832f62","observation_id":"4a09f899-50b1-4187-a53e-e6e38c4a242a","resolution":{"observed_at":"2026-08-11T11:24:00.610637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.756904Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":"633159f8-4522-4038-ae2b-b1ba3a848b5d","year":2024},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.615171Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:5affe38019c64eef6e10326d7946e1655b0258c6bc34b495c8625d2f34fe146f","observation_id":"056687fe-f654-4718-8e92-133754ef86b0","resolution":{"observed_at":"2026-08-11T11:24:00.761934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.742783Z","title":"V3c–a research video collection,","venue":null,"work_id":"c946a4fd-4c15-43e1-a19f-0e73e57ba826","year":2019},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.619658Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:bb1c9ae6557ef8173d13ee462dd98ada3b872b05fee60d07d6fcce13c720337d","observation_id":"9245b8f2-a6bb-41e3-a93c-4ef49887c28a","resolution":{"observed_at":"2026-08-11T11:24:00.747106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:24:00.723832Z","title":"Evaluationcampaignsand trecvid,","venue":null,"work_id":"34205402-ca55-4b3d-8b6a-4c186c16592e","year":2006},"citing_paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:24:00.624313Z"},"links":{"citing_paper":"/paper/2412.15509"},"observation_digest":"sha256:55a92ef1b18afd3c973587a72943ef438e1708dffd95a0e0bd14ffcd0f3ad36f","observation_id":"48398c15-e2ad-44f2-bbd2-3feab8eace6f","resolution":{"observed_at":"2026-08-11T11:24:00.729784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.15509","last_updated":"2025-01-25T02:06:55Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:10:43.697231Z","submitted_at":"2024-12-20T02:45:37Z","title":"PolySmart @ TRECVid 2024 Video Captioning (VTT)"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2412.15509."}