{"as_of":"2026-08-13T10:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e777454dafc10c2708a8562c965a926ccb1f7783de5d96bfdbd0f46403a184f","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:30:20.484216Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18180/citation-record","integrity":"/paper/2411.18180/integrity","json":"/paper/2411.18180/citation-record.json","paper":"/paper/2411.18180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.027395Z","title":"https://github","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.027395Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:6669c4b5ca04b1714881dc093d59ac5f1abb807b5151b32b41302371840c78ed","observation_id":"02369d82-26c8-4448-8328-7213f3562022","resolution":{"observed_at":"2026-08-12T11:30:20.027395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T11:30:20.033060Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.033060Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:33cdd41852ae5c13037edf74de05dd8fcb89da033da825e7792cb963828959da","observation_id":"eb38ada4-d5fa-40e8-a7e9-e286e73ee22b","resolution":{"observed_at":"2026-08-12T11:30:20.033060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.038505Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.038505Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:2ca9bb6c2214e2a98ae93b03f6aedad98b317577190cee074212b2be1bedf17e","observation_id":"4fb03a4b-c28f-42c8-a36f-240869edfd83","resolution":{"observed_at":"2026-08-12T11:30:20.038505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.043031Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.043031Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:654f2f48808caa6c0f180831ffb6ddcca0fe165d10e2b4cf6ef079de00082364","observation_id":"d7808cea-a78d-4ccf-9e44-d48708a49cd3","resolution":{"observed_at":"2026-08-12T11:30:20.043031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.048062Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.048062Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:435c371f74abd1a70d04351a72ca9ceb72b1ad490414a6c35a293d8b18010af2","observation_id":"f17910fa-f342-4a37-a905-be84e39eea45","resolution":{"observed_at":"2026-08-12T11:30:20.048062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.053508Z","title":"Condensed movies: Story based retrieval with con- textual embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.053508Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:a19bffc1082b6589c99ba4ec3167f0f5cc0da886463a5345900a975cdbbdf6cc","observation_id":"3fb462c2-41ef-4a96-a49e-6d361bfa05e6","resolution":{"observed_at":"2026-08-12T11:30:20.053508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-13T08:10:19.417715Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-12T11:30:20.058751Z","title":"Whisperx: Time-accurate speech transcription of long- form audio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.058751Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:2ebc98455fa3619334296311aebd60d2198d3a997c49cdab51ac8ac69a655fb7","observation_id":"9e3b12e7-a13d-421b-9677-d07840be8bf3","resolution":{"observed_at":"2026-08-12T11:30:20.058751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.064337Z","title":"Livedescribe: can amateur describers create high-quality audio description? Journal of Visual Impairment & Blindness, 106(3):154–165,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.064337Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:770d9566425db4268499dc8e2b088beb8ec5baa260c6cc231397cdb3112ebc39","observation_id":"076c5170-ea3d-43ec-a676-3442d7555ced","resolution":{"observed_at":"2026-08-12T11:30:20.064337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.069791Z","title":"End-to-end speaker seg- mentation for overlap-aware resegmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.069791Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:cdb9a5d2c2bc3a175d758977530898c9dad80a85abdc9d5d61d7c63a49f5cc1f","observation_id":"c7af109e-deea-41ea-9e70-80cbe62e5a6e","resolution":{"observed_at":"2026-08-12T11:30:20.069791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.075439Z","title":"Pyannote","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.075439Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:3a853495e9e844f839e6d6f377ae6523ce8b44e585f4af8a940122e3899b8d8c","observation_id":"3f495fa8-dcb0-40bb-95ca-2b6b659f319d","resolution":{"observed_at":"2026-08-12T11:30:20.075439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.746423Z","title":"Groupcap: Group-based image captioning with structured relevance and diversity constraints","venue":null,"work_id":"cf6c469d-fd40-40de-a771-75d36649211e","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.080873Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:adb5ed74d49b060d25839f31391af26a77b30c4e4f0857f9228066986a39a765","observation_id":"343971bb-4cce-468e-9f84-5981aadac8a6","resolution":{"observed_at":"2026-08-12T11:30:21.751384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.730717Z","title":"Towards bridging event captioner and sentence localizer for weakly supervised dense event captioning","venue":null,"work_id":"92e4e838-e98e-412b-b178-aa7dd4b7192a","year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.086187Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:bddf4f734dd384e03995b41d5bcd394ef8939d66e7463b915bde763203029a5e","observation_id":"c4d87e84-4245-486e-b5e9-a29d8bc02f6b","resolution":{"observed_at":"2026-08-12T11:30:21.736099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00983","last_updated":"2024-05-02T03:38:58Z","snapshot_observed_at":"2026-08-13T00:17:13.521510Z","submitted_at":"2024-05-02T03:38:58Z","title":"LLM-AD: Large Language Model based Audio Description System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00983","snapshot_observed_at":"2026-08-12T11:30:20.092465Z","title":"Llm-ad: Large language model based audio description system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.092465Z"},"links":{"cited_paper":"/paper/2405.00983","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:ea2b580d99f66da0c501d839d117ba8aa8bcd960cdaa1f37bc60b30e26ac561a","observation_id":"febee165-4f08-4e3a-a0a8-c454cf5c36c7","resolution":{"observed_at":"2026-08-12T11:30:20.092465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.715896Z","title":"The ides of march","venue":null,"work_id":"c6fd1dcf-c154-4321-baf3-7a0c99b16ab9","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.097964Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:e1f9d7bac3a335d56a497dd276ade8859a29c3397977e3a4fd0c763b6213227a","observation_id":"95a61deb-f6e9-4959-b44c-01c58659e772","resolution":{"observed_at":"2026-08-12T11:30:21.720897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.701535Z","title":"Contrastive learning for image cap- tioning","venue":null,"work_id":"c2cc40da-822c-46e9-903c-5107cc32c50d","year":2017},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.103431Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:16f2deb20a308c5f4498f0d8521ab9da1a64780fdfde7d82581c15a5b9c2543e","observation_id":"7d9787e5-9fbd-43d6-bab4-ecd5d9b3e214","resolution":{"observed_at":"2026-08-12T11:30:21.706567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.686636Z","title":"Maximum likelihood from incomplete data via the em al- gorithm","venue":null,"work_id":"5042bb1a-44ba-4207-bf45-35f637235c6f","year":1977},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.108757Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:5d0598b879ddb06ffd4bba271884f7bca9c04423e5c6fd76dc5617b70956caf8","observation_id":"43ab6fd3-6bb2-4d83-a571-6a99b8739eb2","resolution":{"observed_at":"2026-08-12T11:30:21.691399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.672123Z","title":"Sketch, ground, and refine: Top-down dense video caption- ing","venue":null,"work_id":"9c49a19e-7f16-40cf-8feb-7b63298c03f8","year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.113915Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:c159b6223edc5d1b92e1a994cb3e4042752510f8e197d24ddb5bd72904db40a2","observation_id":"62983dfc-f032-44d7-bc9d-696460ca8dd3","resolution":{"observed_at":"2026-08-12T11:30:21.676885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.657657Z","title":"Describing differences in image sets with natural language","venue":null,"work_id":"fdc69969-dde0-4c9d-a195-f5f14bbf6464","year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.119583Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:6a3db663aac2e17985c56ec6039dc8e87a3280ee3390fa9021f1c9332ac8d9ca","observation_id":"6b948ab6-4590-4931-9d80-9582089132b1","resolution":{"observed_at":"2026-08-12T11:30:21.662408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.642623Z","title":"An introduction to audio description: A prac- tical guide, 2016","venue":null,"work_id":"236a9fa7-1cde-4b92-a861-8d74953a89dc","year":2016},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.125338Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:040b79fdb842d45d069f2dc77399cf137240f73b6c78a144d1c2549030ad209d","observation_id":"f8138907-0ea8-4c08-a8a8-2d55280fd1c7","resolution":{"observed_at":"2026-08-12T11:30:21.647408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.627960Z","title":"Autoad: Movie description in context","venue":null,"work_id":"6df027e8-f800-4197-98a9-21340dcbef05","year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.130735Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:5fbb9afb181387c8eb5b12dad7a5c99acaa42e8f22cdf0c63501602df3a7cb73","observation_id":"2200baab-6ac4-4870-9f70-d4dffe0e3e65","resolution":{"observed_at":"2026-08-12T11:30:21.632668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.612754Z","title":"Autoad ii: The sequel-who, when, and what in movie audio description","venue":null,"work_id":"c2bd95ba-7bb2-4005-99e2-40c6ee84a06d","year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.135896Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:e310a55dab5fad5f6bd7784814ae1fe871871fe79e1b428c39d5719be31aea05","observation_id":"2321d48f-f5e8-4f29-a8d1-8b8d0623b92a","resolution":{"observed_at":"2026-08-12T11:30:21.618232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.597075Z","title":"Autoad iii: The prequel-back to the pixels","venue":null,"work_id":"53ab7b5a-d0a6-49d1-a7a8-e68b9e7f0f23","year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.140758Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:79fe4a112a2619a1ad444d6d834c324fba8d6434e0d3ed2345de5641cfe24b4d","observation_id":"53171eea-5a48-4554-aa1d-239d3fa6737a","resolution":{"observed_at":"2026-08-12T11:30:21.602198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T11:30:20.145887Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.145887Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:44a3d0c4a86f62d7a3d8c3f31c465cdb9e31b653c1e6d7d32cbe2158468ac772","observation_id":"33a2fcf4-4b2a-4ea7-8218-a032e2be1d59","resolution":{"observed_at":"2026-08-12T11:30:20.145887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.581805Z","title":"A better use of audio-visual cues: Dense video captioning with bi-modal transformer","venue":null,"work_id":"a76d64e5-c6b2-4490-962e-f277d9d6991f","year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.150980Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:42cdb8d8db52ca70b2ea8839a2dbf126fc44d975fd985d5e88498eda1fe2e790","observation_id":"c9c2f81e-e134-450c-8a47-d2076cd99df9","resolution":{"observed_at":"2026-08-12T11:30:21.586799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.566229Z","title":"Multi-modal dense video captioning","venue":null,"work_id":"38b7ceed-86bc-49b4-92d3-e01ff48dd21e","year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.155823Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:c9e811ee1c2878fc3bc29e20d7b472cd72a2aa6bf0538fb8dac3d2048072bae8","observation_id":"97f9ed30-2ff2-4ae7-bf0c-6ddf308c2093","resolution":{"observed_at":"2026-08-12T11:30:21.570936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.549573Z","title":"Expectation- maximization contrastive learning for compact video-and- language representations","venue":null,"work_id":"54dc42b4-f88b-495c-ad87-eb693b619d08","year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.161137Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:b7c0ad2c91fbf1bc7178d82d280fdb7f56b9cbb647212150bfb79a322623fdb4","observation_id":"97b1dc59-f90d-4f59-84b6-71e80a5e9d0c","resolution":{"observed_at":"2026-08-12T11:30:21.555158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T11:30:20.167142Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.167142Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:4ab53717ea3668d33fcde9c590411660ebb6374f1f9343bd24b2e32a83026376","observation_id":"e8d4ac44-a001-468e-a96b-75e5294b8943","resolution":{"observed_at":"2026-08-12T11:30:20.167142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.532418Z","title":"Dense-captioning events in videos","venue":null,"work_id":"3d11d206-9693-4559-97ec-07b0f3d847c9","year":2017},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.172088Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:af7314a1ac5b962bbb6c54cb30843db5713bcb66acb873e40fe605e70311a4e7","observation_id":"6de8d026-4d86-4e88-81b4-03bda2214312","resolution":{"observed_at":"2026-08-12T11:30:21.537697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.514510Z","title":"Tvqa: Localized, compositional video question answering","venue":null,"work_id":"dd5b05c1-6fe1-4e08-a63f-d59c691659ee","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.177778Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:129e25aefe7a371c77d0f854cc3a2afe4965a22a94bd810cc7999eafd9f4566f","observation_id":"2a8f33be-f36f-4294-be23-3a669671dc14","resolution":{"observed_at":"2026-08-12T11:30:21.519937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.498525Z","title":"Deep dive: How audio description benefits ev- eryone, 2021","venue":null,"work_id":"77f545f5-89a9-417c-9d4d-7c67eba599b2","year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.182692Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:97776f8cc75543d2460704b512839d69c07ac794b3cb8941d7ea7d3c51778909","observation_id":"27a36bf9-0566-4db7-abb9-5eb73b72a5f8","resolution":{"observed_at":"2026-08-12T11:30:21.503708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-13T06:22:02.817676Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-12T11:30:20.188334Z","title":"Mimic- it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.188334Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:5d9d1052d2e1214a8cee00d98be6dafe74084fd79c7363b6c1ed1085dfbfb7f3","observation_id":"23c28d39-e743-4b41-85f4-e50ea3378951","resolution":{"observed_at":"2026-08-12T11:30:20.188334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-12T11:30:20.193344Z","title":"Otter: a multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.193344Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:e7c9e4271a8c6cac0d9285c043ff14db1a2392941e8ca36f2fb5bad85a1878b7","observation_id":"8b2cd985-cdd6-45d3-91ab-68ea8e942daf","resolution":{"observed_at":"2026-08-12T11:30:20.193344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T11:30:20.199014Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.199014Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:47949500648b96b30d25f53fa315644193c3ca130efd07aed9d8cde93a9fb759","observation_id":"ab03d617-461f-43e0-b03a-772e6a86c436","resolution":{"observed_at":"2026-08-12T11:30:20.199014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.482110Z","title":"Expectation-maximization attention net- works for semantic segmentation","venue":null,"work_id":"ff107f31-184a-45de-ab8b-c25f27f163f2","year":2019},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.204541Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:0e931503e845e31f5e506d76a3f843c44f3f36d1d3f54f0b65e58916db2c39d4","observation_id":"9b1eea9f-6c29-4b92-9086-f7b5d762f49c","resolution":{"observed_at":"2026-08-12T11:30:21.487462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.466172Z","title":"Jointly localizing and describing events for dense video captioning","venue":null,"work_id":"e444380f-81e3-45dc-94f7-c689f4ea5393","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.209995Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:d41858f01d6468dea62a014a4f0d4e8d26b910f6cd83395ebaf2909c959b1ce4","observation_id":"3d624013-759a-42c4-a3e0-b7ef25019bf5","resolution":{"observed_at":"2026-08-12T11:30:21.471370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.214883Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.214883Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:fdb12e10e882bf99fccbff0138b9b3d78ca28edfd5fc1093f332bbc3f7caa1d0","observation_id":"c74c845f-9177-4355-ac63-301279123e91","resolution":{"observed_at":"2026-08-12T11:30:20.214883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.439394Z","title":"Swinbert: End-to-end transformers with sparse attention for video cap- tioning","venue":null,"work_id":"576269cf-17c6-40a4-b293-60e8b322737c","year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.221004Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:fb08a378bf19f43b30d126c55dc3e54dfd33fabed17e1bfb393d911495ba885f","observation_id":"3b1b0724-63d7-4730-be95-1ac1a0ced0bd","resolution":{"observed_at":"2026-08-12T11:30:21.444961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19773","last_updated":"2023-10-30T17:44:09Z","snapshot_observed_at":"2026-08-13T05:37:19.968467Z","submitted_at":"2023-10-30T17:44:09Z","title":"MM-VID: Advancing Video Understanding with GPT-4V(ision)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19773","snapshot_observed_at":"2026-08-12T11:30:20.227041Z","title":"Mm-vid: Advanc- ing video understanding with gpt-4v (ision)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.227041Z"},"links":{"cited_paper":"/paper/2310.19773","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:d3ca984485d248392b2b2f226f9bd061e1e040a34b7374d0a6815a2b0a362045","observation_id":"a3e0faf7-77be-4fb1-bb49-14965fc28da5","resolution":{"observed_at":"2026-08-12T11:30:20.227041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21757","last_updated":"2024-09-12T14:01:56Z","snapshot_observed_at":"2026-08-12T23:11:02.322015Z","submitted_at":"2024-07-31T17:23:57Z","title":"Learning Video Context as Interleaved Multimodal Sequences","version":2},"cited_work":{"arxiv_id":"2407.21757","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21757","snapshot_observed_at":"2026-08-12T11:30:20.687073Z","title":"Learning Video Context as Interleaved Multimodal Sequences","venue":"cs.CV","work_id":"6491bf8c-0e6b-41e3-8313-77b02581c136","year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.233251Z"},"links":{"cited_paper":"/paper/2407.21757","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:8c5fa1b29a15f29cebe8453e99dc0061f8ac55ea37f013e79e1d9b090c471101","observation_id":"22704919-9201-4f2c-85f9-42851797e616","resolution":{"observed_at":"2026-08-12T11:30:20.692183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.423781Z","title":"Swem: Towards real- time video object segmentation with sequential weighted expectation-maximization","venue":null,"work_id":"7df46662-eac4-4875-abd5-0ef1b9db7d35","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.240064Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:fd180bd7f95e8c028537e68adc8a72710bf546043cbc835ad2e10d3c774c2758","observation_id":"435a6317-223f-4459-a81e-719b83a7ced4","resolution":{"observed_at":"2026-08-12T11:30:21.428781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.245406Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.245406Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:544401869fba50fae03bba2c50a990e57aa79b746f282890ee0cbf8bf697bcd6","observation_id":"7651313a-096d-4a23-beef-af6b83729484","resolution":{"observed_at":"2026-08-12T11:30:20.245406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.398688Z","title":"Show, tell and discriminate: Image captioning by self-retrieval with partially labeled data","venue":null,"work_id":"58c936fa-0e0f-4e61-ac2f-b8c8563c391e","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.250581Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:8e28c1549116bdd21bee3e1d623aadbc7fd22642ed9f0f30e434f952d8c91153","observation_id":"b28c05f9-66b4-4dc8-85f7-c5c1c551cb50","resolution":{"observed_at":"2026-08-12T11:30:21.403443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T11:30:20.255802Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.255802Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:75937a9792b79d3fa2293a9401a87d0dcd1100028ef2e84ceadef4f7baa986de","observation_id":"0aca757f-273d-446c-88ab-8bd49d920e18","resolution":{"observed_at":"2026-08-12T11:30:20.255802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06353","last_updated":"2020-09-15T13:27:13Z","snapshot_observed_at":"2026-07-06T08:57:29.493849Z","submitted_at":"2020-02-15T10:03:25Z","title":"UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06353","snapshot_observed_at":"2026-08-12T11:30:20.261336Z","title":"Univl: A unified video and language pre-training model for multimodal understanding and generation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.261336Z"},"links":{"cited_paper":"/paper/2002.06353","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:86e2d1ed2a83d671221eeda2ecb1c451ce6a7b2bad4136b5b08276474a0850eb","observation_id":"a5e8bd5c-3fb9-47de-be4a-89969db9545b","resolution":{"observed_at":"2026-08-12T11:30:20.261336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.383900Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"a0f0d855-9b4c-4cf1-886b-c87d6728c794","year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.266455Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:799ff421ba860cd363dbc2ad4d6384987ed615df26df3ab185848cb27cdf3065","observation_id":"3189e427-a8c2-4978-b120-15cb89919346","resolution":{"observed_at":"2026-08-12T11:30:21.388583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.369173Z","title":"Discriminability objective for training de- scriptive captions","venue":null,"work_id":"f222b18a-acc8-4f88-8c06-58600dd5a53b","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.271181Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:e10d2c971af0b193cfbb3a47fd2dda71d228c3f9d197436e2b10607bc1c01aa5","observation_id":"ea0e8003-9d20-4679-beb0-cca94e0b46df","resolution":{"observed_at":"2026-08-12T11:30:21.374327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.353475Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"bbde7d3b-39ae-4fba-9ac0-999eaa40c582","year":2019},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.276717Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:f3cbbd5fd3887ace59068aec730b81a605f074cf8523a1c66960b52a1982b48d","observation_id":"cb499339-aa4e-41f3-a53b-8d8e206e7376","resolution":{"observed_at":"2026-08-12T11:30:21.358684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.337845Z","title":"End-to-end learning of visual representations from uncurated instruc- tional videos","venue":null,"work_id":"17cf38b8-0360-4457-a28c-685156084346","year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.281897Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:ec0ffa30656048f615b277fd0bb9bb2646717b1eb7ddf401f6656935da12900d","observation_id":"01e3ac2e-6a00-49b3-854c-e17bb462a0f1","resolution":{"observed_at":"2026-08-12T11:30:21.342856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-11T17:44:55.630525Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-12T11:30:20.286884Z","title":"Clip- cap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.286884Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:403d155504fc842d93ba19508d6bab396b264d397014c85c3ed8f0baac1ad724","observation_id":"190f2db0-2770-4c52-99eb-25cd897095f7","resolution":{"observed_at":"2026-08-12T11:30:20.286884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.322265Z","title":"Streamlined dense video captioning","venue":null,"work_id":"5869431c-3540-4c4a-a52c-a551cb9fdc38","year":2019},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.292010Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:32c2dbb3b257de629f32e411434c89740b5980e9d873417e03288fb274cf44d4","observation_id":"86ba81e9-2cf4-4c67-be3a-5de3a0cfffdf","resolution":{"observed_at":"2026-08-12T11:30:21.327232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00575","last_updated":"2022-11-01T16:36:01Z","snapshot_observed_at":"2026-07-06T14:13:07.158001Z","submitted_at":"2022-11-01T16:36:01Z","title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00575","snapshot_observed_at":"2026-08-12T11:30:20.298071Z","title":"Text-only training for image captioning using noise-injected clip.arXiv preprint arXiv:2211.00575, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.298071Z"},"links":{"cited_paper":"/paper/2211.00575","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:a4ca501921090ea8b69014d5571cc2e7c474077daea2cf936596c9b493ba37df","observation_id":"425d1255-1895-4219-bb4c-41052895f79c","resolution":{"observed_at":"2026-08-12T11:30:20.298071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.307514Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"10c3bf81-dbad-4d70-966c-2da18ee5ee47","year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.303224Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:792e67b5443b12a914cf9449d6cbd623d5362bb017ac57f08e2495ff4df7d880","observation_id":"3f725d40-a227-43e7-8e0d-210d9c0fb16c","resolution":{"observed_at":"2026-08-12T11:30:21.312297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.292667Z","title":"Rescribe: Authoring and automatically editing audio descriptions","venue":null,"work_id":"74274355-1171-40a5-b31e-abc5844ca842","year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.308564Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:28c3c0e061ebce16863bc576d5eec605b4aff2420f9e9e8c7b47c6253c242f31","observation_id":"73155be7-3987-4e50-ae7c-0f046f603097","resolution":{"observed_at":"2026-08-12T11:30:21.297653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.277942Z","title":"Gains and losses of watching audio described films for sighted viewers","venue":null,"work_id":"a1b4c060-68e4-41b6-8e3d-16d95cf8d160","year":2016},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.314508Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:24aed0a8d5813fb60055fd3493d946d3b63bfe6d81bce3b49d3e9061fec6c3c0","observation_id":"3d5f1b69-8075-4b51-9a4a-cc5f5cdb035e","resolution":{"observed_at":"2026-08-12T11:30:21.282629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.262752Z","title":"Micap: A unified model for identity- aware movie descriptions","venue":null,"work_id":"eaae15d6-063e-4df7-b3fa-ad0dc165a472","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.319563Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:d9151ee61218cb0496ed1a3b0166351a3c21fa4428287e9788552af01f878365","observation_id":"d906e9e9-9010-472d-bbd9-eaedd8380162","resolution":{"observed_at":"2026-08-12T11:30:21.267702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.246596Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":"754d9050-eeb4-4f0e-b9bf-a24d1ac25648","year":2019},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.324457Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:a9d19ff9238c2ea74f12533a7b5a793d7a53e258b56ef7315b23bfbf1897111a","observation_id":"32fceb71-f90f-4330-bdf7-51aaf1b5c16a","resolution":{"observed_at":"2026-08-12T11:30:21.252571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.230676Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"222061e0-b7bf-4d9a-942b-59d4bc84cdcf","year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.329717Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:d8412057bbba3b62b5735efc26db740614afc4ac840549347d913e5def5ce842","observation_id":"e7fc0d86-6aa8-4923-b001-1811bc3f9e2c","resolution":{"observed_at":"2026-08-12T11:30:21.235740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.214327Z","title":"Watch, listen and tell: Multi-modal weakly supervised dense event captioning","venue":null,"work_id":"064d35c2-d0cc-4585-9277-e9afa55c0992","year":2019},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.335191Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:cd94915d4fc6cf3efe33aa6199a9568a927d71e95a30da33e07283446c14047f","observation_id":"a8379797-23ed-4c49-ad6f-5e07ed01258c","resolution":{"observed_at":"2026-08-12T11:30:21.219693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.198910Z","title":"A dataset for movie description","venue":null,"work_id":"ff36ef8f-48be-4d42-9868-2f146572794c","year":2015},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.340416Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:97966f63a19aa1c0a7eb6a075fb2038cb3f771e5a0a3cff7bc91dddd7eb4322b","observation_id":"41155eae-52c5-4b66-a002-c42f19129dd4","resolution":{"observed_at":"2026-08-12T11:30:21.203727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.183090Z","title":"Movie description","venue":null,"work_id":"463367d2-715c-4205-9baa-0399e88ad009","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.346187Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:6456b91c58224d46d87ce9441662a5730ca38c19aec3da442b628f8746489a75","observation_id":"38e4d5a2-dcd2-47ee-b8a7-baaecf622c46","resolution":{"observed_at":"2026-08-12T11:30:21.188477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.167472Z","title":"End-to-end generative pretraining for mul- timodal video captioning","venue":null,"work_id":"9050f478-4be4-421b-8179-7fd5a1cf2f14","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.351379Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:7d4e11a39e31f3f02ae7ec540e1faba20aff3713b0d6333d309c9026314c8137","observation_id":"76c7bb5c-52b7-45d5-855c-a215bda12685","resolution":{"observed_at":"2026-08-12T11:30:21.172595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.150840Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"d1ec6170-bae8-40d7-a69f-132d5c8be2a3","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.356250Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:9d6538f18c154f3aa0b332b91b6e6c463ac9c06ddfd1bea66cd340d349740eaa","observation_id":"a120a116-b88a-4257-8667-6ca8672067df","resolution":{"observed_at":"2026-08-12T11:30:21.155988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.134864Z","title":"Weakly super- vised dense video captioning","venue":null,"work_id":"0f7600b5-13dc-44c0-8a38-b8bf73ecb90a","year":1916},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.361192Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:06f8cb92dda75f435dd23d2886df020cd3e24c021509ee50aae4ecd7df11baff","observation_id":"08aeaa94-4788-42df-8cbb-9919bb0cb5a3","resolution":{"observed_at":"2026-08-12T11:30:21.139712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.119364Z","title":"Dense procedure captioning in narrated instructional videos","venue":null,"work_id":"7f4aca0f-ca8b-4a74-8fec-ad47f0c14973","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.365803Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:dba333a9b2b88f1563ec2d24efcded707b5f00b244ef20c319f934df1e170e6a","observation_id":"8f133d76-ee14-4dcf-b1ef-ae42d6434d7a","resolution":{"observed_at":"2026-08-12T11:30:21.124630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.102876Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":"7842f979-1d16-41bf-b759-10b9047755c4","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.370645Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:371a1296190cbf15fd09574f0011d21b1f43053fed4b48f58a987115dcb600ad","observation_id":"20c7e090-9998-4ffa-9abb-d6adec1a1b95","resolution":{"observed_at":"2026-08-12T11:30:21.108216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.086666Z","title":"Audio description: The visual made verbal","venue":null,"work_id":"6f45fa70-417a-4d11-b6bb-e1c330cee113","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.375474Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:51a107822440f82d331ddff60712cb329efc461717904a2dd8d99e9346f1ae1d","observation_id":"77fa4c38-5a2e-4f7a-9df3-b99f0cb27b5e","resolution":{"observed_at":"2026-08-12T11:30:21.091809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.069098Z","title":"Mad: A scalable dataset for language grounding in videos from movie audio descriptions","venue":null,"work_id":"a0baa66d-8e32-4141-bb8d-f10d44139732","year":null},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.381315Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:273a8fc0c4c4ae992d3c5f96693c20ae8d4a2339a0d40ea2a6be06d8a9ebf6c8","observation_id":"53f767b4-5613-419d-a45e-db061579556f","resolution":{"observed_at":"2026-08-12T11:30:21.074749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.01070","last_updated":"2015-03-03T19:22:01Z","snapshot_observed_at":"2026-08-04T23:32:00.720564Z","submitted_at":"2015-03-03T19:22:01Z","title":"Using Descriptive Video Services to Create a Large Data Source for Video Annotation Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.01070","snapshot_observed_at":"2026-08-12T11:30:20.386515Z","title":"Using descriptive video services to create a large data source for video annotation research","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.386515Z"},"links":{"cited_paper":"/paper/1503.01070","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:d003681227a11b8ea66c751b6c2affe5526172d2218ec762a2249471a183f73b","observation_id":"3a248ff5-3b61-4870-a9f7-97a836214593","resolution":{"observed_at":"2026-08-12T11:30:20.386515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:30:20.392394Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.392394Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:78a14e2fcd9e50da4099654c8bd6f5e59a50c7b097668b9db1f883c2d8f1870e","observation_id":"ae4f3e86-be4d-4912-ac37-7b24bae5ef75","resolution":{"observed_at":"2026-08-12T11:30:20.392394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.397108Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.397108Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:b53b12508766ff9f0bdd6ec8a3a9ff379abee83624770fc5cf93eb7add4a45df","observation_id":"bca22f9a-8009-45ab-ac50-c0965efe2d57","resolution":{"observed_at":"2026-08-12T11:30:20.397108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.402833Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.402833Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:db1a917613774d6b3de3af4bafa6c32a2126420eddae54093df0ee466d50c363","observation_id":"169aabef-6ee4-4c1a-93a9-d4ba8292e72b","resolution":{"observed_at":"2026-08-12T11:30:20.402833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.030425Z","title":"Joint optimization for cooperative image captioning","venue":null,"work_id":"becd62ef-9b0a-4c2f-96fa-bb05635cbbc2","year":2019},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.407650Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:faff4c50fd3c8f3e07ef7695ca5a809dd1698872f164474a7754d1cc850b1556","observation_id":"ad533852-845d-4a22-b577-df1b28341f93","resolution":{"observed_at":"2026-08-12T11:30:21.036154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12922","last_updated":"2025-04-15T13:30:02Z","snapshot_observed_at":"2026-08-13T00:50:08.027471Z","submitted_at":"2024-03-19T17:27:55Z","title":"Contextual AD Narration with Interleaved Multimodal Sequence","version":3},"cited_work":{"arxiv_id":"2403.12922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12922","snapshot_observed_at":"2026-08-12T11:30:20.571830Z","title":"Contextual AD Narration with Interleaved Multimodal Sequence","venue":"cs.CV","work_id":"6aa585b0-1de9-4cf2-85f6-53ef1b7f1f94","year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.412490Z"},"links":{"cited_paper":"/paper/2403.12922","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:159bab14e16ff36bb3e6f7c412da1448d73a70da68019372062f9aa853e015c9","observation_id":"75122a52-1e50-4ba9-a7b9-883bc6bcc160","resolution":{"observed_at":"2026-08-12T11:30:20.579596Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:21.012661Z","title":"Bidirectional attentive fusion with context gating for dense video captioning","venue":null,"work_id":"3a0c3338-445c-4dea-a99a-72704c5656b0","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.418074Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:633b5c72199aaf29d43abde0b2de65a870ccff8cc82e809f01a2995a94b772c6","observation_id":"c5b510ca-7152-4e1d-9b6a-2f092ffd6b15","resolution":{"observed_at":"2026-08-12T11:30:21.018153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.995849Z","title":"Compare and reweight: Distinctive image caption- ing using similar images sets","venue":null,"work_id":"427030e8-f412-4009-a6aa-88fe91b8b321","year":2020},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.422918Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:b06adc8fc7f80db7383b44c2c2ec45985dce52c547378e1e73dcfcc023e69a43","observation_id":"1dfdf37d-0993-4582-aaaf-97c44303a3b8","resolution":{"observed_at":"2026-08-12T11:30:21.001138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.980938Z","title":"Group-based distinctive image captioning with mem- ory attention","venue":null,"work_id":"41d1c7fe-e0bd-40ce-ae6d-da0e47aabb46","year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.427477Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:4f5375218549e4722bf79e0215749c83d1ce1374ed11a659aede32fef7af1975","observation_id":"e6e2cb71-af4a-4e98-b6d2-e9d03477f90c","resolution":{"observed_at":"2026-08-12T11:30:20.985825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.965729Z","title":"On distinctive image captioning via comparing and reweighting","venue":null,"work_id":"87c2661f-9c54-443c-8a12-72145290165b","year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.431963Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:cecfa56c0210ef94458b77d47ea625aa81a1d9b355cb45c6ebe7c707b79a0967","observation_id":"d05c025b-76ef-482a-a9e0-e7e8875308b5","resolution":{"observed_at":"2026-08-12T11:30:20.970502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.950576Z","title":"Event-centric hierarchical representation for dense video captioning","venue":null,"work_id":"cca6efa7-beb7-4d3a-98c4-989eccae85c4","year":1900},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.436224Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:45742467b4e4cc6b9cf2c9d0dc4cc28d1d2b5dfc053071f1695f17285d83a0a2","observation_id":"52319beb-22ff-48b0-89a0-36799877cec7","resolution":{"observed_at":"2026-08-12T11:30:20.955309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.935563Z","title":"End-to-end dense video captioning with parallel decoding","venue":null,"work_id":"b86879ff-e680-41cb-97ce-6859a09314a6","year":2021},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.440887Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:da3c7569ed3bccfa4f121e3fa95f583bd7c6448c764bc42681c9fcbe1c28d1cb","observation_id":"daf0ef99-e1bc-444a-86c1-acb21e8e4bb2","resolution":{"observed_at":"2026-08-12T11:30:20.940335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.919189Z","title":"Non-local neural networks","venue":null,"work_id":"2614bdb4-7328-4c25-91cd-fc8e2b9e9d2c","year":2018},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.446232Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:0e81edb24c112a66be86a72c9621516ba21ea1af5e22959d4600b4b21c3e904b","observation_id":"970f8517-cb71-4a38-b45b-3fd2b3771cf3","resolution":{"observed_at":"2026-08-12T11:30:20.924408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15850","last_updated":"2024-11-21T20:54:35Z","snapshot_observed_at":"2026-08-12T23:17:04.363233Z","submitted_at":"2024-07-22T17:59:56Z","title":"AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15850","snapshot_observed_at":"2026-08-12T11:30:20.450704Z","title":"Autoad-zero: A training-free framework for zero-shot audio description","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.450704Z"},"links":{"cited_paper":"/paper/2407.15850","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:0cbd3f419841243ccb459c64a759951d7faaa1d8c37cbb9a29cb70f8f8b77e10","observation_id":"9a51e9ef-70a4-4971-b81c-0b827c920e80","resolution":{"observed_at":"2026-08-12T11:30:20.450704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.901353Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":"66fb9bde-19e8-4815-9ae6-5abe1a61d1c2","year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.455460Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:bfff00154124c46d1e093775e803905058f49c919a273553040a63d75fb2fcaa","observation_id":"8933c6c2-56e0-40d4-8412-55e8f33a91f1","resolution":{"observed_at":"2026-08-12T11:30:20.906219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.886487Z","title":"Image difference cap- tioning with pre-training and contrastive learning","venue":null,"work_id":"fc7d9af1-5fab-46d0-a3b1-a0cb58c8c5ad","year":2022},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.460341Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:e51d0153f3dcedceff1eebeb2fb6239eb536860d86a86c249a386479dbef3723","observation_id":"51d7a8be-751b-4b9b-affd-f1ca63fdc1f4","resolution":{"observed_at":"2026-08-12T11:30:20.891378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.871398Z","title":"Videoblip, 2023","venue":null,"work_id":"655abf35-fdf6-45dd-b6e0-f9265efb77a7","year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.465130Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:e1193183ba7c6031cd7a5703a6c59ff2cb23cf27b52c430246625d9e17f1e703","observation_id":"2e8cb047-05c8-4101-b77a-fb540698f292","resolution":{"observed_at":"2026-08-12T11:30:20.876416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.855725Z","title":"Mm-narrator: Narrating long-form videos with multimodal in-context learning","venue":null,"work_id":"d07014a3-7559-4ff1-8de3-c4e6e4ea9f59","year":2024},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.469477Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:7d3a03c74cdf0b2f3710ed8ef0cfc80f28d3a7f8ecac91aa13db32f11d876794","observation_id":"83fa0344-cd93-42ba-840e-628f90421e7d","resolution":{"observed_at":"2026-08-12T11:30:20.860956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T11:30:20.473950Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.473950Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:ff6fae7bd5f724bc082b4434faf942a9a08cba05cfbcb08ea09505ab5c2a2fe6","observation_id":"d9e78c4b-1d56-43b2-b1e1-f52f0a56bce6","resolution":{"observed_at":"2026-08-12T11:30:20.473950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-12T11:30:20.479562Z","title":"Bertscore: Evaluating text genera- tion with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.479562Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:34d465132c4a7116a334d9c2f6cbd2e82815a7a6151129ccdebe6745b26c8a94","observation_id":"b66d9701-a6e4-4fea-9071-e244ac9cb545","resolution":{"observed_at":"2026-08-12T11:30:20.479562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:30:20.839466Z","title":"nuns” mistakenly appears in (d). AutoAD-II tends to gen- erates similar AD words, e.g. “furrowed brow","venue":null,"work_id":"fc414903-e9bd-490b-90fd-ce67ad9a6c21","year":2002},"citing_paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T11:30:20.484216Z"},"links":{"citing_paper":"/paper/2411.18180"},"observation_digest":"sha256:921a3df969ef3d595d2f5a77aea24e55fff89830b3628869e3c581ac59e4801f","observation_id":"d7d91cf0-d474-4d6a-8f0b-d2fda08ed880","resolution":{"observed_at":"2026-08-12T11:30:20.844965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18180","last_updated":"2024-11-27T09:54:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:07:07.521493Z","submitted_at":"2024-11-27T09:54:59Z","title":"DistinctAD: Distinctive Audio Description Generation in Contexts"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":56},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2411.18180."}