{"as_of":"2026-08-22T13:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ff886d3538c64be39b64260c01a1c692ea81e4ae70d69a24fc0de965b98a5e5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:18:05.048266Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03183/citation-record","integrity":"/paper/2501.03183/integrity","json":"/paper/2501.03183/citation-record.json","paper":"/paper/2501.03183"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:04.919134Z","title":"Show and tell: A neural image caption generator,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.919134Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:bae2a2766d82c38e2a86ff478d78ddfe9bb2f969c81492f6dd64bdd2d8d7ecc1","observation_id":"78210de9-879c-4326-9946-a11aa4dcc1a4","resolution":{"observed_at":"2026-08-10T22:18:04.919134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:04.923828Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.923828Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:51385cf2be0d25b773d6240b1d0ffe66b8c453e32bd43b7c7f8d8db73214674d","observation_id":"b15ac4e8-e6a1-4262-af59-0d6cce8667b2","resolution":{"observed_at":"2026-08-10T22:18:04.923828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.468227Z","title":"Long-term recurrent convolutional networks for vi- sual recognition and description,","venue":null,"work_id":"10f9acd6-05b8-4caf-97dd-40f8dfa167a7","year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.927640Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:62a0ec96cb4c3503dacf2d2ccc15665b3c44f568148292da389992e6d2177acc","observation_id":"c506ad58-7a92-4a3b-9aab-ed9695ec1c51","resolution":{"observed_at":"2026-08-10T22:18:05.472753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.454607Z","title":"Show, attend and tell: Neural image caption generation with visual attention,","venue":null,"work_id":"3b089621-6fd3-473d-b0ab-f868a5b47bef","year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.931781Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:6cfff617d8d314ba5078afc9b5cdb59b069517b4c3d1d324c8c734132d1eefa7","observation_id":"4a8c7b6b-d18e-4c4f-ae28-f286b5dd11b0","resolution":{"observed_at":"2026-08-10T22:18:05.459360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:04.935997Z","title":"Image captioning with semantic attention,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.935997Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:0468896feecffc7f7a117fd05b84cd1e4b8ba1336e26c32e47ab382f5f637ad8","observation_id":"a05dee41-949c-40fd-a2f9-291058b70830","resolution":{"observed_at":"2026-08-10T22:18:04.935997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.434959Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"9eeb38bf-822e-4cb9-b069-bed6132fabb4","year":2018},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.939836Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:f50589f4ef3362e5d40ddeae54a0b8bd555ba6467433757efabb0c440b8a487d","observation_id":"0f391700-c4f3-4a8c-94e7-fd484b72d490","resolution":{"observed_at":"2026-08-10T22:18:05.438905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.422772Z","title":"Automated audio caption- ing: Describing audio content with natural language,","venue":null,"work_id":"cb8892e6-a3f9-49d3-8ac0-f991172784a2","year":2017},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.944049Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:66cee2b41f8878c5c1971ea84859cc3a19bf778b8af04282eb263ed3738b7d6a","observation_id":"bd93a27d-58cf-46bf-8bfc-ee0e49ecf9de","resolution":{"observed_at":"2026-08-10T22:18:05.427091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.410493Z","title":"Audio captioning using pre-trained large-scale language model guided by audio-based similarity,","venue":null,"work_id":"ca10fb74-90b0-4372-96e5-2ba649d05cc8","year":2020},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.947529Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:f652a1e22415269cd57e1d382a95e11c89eac535fba004791753e82997043ad2","observation_id":"322c8105-402b-44f4-891e-1deb1e77f68b","resolution":{"observed_at":"2026-08-10T22:18:05.414664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.399050Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":"22eb7878-f03e-4a66-a5f4-0c3f5d88f4b6","year":2019},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.951128Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:830cd354d69c4aa217f7e061e54c9a001b0003ec02d7df8cf9d5e5e0163d9f8a","observation_id":"b14266be-1e21-4dd9-ac0c-be6d3f71119a","resolution":{"observed_at":"2026-08-10T22:18:05.403179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.388017Z","title":"Audio caption: Listen and tell,","venue":null,"work_id":"22ccd280-6bf4-4bf2-b9b4-d9b388dd82a6","year":2019},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.954685Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:817d82e09fda0e653a3d1cf3743b8951cb709284eb7f7e58f072f2a34c6e6833","observation_id":"80f109b1-bc92-4bd0-b6c0-b28397e315b7","resolution":{"observed_at":"2026-08-10T22:18:05.391796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-10T22:18:04.958544Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.958544Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:8a3aa7e16a1f56a0f916f173f912edf557503e08604b0a7bb09110de7cd1890c","observation_id":"ff2682c8-463d-485b-90bf-5841ec2584b7","resolution":{"observed_at":"2026-08-10T22:18:04.958544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.377057Z","title":"Clotho: An audio captioning dataset,","venue":null,"work_id":"86081f74-a015-4e07-a059-fd6dc90b0d49","year":2020},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.962574Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:a06afa82e0290fe696da36a27c1057a790c54b2f80ae68f3aeb0a0b71b2e38ca","observation_id":"81a354f7-3592-4422-97cb-4744973ef479","resolution":{"observed_at":"2026-08-10T22:18:05.381034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.365929Z","title":"BLEU: A method for automatic evaluation of machine translation,","venue":null,"work_id":"1ba8b45d-7c4f-42ba-afa5-23869c43cc03","year":2002},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.966230Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:3bb64e7b7a0d0dfe261a83c7d141dfbc0dc1a4873b8f787f49779dadc63e91a0","observation_id":"6a6f8b90-d07f-427d-b6d1-edc61257ccbe","resolution":{"observed_at":"2026-08-10T22:18:05.369913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.354585Z","title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments,","venue":null,"work_id":"a062f27d-f286-4599-a1bd-8125315debec","year":2005},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.969722Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:2e5f081fab8e8574cd4cccb621cc4cb822f4a355dbb4888d99fac06348872951","observation_id":"94d10fb7-a134-4147-a3f2-17505e53cb5d","resolution":{"observed_at":"2026-08-10T22:18:05.358608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.342886Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":"1c59a173-48c6-4dd1-9762-d2d749e7f4d7","year":2004},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.973205Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:1c33f9ca87d19aa308b622987a1e3216583c4e61caae7c129b67c42436a5d956","observation_id":"0b9e62ec-d122-47c7-90e6-78756a178118","resolution":{"observed_at":"2026-08-10T22:18:05.346912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.330878Z","title":"SPICE: Semantic Propositional Image Caption Evaluation,","venue":null,"work_id":"71827fc9-e7fa-4635-87d5-5e31a49bc1ff","year":2016},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.976898Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:f0d54cc95232f4816aa69bcda12f1b4213bf516d4e1cf2ea411354f5cf0ded38","observation_id":"e734133b-4db1-406e-b0d3-6c862389dd3b","resolution":{"observed_at":"2026-08-10T22:18:05.334971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.318734Z","title":"CIDEr: Consensus-based image description evaluation,","venue":null,"work_id":"ff49cd40-e39c-470d-b4a7-2a6260888e6e","year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.981184Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:0995ab66d6f194cf95763c2fc217c8a274c64f5b536ecfd0ad7b258df66d3467","observation_id":"09c650db-31e4-40ca-82b6-21de913e4f24","resolution":{"observed_at":"2026-08-10T22:18:05.322899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T22:18:04.984909Z","title":"CLIPScore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.984909Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:b68584099a6397541804c8e3c78e358da3846748115d7d749598645c3f5375d9","observation_id":"66cd22c9-e800-41f3-a1ed-9abfa0cb7167","resolution":{"observed_at":"2026-08-10T22:18:04.984909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.306652Z","title":"ZeroCap: Zero-shot image-to-text generation for visual-semantic arithmetic,","venue":null,"work_id":"dc5b7d9a-5681-422a-b063-4b099fa7ec5a","year":2022},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.988864Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:4568967a38c154d394be13ac95c7926e9a8b49d502c63306a22c944336b28b87","observation_id":"fe1d891d-a31b-4ac8-864f-e72f57f0b7ed","resolution":{"observed_at":"2026-08-10T22:18:05.311402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-10T22:18:04.992584Z","title":"CLIPCap: CLIP prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.992584Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:4b9e9838ca7e660a092379166eaf3163b8df700529e01f62d354e11f42c8f14d","observation_id":"aed2f169-d73e-4828-b27c-650bb3656e7e","resolution":{"observed_at":"2026-08-10T22:18:04.992584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.294616Z","title":"Prefix tuning for automated audio captioning,","venue":null,"work_id":"c4b8abe3-d0d2-47b1-95e7-9b6eeafa98d6","year":2023},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.996728Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:8dc62f82a1f1c082b0c8fa3fbe770de41299e0c607047fe4cf057a8d19cdd790","observation_id":"71fb319e-6ce4-47ba-9ad8-26be86c9db02","resolution":{"observed_at":"2026-08-10T22:18:05.298770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.282479Z","title":"RECAP: retrieval-augmented audio captioning,","venue":null,"work_id":"dd4f60d9-6826-4b37-a225-a361510eddba","year":2024},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.000446Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:49aea33fc07bcedc494a4deb480a24fb8010953981c9cf6036876404df67fd9b","observation_id":"1366c640-4e96-4369-84c4-d51dcb07ecf1","resolution":{"observed_at":"2026-08-10T22:18:05.286869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08396","last_updated":"2023-11-14T18:55:48Z","snapshot_observed_at":"2026-08-19T07:16:57.953003Z","submitted_at":"2023-11-14T18:55:48Z","title":"Zero-shot audio captioning with audio-language model guidance and audio context keywords","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08396","snapshot_observed_at":"2026-08-10T22:18:05.004061Z","title":"Zero-shot audio captioning with audio-language model guidance and audio context keywords,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.004061Z"},"links":{"cited_paper":"/paper/2311.08396","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:c51f8b38038ae40e6f8e6bf7932b5649cc081c9930dc033f0f0ac522c0f7ebd4","observation_id":"8899e979-39e8-4e3b-b82a-ae50ee3904c1","resolution":{"observed_at":"2026-08-10T22:18:05.004061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.269140Z","title":"Training audio captioning models without audio,","venue":null,"work_id":"124b6a52-128b-437b-9083-393b52d601b2","year":2024},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.008543Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:7037b941f934e39629fa0c46ccddcf37a042e4a75726e6acc231c84153109ac4","observation_id":"2a395bbe-361e-4761-aa54-790fdd99c23b","resolution":{"observed_at":"2026-08-10T22:18:05.273630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12242","last_updated":"2023-09-21T16:40:46Z","snapshot_observed_at":"2026-08-22T07:00:58.485014Z","submitted_at":"2023-09-21T16:40:46Z","title":"Weakly-supervised Automated Audio Captioning via text only training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12242","snapshot_observed_at":"2026-08-10T22:18:05.012263Z","title":"Weakly-supervised automated audio captioning via text only training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.012263Z"},"links":{"cited_paper":"/paper/2309.12242","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:cc17999a98e2db9585999bc0cc9b93bf15b822bd889db61e18f6fb6435543af9","observation_id":"926b9a59-d539-4b50-baad-335164637750","resolution":{"observed_at":"2026-08-10T22:18:05.012263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06295","last_updated":"2024-06-10T14:16:28Z","snapshot_observed_at":"2026-08-22T07:01:02.774769Z","submitted_at":"2024-06-10T14:16:28Z","title":"Zero-Shot Audio Captioning Using Soft and Hard Prompts","version":1},"cited_work":{"arxiv_id":"2406.06295","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.06295","snapshot_observed_at":"2026-08-10T22:18:05.094829Z","title":"Zero-Shot Audio Captioning Using Soft and Hard Prompts","venue":"cs.SD","work_id":"b1684f74-a46d-464e-9a1e-ca4a3a17161a","year":2024},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.016484Z"},"links":{"cited_paper":"/paper/2406.06295","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:f887f5b23b792584ff9b9691fe19e99661e4be0a4fc671e532eeaef11f0806a9","observation_id":"922d3f24-c35f-49e9-8c59-944ca82a7cf3","resolution":{"observed_at":"2026-08-10T22:18:05.101683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.255901Z","title":"Show and Tell: A Neural Image Caption Generator,","venue":null,"work_id":"492dfeca-03bf-42a8-a290-8bc3d3fab7a8","year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.020540Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:2e2005031c98626ba6a5d8cd40c7495c0beec617c89cffbccb36b0a9bf13f68c","observation_id":"658df8bf-b551-42db-aae4-5ebd97215674","resolution":{"observed_at":"2026-08-10T22:18:05.260538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.243262Z","title":"Show, Attend and Tell: Neural Image Caption Gen- eration with Visual Attention,","venue":null,"work_id":"cf4a92d0-862e-4402-ab4b-ccabb3e0229b","year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.024407Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:a523ae35a830ad17de1ea9c6f8d0b4e9a917485b4a7d8dca6a2ac76ee124e2ad","observation_id":"89a915bf-2a91-4118-9e1a-f29875a5903f","resolution":{"observed_at":"2026-08-10T22:18:05.247832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.229823Z","title":"Self-critical Sequence Training for Image Captioning,","venue":null,"work_id":"66a9af67-7a5b-4f5a-9472-03a0e263126c","year":2017},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.028373Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:6b1fc2fb88eac62ba3c083e61b7ddc361f2e36f7291c9158e5b30c3bdf858e61","observation_id":"1c3f901d-dfb4-45b3-896e-64a4f55905c0","resolution":{"observed_at":"2026-08-10T22:18:05.233886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.215260Z","title":"Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering,","venue":null,"work_id":"79b84fe5-5f9b-4061-a174-ee16f0d38832","year":2018},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.032219Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:91d1c037343a87f3d63597cb38db4cf1732e8f083db566efbff813aea195da82","observation_id":"1648d6af-eafd-4f0c-a71c-bfd8d129bdec","resolution":{"observed_at":"2026-08-10T22:18:05.220173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.201361Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"2f6cfb1a-38dc-4bd7-97da-8a822b21e3df","year":2014},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.035896Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:1440cd18d679055f240b1037ab58e924d84396f473539e323c1a6716c9e6dbc1","observation_id":"88a5efc7-3120-4221-9938-61c06bc2f4eb","resolution":{"observed_at":"2026-08-10T22:18:05.206008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.186704Z","title":"Flickr30k Entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models,","venue":null,"work_id":"8dabd824-d0d7-413e-994f-560c52300ef3","year":2015},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.039652Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:279774679b64b011db7df42d17b651c2cd665b3c4cd502727b7f5cbbd8e9abc4","observation_id":"32aff856-5090-4c8f-a15d-d4ea27a5b10a","resolution":{"observed_at":"2026-08-10T22:18:05.191045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-10T22:18:05.043287Z","title":"BERTScore: Evaluating text generation with BERT,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.043287Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:9ae033505bfc171a2eedf3865a989fc06323fcfa7e2041a455066ec8341bcacf","observation_id":"73e2fdb5-7765-4d30-9f24-fd27c1532720","resolution":{"observed_at":"2026-08-10T22:18:05.043287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:05.173189Z","title":"CLAP: Learning audio concepts from natural language supervision,","venue":null,"work_id":"3d393093-b4f3-423d-a6fa-02ffcd0f1616","year":2023},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:05.048266Z"},"links":{"citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:b240c4fc8ba037958cda3f201479821bb3bf1ba280c3bfc456d4ce2d71e6b126","observation_id":"691c4315-bb22-4fcf-9b97-0e2611d79279","resolution":{"observed_at":"2026-08-10T22:18:05.177813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2501.03183."}