{"as_of":"2026-08-23T22:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d2d48f7c09f716adcef349e0f22bf96c31d8701326e09d0a45762c34b7e9e997","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:00:33.291636Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05260/citation-record","integrity":"/paper/2608.05260/integrity","json":"/paper/2608.05260/citation-record.json","paper":"/paper/2608.05260"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.835170Z","title":"In: Eu- ropean Conference on Computer Vision (ECCV)","venue":null,"work_id":"8df821d2-db41-4f59-9f05-dd1618c0fa3c","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.183793Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:806c032319bdac4e4beed3c56e208095d8d93d20fbbe0dd0b055cee120a7637d","observation_id":"1a5fdd20-2aab-47c5-853e-d03d0343c3c5","resolution":{"observed_at":"2026-08-08T17:00:33.839636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.819815Z","title":"Advances in Neural Information Processing Systems (NeurIPS) 36, 35544–35575 (2023)","venue":null,"work_id":"66512d67-2fb8-41e1-baf6-5b2792fa20c9","year":2023},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.189678Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:ea30d7a2c6d79dad3c36381ee62dcd08908175d28a8c47baec677a8bf512f144","observation_id":"c84c8f52-7611-4bc3-9519-a9dba28dc1ae","resolution":{"observed_at":"2026-08-08T17:00:33.824934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T17:00:33.194553Z","title":"arXiv preprint arXiv:2407.21783 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.194553Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:1337df4b3a5f473dc39dca5f95b2b2f3c51a32922569b43fd309e986f4485853","observation_id":"fca33485-8856-4111-b7c8-04c459bc969d","resolution":{"observed_at":"2026-08-08T17:00:33.194553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.804063Z","title":"In: International Conference on Machine Learning (ICML)","venue":null,"work_id":"2a62db8a-dd87-4f68-b11f-32ca83e5dc88","year":2021},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.199771Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:db0f27507238baf5e119c51b6f40064c6f6dc6df3fef7e640914f07964346763","observation_id":"a441bcaa-489b-4f15-8d42-50f5c84fc98a","resolution":{"observed_at":"2026-08-08T17:00:33.808782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.789205Z","title":"In: European Conference on Computer Vision (ECCV)","venue":null,"work_id":"5515dbcb-bf50-4649-a91b-1bb012561e71","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.205035Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:ce09573441017ca9b158c68271f8fa3892ba3b3969ddfb7d0fade1561b77a761","observation_id":"747a5b31-3f90-40e8-a59a-8eb38c60963b","resolution":{"observed_at":"2026-08-08T17:00:33.793948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.774144Z","title":"In: Proceedings of the International Conference on Machine Learning (ICML) (2024)","venue":null,"work_id":"23165916-4f6a-4fdd-a5f4-b2a1b0c7ddde","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.210160Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:a370ddfd9f8e4407f4a8463feb93dde2d8bc917ad2c8ad66bfb8a6010b45ca07","observation_id":"772ada05-14a1-4ea9-a61f-86d3b92fd15b","resolution":{"observed_at":"2026-08-08T17:00:33.779205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.759200Z","title":"In: International Con- ference on Machine Learning (ICML)","venue":null,"work_id":"485eb938-12d1-4f44-aa4f-c648bbfb2400","year":2022},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.215562Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:cc5515a1194ef446a8cc248542c29e9fd788ee3bc846e4788503d34e0f459ade","observation_id":"1803b72a-b9a2-4071-a272-928f23657fa6","resolution":{"observed_at":"2026-08-08T17:00:33.763972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.744244Z","title":"In: European Conference on Computer Vision (ECCV)","venue":null,"work_id":"e9da6ea7-1993-431e-8b59-1e7b6fe25916","year":2014},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.220176Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:ef3c242a719a4eb67b95cfa44123a58ffda61f1ccf9277a62f4d87b95b701910","observation_id":"b0412ad6-88e7-402e-86f7-3256a986a781","resolution":{"observed_at":"2026-08-08T17:00:33.748984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.224619Z","title":"In: International Conference on Learning Representations (ICLR) (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.224619Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:d03e1fb35a2bc1601dc8e87f5e36a46471e72ead6bc3898ae2be2f88619c8fe0","observation_id":"3146cad1-0bb5-4ab9-921e-c03d3e4424cf","resolution":{"observed_at":"2026-08-08T17:00:33.224619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.719489Z","title":"In: ECCV (2024)","venue":null,"work_id":"30eccb0f-31cf-4cd0-8b8f-9610469cecad","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.228860Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:802f23cec8887946330beb40308eda9b37531d98010fbaf22e7ab23e7da3811d","observation_id":"82168643-d68e-4d00-8a8b-0d19d2f33991","resolution":{"observed_at":"2026-08-08T17:00:33.724666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-08T17:00:33.233154Z","title":"arXiv preprint arXiv:1807.03748 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.233154Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:f8f662bc29db118d4ec9cd4c0ad93fd8a14382ab7ad1a0c2a67c18d8f87a580c","observation_id":"77424ed7-2477-4219-b5b0-588be0c1c8d4","resolution":{"observed_at":"2026-08-08T17:00:33.233154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.705043Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"f3c60cbf-2e95-4b20-b130-391e33ee2f67","year":2023},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.237318Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:d080b0ed2f0fd7101ba305e2dfa83945fc5a9d8163fa9f3f35b7b0a3aeb09d15","observation_id":"d7054a31-e0ff-4599-a479-8cdf76b95375","resolution":{"observed_at":"2026-08-08T17:00:33.709482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.241628Z","title":"In: International Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.241628Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:71f2ec3793307c755f2e3b2f30b266f7ba2cc5686687111cb4aa2814ee4c6aed","observation_id":"704290da-8d07-4d16-9340-84be04ed005a","resolution":{"observed_at":"2026-08-08T17:00:33.241628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-08T17:00:33.245583Z","title":"arXiv preprint arXiv:2204.06125 1(2), 3 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.245583Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:72569a5b1b008672520ae3a00b2422d845818770ffebf795b8474acc1daf60a9","observation_id":"84de665c-24d5-4ef3-8546-ff4ec788a225","resolution":{"observed_at":"2026-08-08T17:00:33.245583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.681190Z","title":"In: International Conference on Learning Representations (ICLR) (2021) 16 M.Ghazanfari et al","venue":null,"work_id":"8816e376-3ac6-4190-9d95-a74d4ec402a8","year":2021},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.249586Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:b5d85855bf0eecda0d5dc3a1610ff51fb5ee2442821641c6bf5594c6ae26c0cb","observation_id":"08688c6e-4711-48dc-aeb4-d5b522261793","resolution":{"observed_at":"2026-08-08T17:00:33.685899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.253337Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.253337Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:9e2cc2dac91fb522a1c7d881c2b3eaf590639465fb6e7d43f6f0cf912cf14e04","observation_id":"7ee4f2b7-6c01-4a99-813e-bbae9f47fceb","resolution":{"observed_at":"2026-08-08T17:00:33.253337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.alvr-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.324070Z","title":"In: Proceedings of the 3rd Workshop on Advances in Language and Vision Research (ALVR)","venue":null,"work_id":"7be5d900-845d-4ef0-be87-6bd512532fda","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.257190Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:54da40eac8f87c6237481996cab7d5e039997561a312f021d26c8bd7ab10d926","observation_id":"e98ffb44-07fb-41d4-8f9b-c2ba80873e36","resolution":{"observed_at":"2026-08-08T17:00:33.330630Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.654675Z","title":"In: Proceed- ings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":"20cd3ee2-5166-49d0-9767-e28512416a78","year":2018},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.261074Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:42c7f240896efd4e92244514468b9c17f8155fdf5899397d956160a5e373de5b","observation_id":"dee9fbdb-d40e-43a4-a8eb-ab9774a627c4","resolution":{"observed_at":"2026-08-08T17:00:33.659977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.638234Z","title":"In: International Con- ference on Learning Representations (ICLR) Workshop (2014)","venue":null,"work_id":"c2fccd56-3888-462b-ae71-8a675b229eb3","year":2014},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.265260Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:2386a727585521f95d491ff534ff24b3e1b1bcfb359807577cb043f615607e12","observation_id":"83df07ab-95f4-4070-aed7-f1861d75ff57","resolution":{"observed_at":"2026-08-08T17:00:33.643309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.269361Z","title":"In: 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.269361Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:bb0189b5440cca6c28efde0bd945b6cadd5fd7d5b19c37682eb717de8cd2c8ca","observation_id":"9ca25fc7-b458-42fd-ba49-27427a49dec9","resolution":{"observed_at":"2026-08-08T17:00:33.269361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T17:00:33.273928Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.273928Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:8541a626541313f3f0abafc0117fe9bb892abd776736afad02d02643dbca5d2c","observation_id":"996660f5-0810-40a4-9a7c-492b160e3f47","resolution":{"observed_at":"2026-08-08T17:00:33.273928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.622499Z","title":"Transactions of the Association for Computational Linguistics (ACL)2, 67–78 (2014)","venue":null,"work_id":"0ed0ab03-e66a-4284-a105-345c9e62d357","year":2014},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.278526Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:6829daf49bda40e71eaae5266ae0c8194dfd6259163da3160830764619cd3c41","observation_id":"280b3164-6e06-4b20-a3d7-571b10e6f597","resolution":{"observed_at":"2026-08-08T17:00:33.627951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.607685Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"046fa36e-549c-4260-b3a1-41a765e1755b","year":2023},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.282603Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:3aec131fe44ca52f1713611a587906c439559fdc9560a8820c4115e519f59193","observation_id":"5b3ea0d7-8b06-47d6-b2f2-809ae35e2167","resolution":{"observed_at":"2026-08-08T17:00:33.612458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.592405Z","title":"In: European Conference on Computer Vision (ECCV)","venue":null,"work_id":"df294602-9f9f-4948-9697-1e916156b2ee","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.286962Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:c6deaffd904cce60f5916ac693fd610bf5a08f263700f9a35968daaa60915c88","observation_id":"785dc7fe-8379-4fc9-8bba-037e1515c7a9","resolution":{"observed_at":"2026-08-08T17:00:33.597247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:00:33.576547Z","title":"TRUTH / IS A BREATH AWAY / THE VICTORY","venue":null,"work_id":"ab36a819-279f-4ac2-a821-f99ba800b3b7","year":2024},"citing_paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T17:00:33.291636Z"},"links":{"citing_paper":"/paper/2608.05260"},"observation_digest":"sha256:7a025332b44223443446b0164847d65bd1da67a275bd3ddcf6a8e0c4d4b9e258","observation_id":"66e68059-776e-4c4d-af48-b09ab75109e9","resolution":{"observed_at":"2026-08-08T17:00:33.581371Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05260","last_updated":"2026-08-05T17:09:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:04:46.431070Z","submitted_at":"2026-08-05T17:09:24Z","title":"A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.05260."}