{"as_of":"2026-08-08T09:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a6d2a556123f6a1e2f06ab4e5f97874a6dd6ff07129e7761d4076e7ed416c5b","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:25:34.169118Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.10118/citation-record","integrity":"/paper/2502.10118/integrity","json":"/paper/2502.10118/citation-record.json","paper":"/paper/2502.10118"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.467638Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.467638Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:59221feb0fa077e9093eb25003ab765e8f177a9b2c897ed1c46c6ab0996772d5","observation_id":"aa4a5621-038b-4697-8500-4d1f2f11010d","resolution":{"observed_at":"2026-08-07T19:25:33.467638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.499305Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.499305Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:499f5881460a90285acd47f9bbb319c82d7672222da31873d488bb87ee51b3ea","observation_id":"b8316e0d-7389-40ee-a9cf-e780a4b05719","resolution":{"observed_at":"2026-08-07T19:25:33.499305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.14883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.038755Z","title":null,"venue":null,"work_id":"10715f51-7d0a-4c83-b240-aff812a3ccb2","year":2025},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.528785Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:2420dd953c8f610359f745301716ee16fb577374d82503bd61ff0b2f0d096e10","observation_id":"ead2f968-5e09-4675-8aeb-141e96a55638","resolution":{"observed_at":"2026-08-07T19:25:36.054649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.704042Z","title":null,"venue":null,"work_id":"0be919ec-3868-4599-97da-ff156cb315af","year":2024},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.531752Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:748c6cbd457665d12470b94d4dcb441ea363d3ceec24eb0f1843ba6d51bb27e9","observation_id":"859d34b3-00e6-4aa5-832e-cec2dae4d5a3","resolution":{"observed_at":"2026-08-07T19:25:36.706941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08529","last_updated":"2019-08-22T17:59:08Z","snapshot_observed_at":"2026-07-06T08:16:13.373890Z","submitted_at":"2019-08-22T17:59:08Z","title":"Sequential Latent Spaces for Modeling the Intention During Diverse Image Captioning","version":1},"cited_work":{"arxiv_id":"1908.08529","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.08529","snapshot_observed_at":"2026-08-07T19:25:35.415589Z","title":"Sequential Latent Spaces for Modeling the Intention During Diverse Image Captioning","venue":"cs.CV","work_id":"72eff24e-cd0a-4613-9908-1ef7bd8572b2","year":2019},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.534230Z"},"links":{"cited_paper":"/paper/1908.08529","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:02777ef573c7030074f96b699aa3dd817416ce342b7f2ddeee20ab855bc07afa","observation_id":"f4ac3de0-ec1d-4fd2-9dd6-d203e4c0f0fa","resolution":{"observed_at":"2026-08-07T19:25:35.475849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.694191Z","title":null,"venue":null,"work_id":"f21be97d-f360-400f-8f1f-1ec9631c94f8","year":2019},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.537274Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:6de8dd17c3ab9c06688801cf2dff345125d6f67f7e222bef1280918fe7357367","observation_id":"546450be-0115-4939-9628-b4e78e731cb1","resolution":{"observed_at":"2026-08-07T19:25:36.697435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.540295Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.540295Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:de4ee92ef963b7bcfcc8311c28164195423aaac4b65cba87b6ea4b649572b519","observation_id":"9cc50b74-be6b-4bfa-a8d7-90d7de24a3bb","resolution":{"observed_at":"2026-08-07T19:25:33.540295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long.1503","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.402358Z","title":null,"venue":null,"work_id":"3eddf518-0b56-41cb-a8ff-143de7af2298","year":2025},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.542937Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:bb732ec13bd4656f37b313dea853bfa052e9bf43b294fbbcf6056bb975cd4666","observation_id":"76fa143b-82fb-4e96-b783-b7977ca1aac9","resolution":{"observed_at":"2026-08-07T19:25:34.405000Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.545277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.545277Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:ec6066b91645a914c36fdfa77dd1b13429deaf90faceedd1e10d55fcbb4b9ced","observation_id":"6dd52c43-0805-42d2-8c48-f54dd9a33514","resolution":{"observed_at":"2026-08-07T19:25:33.545277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06742","last_updated":"2024-04-01T03:00:06Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T18:59:06Z","title":"Honeybee: Locality-enhanced Projector for Multimodal LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06742","snapshot_observed_at":"2026-08-07T19:25:33.547503Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.547503Z"},"links":{"cited_paper":"/paper/2312.06742","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:cc22ae554f298cb36742647b97877381a5ade10b19ed020b12cdc983384fd70e","observation_id":"f3f95225-f6ea-42eb-9236-2ab51d5cdbe2","resolution":{"observed_at":"2026-08-07T19:25:33.547503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00485","last_updated":"2025-08-20T17:41:38Z","snapshot_observed_at":"2026-07-06T18:08:09.361079Z","submitted_at":"2024-05-01T12:49:57Z","title":"What Makes for Good Image Captions?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00485","snapshot_observed_at":"2026-08-07T19:25:33.550436Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.550436Z"},"links":{"cited_paper":"/paper/2405.00485","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:390482bb7dad3f1008e89323386132ce1420f397a1e49b9ba22315187178e17c","observation_id":"ac771f15-1c3e-403e-95d1-18291c5cd0e2","resolution":{"observed_at":"2026-08-07T19:25:33.550436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.629664Z","title":null,"venue":null,"work_id":"7e8406b9-8b42-4823-983a-3116c857bd37","year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.553168Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:f12acfa9120d042bafb0e9504114a89100d422532f6f56d029476ef59b365996","observation_id":"a8b88e4a-d5f3-48c6-a815-bdef4223e7f2","resolution":{"observed_at":"2026-08-07T19:25:36.683121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08231","last_updated":"2023-08-15T07:24:55Z","snapshot_observed_at":"2026-07-06T13:53:17.867762Z","submitted_at":"2022-09-17T03:25:46Z","title":"Learning Distinct and Representative Styles for Image Captioning","version":2},"cited_work":{"arxiv_id":"2209.08231","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.08231","snapshot_observed_at":"2026-08-07T19:25:35.210125Z","title":"Learning Distinct and Representative Styles for Image Captioning","venue":"cs.CV","work_id":"f7e02921-3933-4f2f-8ad9-f5ac8164ab39","year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.555646Z"},"links":{"cited_paper":"/paper/2209.08231","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:f3f3fdc81407d50f923c011e05d03049fc4c56815d64dc697f6cd0b2f5294556","observation_id":"ed7c734c-c624-444b-998c-636e6e9963d9","resolution":{"observed_at":"2026-08-07T19:25:35.213342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-02T17:07:32.299595Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-07T19:25:33.558270Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.558270Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:f3e6d227bedaa7ec87d970a1f0172e422f9e2a2c5e083b4ec22a96f73789989d","observation_id":"3ea38642-fee4-454e-b912-af096972d4fa","resolution":{"observed_at":"2026-08-07T19:25:33.558270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.561008Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.561008Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:000b26386b49b2386824d869e0df9ecbb28cd1d8f6596f8643a05f08f92039ad","observation_id":"bd1132c6-67f7-4ab9-b4a0-32720b4a88d2","resolution":{"observed_at":"2026-08-07T19:25:33.561008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T19:25:33.563017Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.563017Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:643928017c51debbd1cd05f87b013beaca4c6dbcfeec548df735db43effd1735","observation_id":"297f2d1e-da8b-4638-b695-69ba721e6a0f","resolution":{"observed_at":"2026-08-07T19:25:33.563017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.615672Z","title":null,"venue":null,"work_id":"7e05a123-ac87-4de6-97f5-ebb07f2081dd","year":2020},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.565233Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:2c08a8a0b93a50a062e2fbd766b185520ae1964b96da60ef8cb16811e4eb009e","observation_id":"356d3a29-415a-4cae-9964-88aa365277f8","resolution":{"observed_at":"2026-08-07T19:25:36.618649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.573506Z","title":null,"venue":null,"work_id":"eb5a66ab-6fa1-42ea-9694-42f6d438ddd3","year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.567271Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:3c0e79e8157b011c186a039baf9bf0059c0450d8633d9d8a29934779c696f214","observation_id":"fc3b6aad-8349-4a50-87b1-af01ccf63581","resolution":{"observed_at":"2026-08-07T19:25:36.608367Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-07T19:25:33.571035Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.571035Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:35bf67ac6ae7e515bdf549ce42be4d315f860f73fefb8e864e676bac03691bc0","observation_id":"1b8b2a03-0263-4cb5-b24a-ae85641934f7","resolution":{"observed_at":"2026-08-07T19:25:33.571035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.573774Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.573774Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:25c615680d692883b38e4ca109451ed1313867081a2831b67186068e0d3e4bf4","observation_id":"b88151a1-b97c-4b55-a260-a80db9015d8c","resolution":{"observed_at":"2026-08-07T19:25:33.573774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.600147Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.600147Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:68a5e13ae55ad8101be100c81a272be6186ade129c9b9528f7807e62ee17ab24","observation_id":"37bac9dd-a9f8-4328-8d56-85e15024eb0b","resolution":{"observed_at":"2026-08-07T19:25:33.600147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.474715Z","title":null,"venue":null,"work_id":"5bb922a3-f606-41f0-8a92-492428f216bc","year":2017},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.643128Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:2a8baada1d3574f954f4bf40628c279f2a94b47527af99e82c2b203593a6c3df","observation_id":"10ae4e38-cd6e-4dd1-8912-09ab99250d46","resolution":{"observed_at":"2026-08-07T19:25:36.508136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.453380Z","title":null,"venue":null,"work_id":"73dfa9b6-4109-49cc-9796-3f47093fce4e","year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.688662Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:19941134c06fbe3d90a095d9bfb1eadb3b8b4f6458cc5a2ac094bae4416d3ac5","observation_id":"eebad87a-65f0-4c97-9cce-6994cf948e47","resolution":{"observed_at":"2026-08-07T19:25:36.455961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.2306","last_updated":"2015-04-14T05:02:53Z","snapshot_observed_at":"2026-07-06T04:02:50.341299Z","submitted_at":"2014-12-07T02:36:07Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.2306","snapshot_observed_at":"2026-08-07T19:25:33.733124Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.733124Z"},"links":{"cited_paper":"/paper/1412.2306","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:22dc0993935a7fcd670fa9c3ebd3156248f049a7086bc772c2f47d4e6caad6a7","observation_id":"d3bfd178-f4f1-45f5-a395-fe248973285e","resolution":{"observed_at":"2026-08-07T19:25:33.733124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T19:25:33.735909Z","title":"Berg, Wan-Yen Lo, Piotr Doll \\'a r, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.735909Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:d02eff3c4fbb8ea57cd9438ac5b9184443003ce9c8026308b9f2abadac57b7d6","observation_id":"6acf5f46-57b2-4339-8a15-6a1a8ae77bcc","resolution":{"observed_at":"2026-08-07T19:25:33.735909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T19:25:33.738830Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.738830Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:ebe82e33fa93d923d7b01a2edba30215c4ed42b06c4c8674323ce77657fcf839","observation_id":"369cfa1f-97d8-4594-8695-4591ba373fa2","resolution":{"observed_at":"2026-08-07T19:25:33.738830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.444843Z","title":null,"venue":null,"work_id":"76b631c3-c91f-4fd9-b69d-9ddfd0901c02","year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.741656Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:76a6e3b84765568eb82aa77ed347098e45bb10e42cb4d524762dace7cdab3f59","observation_id":"8bb2c361-3005-4458-8d2b-541ee3e13221","resolution":{"observed_at":"2026-08-07T19:25:36.447323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T19:25:33.743835Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.743835Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:d08e05f1520144e5d4235f98a2b2e298736c1459294471e196f8283dcfffee16","observation_id":"75f5a4ab-e5bf-4ba6-bc12-dcd437da3911","resolution":{"observed_at":"2026-08-07T19:25:33.743835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.746467Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.746467Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:3922c8d2f99abcdc114cdc2df6f471c1c9d8ca5e2460cf2c6ec70a862e50016a","observation_id":"a46dd69c-556e-4fed-873c-8af11153a27b","resolution":{"observed_at":"2026-08-07T19:25:33.746467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.748964Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.748964Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:6e2f931b87cf24b5ee6b057e541518d8cec7964430e1162a309c30c27a560510","observation_id":"a24937ca-3364-4c5c-8693-3919c47071df","resolution":{"observed_at":"2026-08-07T19:25:33.748964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-07T19:25:33.751527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.751527Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:f3444e222676ba0b11cd8d66c099cbe60acc21fd2d87a8338d5ea77ad30f20d9","observation_id":"c09a4593-00e2-4dac-b352-4eecbd225704","resolution":{"observed_at":"2026-08-07T19:25:33.751527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-07T19:25:33.755439Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.755439Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:1f5bb5c83195ea505c054f407c1c3cf5fbb7d005549bf8480532b5ea6786230e","observation_id":"feb52e77-1deb-4607-a59e-17c9a537b68e","resolution":{"observed_at":"2026-08-07T19:25:33.755439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T19:25:33.758153Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.758153Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:5c8fce978c1645404a1621b958e62bfc774d885c2341ed2aff61f5dbe08fe122","observation_id":"528f547a-d821-48c4-9278-e06e549a2085","resolution":{"observed_at":"2026-08-07T19:25:33.758153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:35.140132Z","title":null,"venue":null,"work_id":"0742bd89-fa70-4991-bd1b-c7e0978c0bab","year":2002},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.760819Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:d66c3f6d144e14ff79001928535f4ac89c11dce3d7c02a5f9f2641479fcbbab9","observation_id":"e80cb94f-3b78-4a08-bd7f-39891c3638e9","resolution":{"observed_at":"2026-08-07T19:25:35.142995Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.426513Z","title":null,"venue":null,"work_id":"a296e672-90f8-407f-81f3-26c59dc61616","year":2002},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.763402Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:e71a438fe70def7bf2be66b19238178b25f7d3f0d372083ec9a6899272ac9997","observation_id":"b5670a7e-712e-4597-98db-04edb6111371","resolution":{"observed_at":"2026-08-07T19:25:36.429202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T19:25:33.765645Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.765645Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:b8377932c7344bace8f897ddc441ab5ad7c99222faa93fe2cf49a1ce07c5eefa","observation_id":"5df3fd44-4336-4518-9405-280f2a01160e","resolution":{"observed_at":"2026-08-07T19:25:33.765645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.418121Z","title":null,"venue":null,"work_id":"019e1d06-6080-4c31-bada-88e0cdf45ed3","year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.768481Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:045ce761ec92913cabf53553af39bb2a1f6728b30d30d930e517626499f5006a","observation_id":"07609803-4d61-43c8-90c5-f361244f5b34","resolution":{"observed_at":"2026-08-07T19:25:36.420976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.770836Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.770836Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:ef13f4709dc6c1c5c4e468bb5c0417e200169543e79bc777fe50bc41cdc1f4df","observation_id":"8268ccd1-be71-4350-8947-82995259f222","resolution":{"observed_at":"2026-08-07T19:25:33.770836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:33.793991Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.793991Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:abd02bcfbee45046945751d087721c205e29ae377b3a191ea736a8d25a7faeeb","observation_id":"e1c51927-f55f-4e1f-911e-0097e06858c9","resolution":{"observed_at":"2026-08-07T19:25:33.793991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.397898Z","title":null,"venue":null,"work_id":"ebc479b4-ba3d-4bb7-aaf6-95737ab87139","year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.862989Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:9d0a9c9e450108bae44da5280fa28e059907dbcf3bc23ad5c88640c471547309","observation_id":"be7d2470-657b-4429-8653-d9063826bf52","resolution":{"observed_at":"2026-08-07T19:25:36.400864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02352","last_updated":"2024-06-09T23:21:28Z","snapshot_observed_at":"2026-07-31T18:19:30.018367Z","submitted_at":"2024-02-04T05:33:04Z","title":"Region-Based Representations Revisited","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02352","snapshot_observed_at":"2026-08-07T19:25:33.927715Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.927715Z"},"links":{"cited_paper":"/paper/2402.02352","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:30edd4d21874ef3b90180ce6023640542cbd14f9180840efd681ab9f653d4e26","observation_id":"f787e2bd-561d-4e00-bb72-4b731a4ccdd7","resolution":{"observed_at":"2026-08-07T19:25:33.927715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.390054Z","title":null,"venue":null,"work_id":"ae8c696c-16c2-4514-a926-2aa7d163db5f","year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.008077Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:dbf9da6007cb665c85faaafafb961840fad61a3fb530ec285123b4afb9c28bc3","observation_id":"b2848dbf-99b4-4358-b20c-bc11c9dcc05e","resolution":{"observed_at":"2026-08-07T19:25:36.392912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.73","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.272610Z","title":null,"venue":null,"work_id":"2f22d693-c370-4124-be68-6ddd647f0a04","year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.097981Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:70a1e66ef297a3c101ef616677c02a8429dff52667ea06b6f3bd216931773d87","observation_id":"3e1e3af0-029b-4ddc-b072-30ea64e61c69","resolution":{"observed_at":"2026-08-07T19:25:34.361129Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.381644Z","title":null,"venue":null,"work_id":"e911f936-98ff-408d-8337-ed5722efc552","year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.100881Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:b96ad5eebe128e49e06714bf11ba62087ae812fded1cdb428a3aff588f821f1f","observation_id":"3aa21bf0-f8fa-4baf-bbf0-3d46e6416063","resolution":{"observed_at":"2026-08-07T19:25:36.384468Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T19:25:34.104244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.104244Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:6489905af1209dd38636d26475d53b4ebe735476d04dd9666d0fa281b0531c07","observation_id":"0f730e41-8b35-4ba1-9fc0-faf4c69f620e","resolution":{"observed_at":"2026-08-07T19:25:34.104244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.991425Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"5273db9b-b6f8-4539-a63b-0c029f207d95","year":2015},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.107280Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:8d8844ed5ddc0b9824a7d8fbe28aea8abe64761a1800bf0b8b7dd67b00d60a7e","observation_id":"2af9d7b3-3266-4995-9dae-25c944e658cd","resolution":{"observed_at":"2026-08-07T19:25:35.052311Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17455","last_updated":"2026-06-26T13:24:26Z","snapshot_observed_at":"2026-08-06T14:45:09.380269Z","submitted_at":"2025-07-23T12:23:03Z","title":"VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization","version":2},"cited_work":{"arxiv_id":"2507.17455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.17455","snapshot_observed_at":"2026-08-07T19:25:34.432542Z","title":"VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization","venue":"cs.CV","work_id":"c19e5fc8-7293-40f2-bf87-2fda0acd361c","year":2025},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.110391Z"},"links":{"cited_paper":"/paper/2507.17455","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:842aea499f2c8f6933e1088fd2966ceb1b503e6db7e7433b49d242e69920daae","observation_id":"7e40051d-73db-49ab-85c2-0c201e70e767","resolution":{"observed_at":"2026-08-07T19:25:34.436452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-07T19:25:34.115740Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.115740Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:9b2dc0a43ecb8cee8b0ed19a64def27f88c1a914f7542566dd1661bb5fbf1c1c","observation_id":"a25a8aca-fde3-460c-b13d-81105354d563","resolution":{"observed_at":"2026-08-07T19:25:34.115740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00936","last_updated":"2025-03-02T15:19:37Z","snapshot_observed_at":"2026-08-07T17:35:45.126755Z","submitted_at":"2025-03-02T15:19:37Z","title":"IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00936","snapshot_observed_at":"2026-08-07T19:25:34.118310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.118310Z"},"links":{"cited_paper":"/paper/2503.00936","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:c19a73d43d0062ca6658758965049d7fe9776f16c7fcd306c602506882b0f002","observation_id":"49ec7240-df3b-4bb1-8dd1-a937a6de4628","resolution":{"observed_at":"2026-08-07T19:25:34.118310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.374167Z","title":null,"venue":null,"work_id":"f740148d-eea1-480e-b47e-faddc69512d0","year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.121604Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:575cc212e6687bbebd491ae4afe73f879f17ecfa7dae043941f5b3cfc827f8dc","observation_id":"cda4f9a6-c3cf-4a10-b7a3-41b6ee086779","resolution":{"observed_at":"2026-08-07T19:25:36.376837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.304324Z","title":null,"venue":null,"work_id":"b603d783-db0a-4c32-9c4e-c6e27d7fef80","year":2019},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.124819Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:74e8b3c125ab4252a114ea587b18a51b46a6817a54c4f04cf737b0c9e794c9a2","observation_id":"c8a2732f-834f-4ce7-87e6-62176b59c44e","resolution":{"observed_at":"2026-08-07T19:25:36.368847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.127360Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.127360Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:470d5ecbdca26ae34c90bda23fa0920fe21a179dde45a76064a761683d537afd","observation_id":"380885f3-627d-4531-8c11-56976c7eec7d","resolution":{"observed_at":"2026-08-07T19:25:34.127360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.215204Z","title":null,"venue":null,"work_id":"dea78ceb-77fe-4ab9-ad3d-10d572593f6d","year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.129831Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:d72e2b05058654c0160374cf19e852e0f2b900c47e083e8da8c075626a629545","observation_id":"5becfe5a-5548-4f17-9059-da5ceb6a5187","resolution":{"observed_at":"2026-08-07T19:25:36.239756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.132536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.132536Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:d2660121ba4398030efebe5310767a3355fb3c64fa0a509ab8c85dc7e28efb58","observation_id":"186c3f45-4abc-4c03-84af-02a6f49c3e71","resolution":{"observed_at":"2026-08-07T19:25:34.132536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:36.115504Z","title":null,"venue":null,"work_id":"b8a433fc-dddf-45ef-8182-227094797348","year":2021},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.135309Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:80b81407642b307fba09c62b4a64008d1705565dd5e352beb41312219f6f910a","observation_id":"4e509519-c6f2-47c8-9de8-58d26913cfe7","resolution":{"observed_at":"2026-08-07T19:25:36.163409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-07T19:25:34.137933Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.137933Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:d28a8dcbcd0ff9f901d7f46ae85f04a6caf94f6a970912671f1e5cd80a789954","observation_id":"2bdffec3-0cb7-4d07-9319-158402647dbe","resolution":{"observed_at":"2026-08-07T19:25:34.137933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.141267Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.141267Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:661ad0b8a8840d47007a813e6d9c54da3f30e49f7bacf0cea04071e34854d6ec","observation_id":"19e07378-850f-489b-b150-65ede70d64fb","resolution":{"observed_at":"2026-08-07T19:25:34.141267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T19:25:34.169118Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:34.169118Z"},"links":{"citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:f94ed9e7f8d4fcb07f2891d8ef6ceac328a3b7ddbcd649ce54fa63b654b8912c","observation_id":"10d524db-26c9-4d86-9de4-7c9b9cb80c01","resolution":{"observed_at":"2026-08-07T19:25:34.169118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:16:59.528949Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2502.10118."}