{"as_of":"2026-08-23T12:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da395e4f3de9aef366a82fc7311d7434f6f7ff0eb2ac075a7ee993cf93c8cba7","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:02:33.204350Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03242/citation-record","integrity":"/paper/2505.03242/integrity","json":"/paper/2505.03242/citation-record.json","paper":"/paper/2505.03242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T00:02:33.011938Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.011938Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:dd8a2b0628581be6bfdc78444383b25890fc4731b8f2311b0d3f3388910e8fa5","observation_id":"0c3c98f7-a1d2-4e9d-a707-2f637b9a84b2","resolution":{"observed_at":"2026-08-16T00:02:33.011938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.952934Z","title":"Fashion product images (small), 2019","venue":null,"work_id":"f511e1d1-6ee9-4c24-9b31-b62702d92f3b","year":2019},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.018210Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:39f9da9e224080ddd494143c29a56d283378f2cf1859c4559df61a4c1f46351b","observation_id":"1130a012-6b04-4a0e-b790-8869522511f6","resolution":{"observed_at":"2026-08-16T00:02:33.957305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.938273Z","title":"Compositional learning of image-text query for image retrieval","venue":null,"work_id":"d6356fa2-2bcb-4388-9314-43dcca4d0b98","year":2021},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.022904Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:f70440c21ea6ffb85ee6e33d4731940e6445740bbd4fa9beb62ed00afe8110ce","observation_id":"50bee6d9-7a3c-41ab-aca5-b369a354f40d","resolution":{"observed_at":"2026-08-16T00:02:33.943015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.923611Z","title":"Effective conditioned and composed im- age retrieval combining clip-based features","venue":null,"work_id":"a24e1598-f5d3-4c2f-b412-510a3ce84bbb","year":2022},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.027612Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:01e9f62a2e4d4eb1a4441bcb8dfa8754dc311878a40a8d3010a0aaf25a5cfe2c","observation_id":"8aee5ede-c3aa-4363-8732-421ef2f74c86","resolution":{"observed_at":"2026-08-16T00:02:33.928127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.908827Z","title":"Concreteness ratings for 40 thousand generally known en- glish word lemmas","venue":null,"work_id":"95eda1f2-df3b-490a-a4fd-82cae9bd4951","year":2014},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.032117Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:7f3eea6bab351a7617f9dfffed63a7bc7a9b03dede1160597eb4ffbfe7c251df","observation_id":"0d88aab7-7541-46e7-b399-203b1865c234","resolution":{"observed_at":"2026-08-16T00:02:33.913521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.894186Z","title":"Openfash- ionclip: Vision-and-language contrastive learning with open- source fashion data","venue":null,"work_id":"d04b398a-a755-40eb-a1ba-29c9c5bafafd","year":2023},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.036422Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:eb748a3c556db096b302141dba887c83ccc11562205d481cce9ddba344bbd722","observation_id":"5fba8645-11ae-4967-a6cc-6a57971e6d0a","resolution":{"observed_at":"2026-08-16T00:02:33.898808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.879316Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"f71f87b1-70c1-4d69-8351-8a8ec9890f1d","year":2023},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.041454Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:fcaf4f1be7599b5cf5b52d053be55108f8c50c8a282cb5e1113f2750093c4192","observation_id":"337e550e-c887-4f49-9a42-8654823ef4f8","resolution":{"observed_at":"2026-08-16T00:02:33.884496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.864784Z","title":"Contrastive language and vi- sion learning of general fashion concepts","venue":null,"work_id":"7b804a39-6474-4b85-856a-b133f6bed38c","year":null},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.045877Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:69ee1149cdadbe764a1b4fefe8be15fe0a691bc0398fb8124b3dfb542c2bb915","observation_id":"0431e9b4-0571-40da-85bc-7d18572a29b2","resolution":{"observed_at":"2026-08-16T00:02:33.869532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.850451Z","title":"Style finder: Fine-grained clothing style detection and retrieval","venue":null,"work_id":"5e89110c-87b9-4b4a-9700-d5b4302a2592","year":2013},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.050148Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:37302db5b5d9558138f86bdd1d21e7abc5bba10165e60191bf91354f05dcf643","observation_id":"2faacbe2-f26e-446d-8e52-2b37b459ee0e","resolution":{"observed_at":"2026-08-16T00:02:33.855069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-16T00:02:33.054416Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.054416Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:ac02b7ec79e6d70456c67d3edb05f4b6936fc80f702da3316917da4d7740cc5d","observation_id":"d0d34711-bba8-4f6a-87a9-ae0859429f8c","resolution":{"observed_at":"2026-08-16T00:02:33.054416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T00:02:33.058679Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.058679Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:afadb3a66dba7df6a9c51fbe9ffbb4af3654230531d122440277bf1543decd3e","observation_id":"c3249b55-16dd-4104-939a-830e141103be","resolution":{"observed_at":"2026-08-16T00:02:33.058679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.834918Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"7837b4a1-6b1c-410d-91a0-88ff45907264","year":2024},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.063314Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:c13c4d2c335c8847df66ab2c5642ff664eec23c38aeb207e9362d874c37ae9d2","observation_id":"0b498e6e-1c3d-4c47-91a0-cd115027dfc9","resolution":{"observed_at":"2026-08-16T00:02:33.840254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.819889Z","title":"Fashionvlp: Vision language transformer for fashion re- trieval with feedback","venue":null,"work_id":"87153ad1-e768-40d9-b27c-23a26d3a3fd0","year":2022},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.067832Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:d4eddc433d2a5d7f5e10e5311aea202933ac698032b7db52db6d2cc6809a7c2e","observation_id":"f600fd3a-d9a6-45a9-8c34-bcd5a3a5469e","resolution":{"observed_at":"2026-08-16T00:02:33.824795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.804503Z","title":"Scott, and Serge Belongie","venue":null,"work_id":"dfc969ee-546c-4282-b248-78fb830f4a4e","year":2019},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.072286Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:1a5f0a4bb5bf141334ded30c68e3a836570dfd4fc93302340afbb37088da0ef6","observation_id":"249663be-8ec0-4874-9c23-d5aa3a20790d","resolution":{"observed_at":"2026-08-16T00:02:33.809323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.788879Z","title":"Huang, Xiao Zhang, Menglong Zhu, Yuan Li, Yang Zhao, and Larry S","venue":null,"work_id":"59296b2c-66ed-479e-bc78-f12ed12711ed","year":2017},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.076495Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:1df7dc48734c1e6c89d4ec5b8ae4182cba798aa22b2b027724eda034930e1861","observation_id":"df531b13-ec87-412a-b06b-0609cbe5beac","resolution":{"observed_at":"2026-08-16T00:02:33.793548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-16T00:02:33.080711Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.080711Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:32bd57b683b33bb04d969d6ed719b0f228918467457c64e62b35277227e2c117","observation_id":"9df7489e-d73a-47e5-b022-9302eb3d497e","resolution":{"observed_at":"2026-08-16T00:02:33.080711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.774626Z","title":"spacy: Industrial-strength natural lan- guage processing in python, 2020","venue":null,"work_id":"3eee95ae-1eec-4723-8795-cfdb08f7a174","year":2020},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.086130Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:b296cf1e81aece63d8d82676ad02939e42186b4fc548758afe643fdac843fbd7","observation_id":"92d27575-e7fc-4fae-8d1d-3faab532a7e0","resolution":{"observed_at":"2026-08-16T00:02:33.779144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.759659Z","title":"Feris, Qiang Chen, and Shuicheng Yan","venue":null,"work_id":"90ecabf4-adb5-4d41-bdaa-143426bb0d1e","year":2015},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.090493Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:892417a640c44bb2879ad9c720b65ab0fc9b89d1454b76a8d856d93fb27d1fb4","observation_id":"f95ba6e1-83c8-4947-9dc3-5da770efa273","resolution":{"observed_at":"2026-08-16T00:02:33.764540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.743631Z","title":"Multi-label fashion image classification with minimal human supervision","venue":null,"work_id":"6a5a9d29-9430-4fa5-8971-d835b17dca7a","year":2017},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.095115Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:3f85e05b81b3418d16a7e5e5bfb2e620c70f8c0ceb70600acdacb7704d140547","observation_id":"7416e206-8743-4af8-a246-13c1cffd0a1b","resolution":{"observed_at":"2026-08-16T00:02:33.748411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.728276Z","title":"Cross- domain image retrieval with attention modeling","venue":null,"work_id":"870f69d6-fe2f-451e-b76d-73e465833249","year":2017},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.099520Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:42b448cd79f6ffb0123ed3d1bd11027f5e7f06a9ffcdac1e6e1d344d12cf100c","observation_id":"4ee5b739-5acf-41c6-8172-e5e8ffce4e64","resolution":{"observed_at":"2026-08-16T00:02:33.733277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.711135Z","title":"Hadi Kiapour, Xufeng Han, Svetlana Lazebnik, Alexan- der C","venue":null,"work_id":"3dd21f98-b3d5-4f41-8fd8-cffe710b9d92","year":2015},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.103752Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:32bc75432e7a8a25fb3ec908b61dadcd1a0a0a8ec1ca3f7f1da9a065a8c0ae61","observation_id":"f32aadfb-536c-4cdb-a4d0-c6fda574d590","resolution":{"observed_at":"2026-08-16T00:02:33.717084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.692930Z","title":"Cosmo: Content-style modulation for image retrieval with text feed- back","venue":null,"work_id":"2be23933-b102-42fb-83b1-78d9f09cabb0","year":2021},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.107981Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:ceb0b3e426b5bdf6d0de744b1d3d5082651345f3192cace6b217bd939af69afd","observation_id":"a2bad5db-f6a6-4c8e-a584-3b9482b58c6b","resolution":{"observed_at":"2026-08-16T00:02:33.699369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.674496Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":"4b0e266e-e5f9-4ba9-9987-e81e75e2cbaf","year":2022},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.112226Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:1ab78c701159b77ab4aaea4a346781c2b904874cbbea597e4b9783581a088165","observation_id":"b4a03a62-29a0-477d-81cf-826b765be2bd","resolution":{"observed_at":"2026-08-16T00:02:33.680884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.656772Z","title":"Deepfashion: Powering robust clothes recog- nition and retrieval with rich annotations","venue":null,"work_id":"18eda0ea-bb1b-4c9f-a127-ec235426ced6","year":2016},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.116734Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:468edd18708b6859ea71000c06cb148565fd2291cac2a645fcdd8078894e2d9d","observation_id":"fad16657-c19b-440b-b7e9-baa648f0913d","resolution":{"observed_at":"2026-08-16T00:02:33.661965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.641061Z","title":"Matthews","venue":null,"work_id":"9cc88dd0-234b-49d7-b4d9-aac3660f8058","year":1975},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.121328Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:e6998326f0fa1fbf2c50b9e7ae58be97113361a6d8a0393871adea5cbed6b374","observation_id":"15350a28-6f30-478d-9799-db2f8bfe1af5","resolution":{"observed_at":"2026-08-16T00:02:33.646171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.624957Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"3cee817a-39c2-438a-98bf-42428189ca88","year":2021},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.125608Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:acc307851adccc1abb4c6ffd69b1d3630631b30d3e7bf66cdb9c5e8cc5fc4795","observation_id":"fc282812-771b-4be0-933b-93527640cd31","resolution":{"observed_at":"2026-08-16T00:02:33.630334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08317","last_updated":"2018-07-30T16:12:32Z","snapshot_observed_at":"2026-08-14T19:00:53.415199Z","submitted_at":"2018-06-21T16:53:02Z","title":"Fashion-Gen: The Generative Fashion Dataset and Challenge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.08317","snapshot_observed_at":"2026-08-16T00:02:33.130036Z","title":"Fashion-gen: The generative fashion dataset and challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.130036Z"},"links":{"cited_paper":"/paper/1806.08317","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:5917bc4dbc6444ea5fc4c1a52d4db1557d9f03d3b090bef7d7679e9fbefa0fc1","observation_id":"77883fbb-2104-4932-9fc4-3d90c683db2c","resolution":{"observed_at":"2026-08-16T00:02:33.130036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-16T00:02:33.136073Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.136073Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:ce15b3f86b29eb750fda04b30c9e3d3cffceb545a1670db25bda5900bacec2f3","observation_id":"2609d7e3-60ec-46c3-ab51-61d4240b510d","resolution":{"observed_at":"2026-08-16T00:02:33.136073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1404.1100","last_updated":"2014-04-03T21:16:49Z","snapshot_observed_at":"2026-08-14T23:38:43.273043Z","submitted_at":"2014-04-03T21:16:49Z","title":"A Tutorial on Principal Component Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1404.1100","snapshot_observed_at":"2026-08-16T00:02:33.140679Z","title":"A tutorial on principal component analysis","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.140679Z"},"links":{"cited_paper":"/paper/1404.1100","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:fd687a7154515869722f9f4462d4af34cafd3de2eab8b04c43d106f71123b1cd","observation_id":"4cb6e6fd-02ba-495e-af9a-cf708361f448","resolution":{"observed_at":"2026-08-16T00:02:33.140679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.601659Z","title":"Neuroaesthetics in fashion: Mod- eling the perception of fashionability","venue":null,"work_id":"47b8fc55-1554-438b-834e-ba68b01ee330","year":2015},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.145361Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:ebd5e70d084b63f7e3e0bde3696a0fa292ac15769385fce44710affefcd826ab","observation_id":"eb9a49a2-2496-4219-bc2d-10efc81edfa8","resolution":{"observed_at":"2026-08-16T00:02:33.613030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-16T00:02:33.149592Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.149592Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:26b3cda485805d23c49f4d25b104409a3cc904da667c7bb035831011664dcacf","observation_id":"36c1c18d-518c-4834-be3d-a8254071c761","resolution":{"observed_at":"2026-08-16T00:02:33.149592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.537651Z","title":"What makes a style: Experimental analysis of fashion prediction","venue":null,"work_id":"d8ed56f6-a8e3-4f83-80ad-c212b97737de","year":2017},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.154179Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:a787eff96aba94a3e9629027b3939f67079399b4a52cafbbb8c425b7fc542089","observation_id":"ee2e54c3-10e0-4dbe-9ba2-a73ff3eb8300","resolution":{"observed_at":"2026-08-16T00:02:33.560644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.158480Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.158480Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:74dbc9f5727971776ff651ae27ae13c6d90cf32d9452208e606469fa168099bf","observation_id":"6f9c7cd0-b3c0-4d5b-819f-0894c1745cd0","resolution":{"observed_at":"2026-08-16T00:02:33.158480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.505023Z","title":"Vinson, Marco Tettamanti, Joseph T","venue":null,"work_id":"a0e29472-6a34-4c4e-9949-ea7404e54fd6","year":2014},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.162757Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:6893715575ce23d994aefe4cf1f37973c79c7627308c3aaf22bc3694e76467e0","observation_id":"b36767c4-1756-487c-89e7-e4c23e966099","resolution":{"observed_at":"2026-08-16T00:02:33.510470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T00:02:33.167290Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.167290Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:1d45c80890d6bf661c8af86196b126c6e71800b59fbbfc772d2a8f90f0fbae5c","observation_id":"71ca092f-60d1-463c-8b69-cea11389fa4d","resolution":{"observed_at":"2026-08-16T00:02:33.167290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.489217Z","title":"Clothes search in con- sumer photos via color matching and attribute learning","venue":null,"work_id":"b13a7517-10dc-45a7-8947-abf217007368","year":2011},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.172411Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:6bd8336e80d3ceead347c9663630fec1d184df50ad7339b8804f34ccba036d40","observation_id":"94290281-25d3-44c4-acf2-f030547900b2","resolution":{"observed_at":"2026-08-16T00:02:33.494805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.473510Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":"1c49dbe5-8fe8-4ede-913d-5a2b4bd82aa9","year":2021},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.176766Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:94e4572b522ada1fe0e396c0e95e38a43c6366effed0d768347bd13ea43f2283","observation_id":"5c5c8509-ec41-4fe9-bc3d-e749d0159308","resolution":{"observed_at":"2026-08-16T00:02:33.478362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.07747","last_updated":"2017-09-15T21:29:49Z","snapshot_observed_at":"2026-08-13T15:13:33.081929Z","submitted_at":"2017-08-25T14:01:29Z","title":"Fashion-MNIST: a Novel Image Dataset for Benchmarking Machine Learning Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.07747","snapshot_observed_at":"2026-08-16T00:02:33.181886Z","title":"Fashion- mnist: a novel image dataset for benchmarking machine learning algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.181886Z"},"links":{"cited_paper":"/paper/1708.07747","citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:f8f835d907d79074782bb4ef5781d79ccf0193a79c82edbc84720a86a4c62bb2","observation_id":"9c828452-ad37-4bf8-9d9d-6abac93f0066","resolution":{"observed_at":"2026-08-16T00:02:33.181886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.457103Z","title":"Fashion captioning: Towards generating accurate descrip- tions with semantic rewards","venue":null,"work_id":"88676e85-70a7-451b-8a35-5583db4464b1","year":2020},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.186359Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:21ef89210fc0600bc986b2a2f855488336990ccda299cb5305c5353f551897ee","observation_id":"e1350231-81c8-4e53-96f4-11b1d05ff49a","resolution":{"observed_at":"2026-08-16T00:02:33.462130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.440224Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"3728d29c-1b8e-47c0-8833-1074eaf37d8b","year":2023},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.190681Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:2ba3092db046b86e5ae8e5bebfb13a471e2f5e7c36f92037cebc9855c1f6f449","observation_id":"a5764240-858d-4821-a85d-cf14fa824389","resolution":{"observed_at":"2026-08-16T00:02:33.446319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.424247Z","title":"chic” and “street ready","venue":null,"work_id":"2fc8392f-6b64-4f16-b4f1-98b4591b165a","year":2021},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.194952Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:b80cb762e61be635cd5ba2af4d3e59b54b09b694be77bf1a80587884990c0456","observation_id":"72bfe066-24e8-43ae-a12e-2ff3e6b3e2ae","resolution":{"observed_at":"2026-08-16T00:02:33.429305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.407983Z","title":"adjective","venue":null,"work_id":"c483b72b-d936-4580-94c7-03b04b254e37","year":null},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.199797Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:3407264b3a5f5dced203704598ed6c6d2f6810fcac0c48e86fad3eca1b0cbd1a","observation_id":"85282655-cebe-439c-93c5-f757ed9367e9","resolution":{"observed_at":"2026-08-16T00:02:33.413730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:02:33.390505Z","title":"compound word","venue":null,"work_id":"01ce952a-95df-4dc5-bbea-cc4fc7755d85","year":null},"citing_paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:02:33.204350Z"},"links":{"citing_paper":"/paper/2505.03242"},"observation_digest":"sha256:e7f8d73257187987420a150499485a187102c7e144c10d05eaa4b738e68839af","observation_id":"4b95f207-1dc3-45ff-97c3-6179bdfaf0d1","resolution":{"observed_at":"2026-08-16T00:02:33.396384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03242","last_updated":"2025-05-06T07:14:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T20:23:11.948495Z","submitted_at":"2025-05-06T07:14:10Z","title":"Seeing the Abstract: Translating the Abstract Language for Vision Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2505.03242."}