{"as_of":"2026-08-08T21:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7cbe11a6e47b8898ef3e3b8ae836638a2aaa47e2179d627ede57707f085e3003","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:13:47.973601Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.03542/citation-record","integrity":"/paper/2507.03542/integrity","json":"/paper/2507.03542/citation-record.json","paper":"/paper/2507.03542"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.842861Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning,","venue":null,"work_id":"38d08b4b-62fc-4815-b3a1-51626a8f7fde","year":null},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:44.886696Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:1319edefd5c15e9c74917d2c05122d9fc5721e323ee64bd76d1804706bd406c9","observation_id":"514e91e1-0e31-4f17-ae39-97a34219086b","resolution":{"observed_at":"2026-08-06T20:13:51.909807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.688298Z","title":"Vision-language models do not understand negation, 2025","venue":null,"work_id":"4f3bead6-7686-47f0-bc35-313008529d43","year":2025},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.066252Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:2f6305246b064cbc51060bf1e7675f8f6ab5cb66e7a6a16d9fe055bfb17a2714","observation_id":"b2230a53-3e9d-4ba8-86b6-b639a7ca850b","resolution":{"observed_at":"2026-08-06T20:13:51.715376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10376","last_updated":"2024-11-04T17:28:54Z","snapshot_observed_at":"2026-08-08T08:33:23.095535Z","submitted_at":"2024-02-16T00:04:36Z","title":"Interpreting CLIP with Sparse Linear Concept Embeddings (SpLiCE)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10376","snapshot_observed_at":"2026-08-06T20:13:45.126162Z","title":"Calmon, and Himabindu Lakkaraju","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.126162Z"},"links":{"cited_paper":"/paper/2402.10376","citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:57de4e2e0f1ef2b5d60c53597ebe14504ac4ab0e63e50f4057bcae111af10c38","observation_id":"d092a9c8-e782-4bf8-9063-2ac28c24e2ce","resolution":{"observed_at":"2026-08-06T20:13:45.126162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.629268Z","title":"Evolving interpretable visual classifiers with large language models","venue":null,"work_id":"c3f34c95-61e6-418d-a75e-58e3e45d2a72","year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.211704Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:8786d48d462a111ce9b9dab5a57a7998d9a770ff30f30bbde1edcb9adaa84e83","observation_id":"320ef00d-9715-47d0-be98-97bb7e4d2b81","resolution":{"observed_at":"2026-08-06T20:13:51.657578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.574156Z","title":"The platonic representation hypothesis, 2024","venue":null,"work_id":"dc1a1fe3-d029-4ab5-ab04-3410f08ac61b","year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.304699Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:d72386c68337372e898d968b3d13ddb351a1a330266550b87eeca971aceae708","observation_id":"8c94f42e-3714-46a5-b39f-d5ff3fe20e6c","resolution":{"observed_at":"2026-08-06T20:13:51.594457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:45.396579Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.396579Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:a8cf3a30ecdc36fc94396aa8b0cb6bfe1c94ad8ad41f76bf9bb149b3f42a532b","observation_id":"4d74d4bf-483a-4ca9-9d77-c693da85ec94","resolution":{"observed_at":"2026-08-06T20:13:45.396579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19785","last_updated":"2023-10-30T17:50:15Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-30T17:50:15Z","title":"What's \"up\" with vision-language models? Investigating their struggle with spatial reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19785","snapshot_observed_at":"2026-08-06T20:13:45.458422Z","title":"What’s ”up” with vision-language models? Investigating their strug- gle with spatial reasoning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.458422Z"},"links":{"cited_paper":"/paper/2310.19785","citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:e850540676824233bddee2659824bf1c59546d91997b80c507210a5b927d94a9","observation_id":"d82a0fa9-6153-4417-9d18-8c851062505e","resolution":{"observed_at":"2026-08-06T20:13:45.458422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.511567Z","title":"Large language models struggle to learn long-tail knowledge, 2023","venue":null,"work_id":"47882cee-2441-4db4-b4b7-588f1e6a9d3d","year":2023},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.556686Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:4f03ff16dc5ae0c02757086f26686546fb49716441d976a62bbe90e0d99e06c6","observation_id":"12f6097e-142c-47d1-b06c-549592b1a386","resolution":{"observed_at":"2026-08-06T20:13:51.538319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.469899Z","title":"Cifar- 100 (canadian institute for advanced research)","venue":null,"work_id":"b59d573c-27bd-4a46-93a9-5491efa1a96b","year":2009},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.616748Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:1cff04844d363a76d46fb67a02eebfbe319bea4b7a9a56229bf97c518c3a4883","observation_id":"e4a5d569-e6ae-401d-93b7-87eec66b9952","resolution":{"observed_at":"2026-08-06T20:13:51.485661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:45.629794Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.629794Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:4d42363325a0c5c27a0068666c509ed8c20b8d840db70984f2a26e137cb42784","observation_id":"ae75167e-f446-46e0-a689-3ca8eba802ac","resolution":{"observed_at":"2026-08-06T20:13:45.629794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:45.654032Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.654032Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:42c1e31503800f624d55fc17164fa7c12a6e8987af9cf49d212f43f45376d1f8","observation_id":"8910940d-96a0-4bda-be08-75a09dfa55d2","resolution":{"observed_at":"2026-08-06T20:13:45.654032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:45.841570Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.841570Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:80ec88adcc7f1f1d17af4483e532c1dd3ae6eabe038496dd3db23bf0299ce962","observation_id":"cffcfc55-cc6d-4671-93b8-a982536abc0a","resolution":{"observed_at":"2026-08-06T20:13:45.841570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.417179Z","title":"Visual classification via description from large language models, 2022","venue":null,"work_id":"455da470-e991-4085-933d-9687f3602fb2","year":2022},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:45.945125Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:a4705015eda2378f4019054ebd18643e04b7bee12fa1a61f2975826c89bf27be","observation_id":"e51f2db3-70d4-4c48-a252-12925c062df8","resolution":{"observed_at":"2026-08-06T20:13:51.435605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.401486Z","title":"Visual Classification via Description from Large Language Models","venue":null,"work_id":"fd8011fe-7dbd-4cdf-9b2e-fef01f0ba30d","year":2022},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.106812Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:c8d0531e0a054399439c90aa303efad0004d0b8e45e9ee1416b25a529e938b12","observation_id":"c50dfedd-ed59-455a-b089-498faed52d00","resolution":{"observed_at":"2026-08-06T20:13:51.412046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:46.234593Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.234593Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:262db4e1c19df4f98a920150e772f405dc2c6a9a6f7db4d4f9436aeec27e4bfb","observation_id":"56026ccf-c83c-4f76-8e27-db45f747e6e7","resolution":{"observed_at":"2026-08-06T20:13:46.234593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:46.420003Z","title":"Dinov2: Learning robust visual features with- out supervision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.420003Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:844e05cca49432be09f7c7b233437fc9480e4c22cda701d6b0a22fb47b25fb3b","observation_id":"d5a8d458-3ca0-4235-a84f-6e78a3ee3794","resolution":{"observed_at":"2026-08-06T20:13:46.420003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T20:13:46.524666Z","title":"Learning Transferable Visual Models From Natural Language Supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.524666Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:0e373330cd4ec263a5e170fbdf34ca0aba76b6a6fa9d5586a86ef871b5a43e93","observation_id":"58fbfcf4-8fab-4580-9678-2f8346bafff2","resolution":{"observed_at":"2026-08-06T20:13:46.524666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:51.199710Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5532642a-6241-4a6b-b4ad-bedcf53540ee","year":2021},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.571481Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:a57afe1b5c956a7172cb27f5338d5ded5bf37af537001adf358b78928a5aab7c","observation_id":"9c9fdb4a-06e6-4ba2-8ebd-64d9158315fe","resolution":{"observed_at":"2026-08-06T20:13:51.306332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:50.947433Z","title":"Sophia Koepke, Oriol Vinyals, Cordelia Schmid, and Zeynep Akata","venue":null,"work_id":"d27da55e-a81a-449b-a185-6cf9ceba8f7a","year":2023},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.636919Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:f7e70e5c2001bc40f898e100bc5a3b8ae2ca0e834beb1e09664f75eae70a8818","observation_id":"f61589dd-d120-4037-aa20-442ae9ede13b","resolution":{"observed_at":"2026-08-06T20:13:51.056043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:50.754142Z","title":"Sun, and Swarat Chaudhuri","venue":null,"work_id":"b1096f33-36ed-46bc-a32f-b9b0a14431b3","year":2025},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.835514Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:89601017617f488bd8a72c2d8e7bddb3d210141ad7ccb837b7f830d5fa71a77f","observation_id":"a567c6e1-e12f-4ac8-880e-9a6f36b24095","resolution":{"observed_at":"2026-08-06T20:13:50.849513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:50.553750Z","title":"Love, Christo- pher J","venue":null,"work_id":"b0f66ff3-a469-47c4-a013-2236f80776ff","year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:46.965074Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:bb98c640b42965c067a9240b52ef27ffbbe2b5268bb3185c05fd52df8c4fd7a4","observation_id":"faf6d0b9-3eef-4c57-b727-a935747683a1","resolution":{"observed_at":"2026-08-06T20:13:50.657671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:50.352603Z","title":"Understanding the emergence of multimodal representation alignment, 2025","venue":null,"work_id":"5f48949d-29e3-499d-9537-3440dd03c225","year":2025},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.109632Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:d2b192cc7102ef7128f9a3cbf0877b8d62bc102cd3803cda880fc16b3f735709","observation_id":"335682cf-102e-4107-8b7d-25d1d37a5bdc","resolution":{"observed_at":"2026-08-06T20:13:50.400989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:50.069554Z","title":"Eyes Wide Shut? Exploring the Vi- sual Shortcomings of Multimodal LLMs","venue":null,"work_id":"66631493-85a7-47d9-8a0c-526ca8286f2d","year":2024},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.212467Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:72f0fd754d5ad9383d9d8e06ebe26c5ec76d0af3f08a539f0e2697a12c82e9f3","observation_id":"98ee8c2b-cd79-4be2-852d-65a645b5068b","resolution":{"observed_at":"2026-08-06T20:13:50.239394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:49.715034Z","title":"Building a bird recognition app and large scale dataset with citizen scientists: The fine print in fine-grained dataset collection","venue":null,"work_id":"6846d75b-cfab-4e06-a663-9c99628b8ee6","year":2015},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.298571Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:cb3802c56c9ae96538234d608d711eb9f36a4c738fdf40068784df77a14fa4fa","observation_id":"6835cae2-5dcb-4d53-9c6f-1e658f69a0ca","resolution":{"observed_at":"2026-08-06T20:13:49.923528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:49.446299Z","title":null,"venue":null,"work_id":"a928684e-c6ba-42ce-ae7e-d232ce8eaab7","year":2011},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.470192Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:87e09148293b05e0b0d0d2bda3fc95fbfd92e18bbfbd21aeafcc513bf9b9099e","observation_id":"f318744b-75a4-477c-9b73-e1fdda7efc10","resolution":{"observed_at":"2026-08-06T20:13:49.601688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03685","last_updated":"2023-08-07T16:00:22Z","snapshot_observed_at":"2026-07-06T16:03:30.529010Z","submitted_at":"2023-08-07T16:00:22Z","title":"Learning Concise and Descriptive Attributes for Visual Recognition","version":1},"cited_work":{"arxiv_id":"2308.03685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.03685","snapshot_observed_at":"2026-08-06T20:13:48.143948Z","title":"Learning Concise and Descriptive Attributes for Visual Recognition","venue":"cs.CV","work_id":"4f502f26-0f8c-48b2-ad37-b364265213b2","year":2023},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.524543Z"},"links":{"cited_paper":"/paper/2308.03685","citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:30e90b52e75489952cccf51bcdff6365a1430fe8ae24c1adb251e5c574dc4aca","observation_id":"044a7e41-72bb-41ee-9e8f-f053afa823bf","resolution":{"observed_at":"2026-08-06T20:13:48.328678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:47.625348Z","title":"Learning concise and descriptive attributes for visual recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.625348Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:688a56b0a1041af76725b128da275accd582a162b7ab54268cb07bf5b914ec0e","observation_id":"40433328-06c2-4aa4-8d6f-d9e4f40a3787","resolution":{"observed_at":"2026-08-06T20:13:47.625348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:49.117880Z","title":"Language in a bottle: Language model guided concept bottlenecks for in- terpretable image classification, 2023","venue":null,"work_id":"7bcef674-4b24-4ed0-b0d3-f1cfebf0d22b","year":2023},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.722998Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:a76c0f830c404417d38bf65c0aa4c9423e5a5b30d4cc16ed0d69d905cd5d5ac7","observation_id":"2511dd34-242d-489f-a07b-a6243ef53d17","resolution":{"observed_at":"2026-08-06T20:13:49.284244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:48.785645Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":"92d56831-83c4-4085-b4f3-8af70cb4b5bf","year":2022},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.871811Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:6328d191150b43013578579504e6c0b6167d6ea6d1162efc484e0c618c6a7423","observation_id":"d193fc5f-09a5-488c-9559-38c6f818b9a8","resolution":{"observed_at":"2026-08-06T20:13:48.982821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:13:48.501486Z","title":"laysan albatross, which is a","venue":null,"work_id":"8d1de5be-eb4e-4a79-9b17-b6bc2e1133f0","year":2022},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:47.973601Z"},"links":{"citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:4f26b071eeabf2b0046dafe4b8c06d8234f1857e3144fcf7426c1fb9f194b952","observation_id":"19274119-75c2-4d67-9c60-8d015a7e368e","resolution":{"observed_at":"2026-08-06T20:13:48.658859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T20:13:44.966493Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:13:44.966493Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.03542"},"observation_digest":"sha256:b4b6e7d93b1b9cf2c832846fa11a9b5c97acd6932c59f04a6b8c42b3bbf0379e","observation_id":"0bdd19ee-a710-47ff-b531-5ce9f118ab5d","resolution":{"observed_at":"2026-08-06T20:13:44.966493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.03542","last_updated":"2025-07-09T03:01:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:04:52.172903Z","submitted_at":"2025-07-04T12:50:04Z","title":"Beyond Accuracy: Metrics that Uncover What Makes a 'Good' Visual Descriptor"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2507.03542."}