{"as_of":"2026-08-14T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17317b83bb7b2aaa7eae40040702fe1063b1a9cb049bf98bf05161adf21269c7","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:45:00.726508Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18968/citation-record","integrity":"/paper/2411.18968/integrity","json":"/paper/2411.18968/citation-record.json","paper":"/paper/2411.18968"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.513070Z","title":null,"venue":null,"work_id":"7415f8e4-e826-42f7-8168-9d0ddf973219","year":2020},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.540595Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:b5c8183a6bb9cb82840c390889d1b81ca719820da978df6152d6d5ae3d3d578a","observation_id":"5f250c5a-b4e5-484c-8153-5b71c67f3e15","resolution":{"observed_at":"2026-08-12T10:45:01.518866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.495473Z","title":"Y.; Saligrama, V.; and Kalai, A","venue":null,"work_id":"d45fd13b-697c-4867-9779-c6c23a2e59de","year":2016},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.545913Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:535ee21613fbd39d8d96229d48bc4c65be6dfd13b47436dc107a5b6ec5d30245","observation_id":"d6f58225-9900-4006-91f1-23fb3bfc5d6d","resolution":{"observed_at":"2026-08-12T10:45:01.500954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.478704Z","title":"J.; and Narayanan, A","venue":null,"work_id":"e5d8a4cf-8122-4b39-bab8-0ce9322f7210","year":2017},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.550703Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:e10cffad4b5704361f3c2e852f8b5b79df4fcee9ea02797be4f0064b93dc963d","observation_id":"6c3ab90b-dfad-40b3-a9dd-017ffae4487c","resolution":{"observed_at":"2026-08-12T10:45:01.483683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.460404Z","title":null,"venue":null,"work_id":"546a6dce-8988-4ee8-9629-1e3ee6f25d5f","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.555536Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:6f23d33ac9dc4f8170a589077687f2cbdd34b861931157b6c72a24bd51e82f35","observation_id":"e931806d-d49b-4a02-888a-eddc1f6e9608","resolution":{"observed_at":"2026-08-12T10:45:01.465734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T10:45:00.560884Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.560884Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:cfb7f04480225ba44c1fcfcb33325e48fb7c1e809be07ee682be8f7c232a3a92","observation_id":"847c5018-8bd6-4068-b6d8-bcac460edb0b","resolution":{"observed_at":"2026-08-12T10:45:00.560884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.443277Z","title":null,"venue":null,"work_id":"a5adc93b-e6d5-47ab-a310-3237480028ef","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.566188Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:22b742580136d91b400909d18d9b099b5dfa2b2a6db72ec8d95d9ab17f52520e","observation_id":"eacdc16c-86a3-4135-bfba-bc5947006a89","resolution":{"observed_at":"2026-08-12T10:45:01.448203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.425666Z","title":null,"venue":null,"work_id":"c6115ba8-f557-4e0b-94b7-0421a257a1b3","year":2019},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.571346Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:0d236b93039e698093d36c7649e55dad734da3b82ae54a99155eb6530cab9a93","observation_id":"1e5121ea-7ad3-4e30-aeec-7e292ae2fd1d","resolution":{"observed_at":"2026-08-12T10:45:01.431381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.407411Z","title":null,"venue":null,"work_id":"bae6c8d1-3ab9-4d2c-a7c4-d2d436291f3c","year":2024},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.575863Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:49954c6770330261fa21dc0fad8fe5ad5506bcec07b8f70de93caaa01a1b3512","observation_id":"daa01dd6-4da1-44a5-b008-8f39afb1418f","resolution":{"observed_at":"2026-08-12T10:45:01.413985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.388392Z","title":null,"venue":null,"work_id":"53485687-0bf4-43d5-96fb-ea8e1f529fc8","year":2005},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.580420Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:46763b3983b78c35099e029e2b73a660b21c007cd8b57c3e5ce58a7dcbecab4f","observation_id":"74a5d835-4fcb-48e5-9e17-3557f14c8bd9","resolution":{"observed_at":"2026-08-12T10:45:01.394786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T10:45:00.585067Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.585067Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:05b162a3bc9472051a562e29645316c326293b791829ffac8b6bad50905bcedb","observation_id":"96090373-dd21-4312-9724-3a804634f87c","resolution":{"observed_at":"2026-08-12T10:45:00.585067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.371638Z","title":null,"venue":null,"work_id":"c743566b-cf1d-402b-b966-32798e9066ef","year":1997},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.589886Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:37aaf175e47db2894557b6696d7989426ba075422177f3d204881e69532028f4","observation_id":"f1be5705-ab65-4301-8b89-5f7566650f7a","resolution":{"observed_at":"2026-08-12T10:45:01.376181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.353159Z","title":null,"venue":null,"work_id":"14007b22-47a3-4d75-bdf9-a5d7b2d7f2a5","year":2022},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.594408Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:834a02af5978aef7a2359278ebe0b3211d8eb3f43743b6ebfe608f0b81c003a2","observation_id":"dccfab2a-2a0c-4ffe-a075-a4d011edcb95","resolution":{"observed_at":"2026-08-12T10:45:01.358332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.335376Z","title":null,"venue":null,"work_id":"77732141-39a4-4c84-a36d-0e92901d949f","year":2022},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.599981Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:915e561416392e134b4c8e9613e53e266254984ca4ce305e5a5acfbb8ef87cc7","observation_id":"10b09876-a852-42b5-afd1-76aed70f36d0","resolution":{"observed_at":"2026-08-12T10:45:01.340570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.316748Z","title":null,"venue":null,"work_id":"a3988c8a-ebea-449b-8995-654229f22361","year":2020},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.604574Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:b477813db9aa85a1ef453f28492cc479a90cc7a9e5d7e0a785529752248d2a63","observation_id":"4e2c7df7-d39f-494c-bef4-f3eae74c02ab","resolution":{"observed_at":"2026-08-12T10:45:01.322353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.297180Z","title":null,"venue":null,"work_id":"94b0477b-8a6c-40a7-a88e-ed4217f4e1af","year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.609199Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:5e67fd8a65a9e5375a83b8d4f80877f0f338f37fb131104aa35c5bd3a1ec24f2","observation_id":"fad728ff-f71b-4b49-a49d-718d0761b6b4","resolution":{"observed_at":"2026-08-12T10:45:01.302530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.613881Z","title":"W.; Wallach, H.; Iii, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.613881Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:9c03b5e823cfff1b347819d5132af4c9e50636229a8d357666de4122f82c7ef6","observation_id":"72135e13-5b2f-4baf-b96a-99fcc8ebb3c6","resolution":{"observed_at":"2026-08-12T10:45:00.613881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.267383Z","title":null,"venue":null,"work_id":"eefc1e2d-c4b3-401f-9ed1-4dcb00ef6934","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.618456Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:be5c0e72aabbe100a158f522e8745a76001fb53faeaec831777464650ff68251","observation_id":"130f47b6-4a61-44a2-8e7d-2d24d4fb8bf7","resolution":{"observed_at":"2026-08-12T10:45:01.273533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08940","last_updated":"2022-05-18T23:17:18Z","snapshot_observed_at":"2026-08-13T17:32:45.153550Z","submitted_at":"2021-11-17T07:09:59Z","title":"Transparent Human Evaluation for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08940","snapshot_observed_at":"2026-08-12T10:45:00.623203Z","title":"L.; Choi, Y.; and Smith, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.623203Z"},"links":{"cited_paper":"/paper/2111.08940","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:74006e1d3828db9446e5b0f87be68155fe0d6a240c327b2f55e8adb3964e1b66","observation_id":"be73e4ad-888e-4652-b601-fef8968d48e2","resolution":{"observed_at":"2026-08-12T10:45:00.623203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.627534Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.627534Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:c5de99fc42e713a75cf675dfcc9019c19fda745ac5bbc423cb70fa0661de62b0","observation_id":"0905eee0-4fbe-4e2c-bc13-4cf86b70d89d","resolution":{"observed_at":"2026-08-12T10:45:00.627534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11429","last_updated":"2021-11-22T18:59:15Z","snapshot_observed_at":"2026-08-13T17:29:31.654755Z","submitted_at":"2021-11-22T18:59:15Z","title":"Benchmarking Detection Transfer Learning with Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11429","snapshot_observed_at":"2026-08-12T10:45:00.631913Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.631913Z"},"links":{"cited_paper":"/paper/2111.11429","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:afec8b623fb52e67a3cf4dec037f3786f08675e1222b5214035695b79c674dd8","observation_id":"20b108e2-7e44-4e05-abee-833ed77af9d6","resolution":{"observed_at":"2026-08-12T10:45:00.631913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-12T10:45:00.637986Z","title":"J.; Bourdev, L","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.637986Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:87e65dff272f8dc21f5a33888e046f6b7d0135b706f95feda1e2f7a87e75892c","observation_id":"4a4f77cd-fe64-4a49-99a3-245ae888edc3","resolution":{"observed_at":"2026-08-12T10:45:00.637986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.234770Z","title":null,"venue":null,"work_id":"3029625d-4e32-4e04-89c9-969a764d9d65","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.642718Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:9565ce23b6ca640b55f6d9641ce7016d752d65adaa68988c9f1a083ad35bdc9d","observation_id":"407b8522-a92d-4ee8-bfef-e0452c84a5c7","resolution":{"observed_at":"2026-08-12T10:45:01.240070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.216609Z","title":null,"venue":null,"work_id":"b554313f-342e-4f97-8799-47f88afa66a9","year":2022},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.647196Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:11727a0cb830ee1dca71eff5727a15e5b3633aec99046b2107363f8dc6c48c2a","observation_id":"1bb3cdae-8ccc-4b04-a18d-25d1fccc8e2f","resolution":{"observed_at":"2026-08-12T10:45:01.222501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.198062Z","title":null,"venue":null,"work_id":"cacf0eb2-22f0-4d76-ade7-d412967bd0dc","year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.651491Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:f49f57f6c26445d82252876db15a461612f7b9310fca1adc2fd005f469809d51","observation_id":"6d4c1f6e-9977-4541-b1af-55493af59717","resolution":{"observed_at":"2026-08-12T10:45:01.203516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.176256Z","title":null,"venue":null,"work_id":"39dd5a3b-67fc-4069-b454-d340cac0f9b6","year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.655991Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:abf21bb5a31267cb438b4511bbcc923c8b25f780a28e56277ddad6f4448da916","observation_id":"2279ed85-f86a-421e-aae9-65da0d1e2615","resolution":{"observed_at":"2026-08-12T10:45:01.184221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.153593Z","title":null,"venue":null,"work_id":"70c19d66-22f5-45d7-b263-56dde4ab356c","year":2017},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.660575Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:d6752adc74e82d23f549266773b4fbfa7b92481bda784e9b8a991c329c5b176b","observation_id":"98c0defd-e295-497b-a5a9-d3927394bbdc","resolution":{"observed_at":"2026-08-12T10:45:01.159783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.129782Z","title":null,"venue":null,"work_id":"10cde5dc-a438-4796-81ed-1ea6947dc781","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.665233Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:94e2bcfe66848362c0a2c081966fec6357ac30f9c649e2c79d8cbff8c4500851","observation_id":"fc9215f1-928f-48ba-aeae-efa85721729b","resolution":{"observed_at":"2026-08-12T10:45:01.138775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.107042Z","title":"M.; Van Hulse, J.; and Napolitano, A","venue":null,"work_id":"555157e5-8796-4b27-9733-54be2807f854","year":2008},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.669734Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:ae163a4bd0297e100da76e0063877994f80874941ac470e8b8a3a35abf47821a","observation_id":"929daa29-e08d-4318-b48b-b2ad5f76f3d9","resolution":{"observed_at":"2026-08-12T10:45:01.115010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.080566Z","title":null,"venue":null,"work_id":"22ed6b2e-45e7-4b67-82f9-7260b97fc6e2","year":2022},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.674723Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:3ad1b70fde153d4029c515a4ae01345baa246b7c4217adc0af5304a72ce5db56","observation_id":"370aabbc-151a-433c-8887-dd78b30fb39e","resolution":{"observed_at":"2026-08-12T10:45:01.090926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.055672Z","title":null,"venue":null,"work_id":"961fb5ba-1782-4bdb-a33a-bc4fb73d839d","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.679634Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:279b32b786f4fee5037272c6843e69808a159bd32743f7a45389565618161c0f","observation_id":"e98f8692-cbc4-4481-b668-4285e78cea28","resolution":{"observed_at":"2026-08-12T10:45:01.066958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.037269Z","title":null,"venue":null,"work_id":"b2d1f0c0-131d-4fcb-ae9b-a4c4eab7c7bc","year":2020},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.684066Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:c0af11aaef209c48ec167a25d2de47250473d0020548f63fb88cdd858a7ebbd9","observation_id":"4815cda4-c9e8-4ff5-9380-cf781e4dbd21","resolution":{"observed_at":"2026-08-12T10:45:01.043309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.021020Z","title":"H.; and Hauska, H","venue":null,"work_id":"21c70435-67f8-4192-a191-ac2c2d7db1e7","year":1977},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.688616Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:bb3a4d5386c24ffa91d1cd7b0d7e14d78a4d56a98b7badf73434ee6d43fa079d","observation_id":"b28aeb45-686c-4b5a-82e7-e1bc61e89141","resolution":{"observed_at":"2026-08-12T10:45:01.026234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10621","last_updated":"2024-05-16T21:53:41Z","snapshot_observed_at":"2026-08-13T10:09:58.601090Z","submitted_at":"2023-09-19T13:55:39Z","title":"Large language models can accurately predict searcher preferences","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10621","snapshot_observed_at":"2026-08-12T10:45:00.693164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.693164Z"},"links":{"cited_paper":"/paper/2309.10621","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:d8f2e77771f89b66ee00b73593fb2c936c998d276d448edef18cdfe783678351","observation_id":"6bc4be8c-e6b4-411d-9a94-d35ead841299","resolution":{"observed_at":"2026-08-12T10:45:00.693164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:01.004147Z","title":null,"venue":null,"work_id":"7e23e1ef-f1ae-48da-91b6-b5c95ca2f3d1","year":2013},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.698061Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:d4066ecdb22b9a2ce09e44ba902626937890e442fe3f767639c81d058c0bceb8","observation_id":"0b72f8eb-cb68-43a6-92d7-ec0a5d33f3a7","resolution":{"observed_at":"2026-08-12T10:45:01.009661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.702843Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.702843Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:6e5dde82182fa2197532cf37e6e6bd7451768af717016b99689e412e7b393294","observation_id":"5709c3cf-2d02-41ee-a0ec-c543bf963868","resolution":{"observed_at":"2026-08-12T10:45:00.702843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.707251Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.707251Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:0e3147fca25bf794d83022a21e8a52483dbbb2482ac33b39b0fe1718a35a3c5d","observation_id":"68a05402-b684-4cd0-a881-7b919caed706","resolution":{"observed_at":"2026-08-12T10:45:00.707251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.975136Z","title":null,"venue":null,"work_id":"6f627723-fb5f-4102-bace-85024a63baa0","year":2023},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.711909Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:a6261f0bda1790257ecbcc91f205e8e47981a8498952e732c71a8ce18303b92a","observation_id":"89cc2fa3-756e-439f-9ab2-01ee55d6088b","resolution":{"observed_at":"2026-08-12T10:45:00.981220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07337","last_updated":"2021-01-18T21:45:35Z","snapshot_observed_at":"2026-08-13T20:28:50.241653Z","submitted_at":"2021-01-18T21:45:35Z","title":"Dissonance Between Human and Machine Understanding","version":1},"cited_work":{"arxiv_id":"2101.07337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.07337","snapshot_observed_at":"2026-08-12T10:45:00.763806Z","title":"Dissonance Between Human and Machine Understanding","venue":"cs.AI","work_id":"e1425ed2-993e-492f-bd64-f30a70e8c34d","year":2021},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.716514Z"},"links":{"cited_paper":"/paper/2101.07337","citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:049208ccfee5a01cc801f56fd4f79081c757b1847341b1e8564de1e841d20d19","observation_id":"9dab5f83-6bbc-43be-9bdb-1e371fe66325","resolution":{"observed_at":"2026-08-12T10:45:00.770709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.721331Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.721331Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:825c47d7b0d5cd0e87b73123b58eaa8f517be4f94683a898cfc1b850f43e9869","observation_id":"a62d2a18-bf29-4e42-9f91-1fa930928475","resolution":{"observed_at":"2026-08-12T10:45:00.721331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:45:00.726508Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T10:45:00.726508Z"},"links":{"citing_paper":"/paper/2411.18968"},"observation_digest":"sha256:45701a0c4016b7675845d2aeae9e35cf95be7492bb445f2b8546bae5cd07ad15","observation_id":"69c8589d-6d4a-4f64-b766-9b87caf94d04","resolution":{"observed_at":"2026-08-12T10:45:00.726508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18968","last_updated":"2025-04-27T12:16:50Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T08:52:57.543054Z","submitted_at":"2024-11-28T07:37:04Z","title":"Perception of Visual Content: Differences Between Humans and Foundation Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2411.18968."}