{"as_of":"2026-08-22T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71cbd4d3be73fd0e2994ecbd89b1052118164558c0c58d4807fa24cf4df150e9","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:12:47.356051Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:14.267530Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"cited_work":{"arxiv_id":"2411.15560","doi":"10.48550/arxiv.2411.15560","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2411.15560 , year=","venue":"arXiv (Cornell University)","work_id":"8a16ec55-fe29-4912-97d6-dfa13ad22096","year":null},"citing_paper":{"arxiv_id":"2606.00875","last_updated":"2026-05-30T20:15:01Z","snapshot_observed_at":"2026-08-22T10:15:23.963124Z","submitted_at":"2026-05-30T20:15:01Z","title":"IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T18:42:00.845492Z"},"links":{"cited_paper":"/paper/2411.15560","citing_paper":"/paper/2606.00875"},"observation_digest":"sha256:cd16e29b6eddae535e4ec2654d2d5b0fd2e1bfe514987433ef60b5953d452cc0","observation_id":"9d6f09da-0d48-4228-92aa-ef6c3687957a","resolution":{"observed_at":"2026-06-28T18:42:28.906500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"cited_work":{"arxiv_id":"2411.15560","doi":"10.48550/arxiv.2411.15560","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2411.15560 , year=","venue":"arXiv (Cornell University)","work_id":"8a16ec55-fe29-4912-97d6-dfa13ad22096","year":null},"citing_paper":{"arxiv_id":"2606.10113","last_updated":"2026-06-08T19:46:00Z","snapshot_observed_at":"2026-08-16T14:13:46.484120Z","submitted_at":"2026-06-08T19:46:00Z","title":"Emotion Profiling in LLM-Based Literary Translation: Systematic Shifts Across MT and Post-Editing","version":1},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-06-27T16:09:08.317910Z"},"links":{"cited_paper":"/paper/2411.15560","citing_paper":"/paper/2606.10113"},"observation_digest":"sha256:653b6704b82274b79e254e41b968f597186e42856fe53d64a7d9c1586a291ca9","observation_id":"357805c9-bb97-4965-b9a4-8816c8def933","resolution":{"observed_at":"2026-06-27T16:11:02.634587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15560","snapshot_observed_at":"2026-08-04T23:25:10.964532Z","title":"arXiv preprint arXiv:2411.15560 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01666","last_updated":"2026-08-04T03:10:26Z","snapshot_observed_at":"2026-08-18T08:49:11.621541Z","submitted_at":"2026-08-03T04:01:02Z","title":"Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T23:25:10.964532Z"},"links":{"cited_paper":"/paper/2411.15560","citing_paper":"/paper/2608.01666"},"observation_digest":"sha256:d7c69c3566805bfcf052d15e904257df491cbb9850cff421152d47c704a1e857","observation_id":"2eceef84-013f-4f55-86ea-927bd9b702ee","resolution":{"observed_at":"2026-08-04T23:25:10.964532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15560","snapshot_observed_at":"2026-08-07T00:15:14.267530Z","title":"arXiv preprint arXiv:2411.15560 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01666","last_updated":"2026-08-04T03:10:26Z","snapshot_observed_at":"2026-08-18T08:49:11.621541Z","submitted_at":"2026-08-03T04:01:02Z","title":"Style Wins, Substance Loses: A Diagnosis of LLM-as-Judge in Idea Generation","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:14.267530Z"},"links":{"cited_paper":"/paper/2411.15560","citing_paper":"/paper/2608.01666"},"observation_digest":"sha256:f083804ea9f0cb392c8434e280480c74b3f53d5e42e0b76e48fce3071d8fcdb0","observation_id":"72439531-ebbb-4c85-974d-677ff006b278","resolution":{"observed_at":"2026-08-07T00:15:14.267530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15560/citation-record","integrity":"/paper/2411.15560/integrity","json":"/paper/2411.15560/citation-record.json","paper":"/paper/2411.15560"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3758/s13428-023-02313-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.431552Z","title":"Automatic assessment of divergent thinking in chinese language with transdis: A transformer-based language model approach,","venue":null,"work_id":"ca012870-27d3-4188-8354-55aab9155000","year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.228821Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:4fd1c6d4a6e60b9ff7f52a8a41a40a81f0454e911530a8fc2f4610e27974e44b","observation_id":"75c829c6-0044-40c7-bdec-2f0bcffeed1e","resolution":{"observed_at":"2026-08-12T14:12:47.435480Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.962150Z","title":"Pushing gpt’s creativity to its limits: Alternative uses and torrance tests,","venue":null,"work_id":"1a6227f4-c23b-47bb-a5ba-bc8842effab8","year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.233264Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:299639ba11689f68b410a11ec3aadebfbae4570f0188bcd3b1e7ee4251dc23e0","observation_id":"8cc6f45c-2774-41d6-91ab-5b206faf6ec2","resolution":{"observed_at":"2026-08-12T14:12:47.965812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.950870Z","title":"Using large language models to evaluate alternative uses task flexibility score,","venue":null,"work_id":"1f873cc6-03ac-4555-970b-411184f8da9a","year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.236970Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:38f4ca6b8149095ac601aa462ed87782c3ec9c8eae8f8e0996e210ffd09ab313","observation_id":"1e51c20a-de39-45f6-99c7-1289685040b1","resolution":{"observed_at":"2026-08-12T14:12:47.954404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.940333Z","title":"A standardised procedure for evaluating creative systems: Computational creativity evaluation based on what it is to be creative,","venue":null,"work_id":"489ab8a6-74cc-4a35-9c0c-7a4cd9acc495","year":2012},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.241257Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:3847d39632f3e61b85c22d8d2edb8a145461fb324091c5eff8760e5faef9d708","observation_id":"00fe2030-f2fc-423f-813a-66e9524223f3","resolution":{"observed_at":"2026-08-12T14:12:47.943990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.929512Z","title":"Regent-dependent creativity: A domain independent metric for the assessment of creative artifacts,","venue":null,"work_id":"b2cef8de-dd11-4b56-b793-2c39cc2c7242","year":2016},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.245633Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:89e297a47ad1ce62d1d3666ab239d21a4add71014925fcf600c259e1fa41cb3f","observation_id":"24b88ab9-dc70-4e9a-bee3-3fe3d45e2f36","resolution":{"observed_at":"2026-08-12T14:12:47.933291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.249238Z","title":"Evaluating the evaluator: Measuring llms’ adherence to task evaluation instructions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.249238Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:55f28b907942259e90ddc0f6cafe3a79e03d707d266a1fe87504f5430bd1efa4","observation_id":"1efc66ca-4c0a-405a-acc0-04a1544dc09c","resolution":{"observed_at":"2026-08-12T14:12:47.249238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-12T14:12:47.253387Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.253387Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:ae3a4b5f4681719a064ce1797576f58b52f387632c92d234d8578ebad088edea","observation_id":"d1659070-dfad-443a-8251-cbc1f0d4f8d7","resolution":{"observed_at":"2026-08-12T14:12:47.253387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.257337Z","title":"Automatic scoring of metaphor creativity with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.257337Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:1956891c4d5eb33c920b50129bd69b2331782980e38ffb81994d1b5e2e6a7771","observation_id":"122f056b-62c3-48a4-8635-3c20c3f95908","resolution":{"observed_at":"2026-08-12T14:12:47.257337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.918782Z","title":"Is GPT-4 good enough to evaluate jokes?","venue":null,"work_id":"be9b7854-db57-46f3-997a-1e8438f84aee","year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.261071Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:b117653b016d01712c6048f4489c9cb193a8f6f5ce9a38102347cf6b597c2888","observation_id":"47614a52-3f45-40fa-8274-a475787ea1c2","resolution":{"observed_at":"2026-08-12T14:12:47.922625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.907984Z","title":"On the power of special-purpose GPT models to create and evaluate new poetry in old styles,","venue":null,"work_id":"0c3b7094-45a1-4682-a6df-866d7a332a6b","year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.265264Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:feb3c3a85eb669a8cd564b8f583cdb0972987d15f20187f4af9c59b11f40cc3d","observation_id":"f887adb8-6ea4-4a6b-bb13-f18fbf77213c","resolution":{"observed_at":"2026-08-12T14:12:47.911740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-14T09:51:03.197404Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-12T14:12:47.268640Z","title":"Large language models are not fair evaluators,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.268640Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:89673eff7d8675bc004c4a2995ba177a19710f225f5ad052273cfdf6885e32c3","observation_id":"48849448-6e53-40b9-b427-73fb1c9f362f","resolution":{"observed_at":"2026-08-12T14:12:47.268640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-19T05:45:27.077361Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-12T14:12:47.273316Z","title":"Judging the judges: Evaluating alignment and vulnerabilities in llms-as-judges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.273316Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:cb3a8b3ef0f1422f11b641cae1cc5a95596b2ec40502b0cdbb3ce6662050586a","observation_id":"5a1dd21d-8d36-4be1-bf11-05e3f4b196c8","resolution":{"observed_at":"2026-08-12T14:12:47.273316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-16T20:55:34.075464Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-12T14:12:47.277502Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.277502Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:74ababd45711500e5009a476c424de6783c276e801dcd7244e42eddd04ef5464","observation_id":"cc76682c-2a6e-4f13-8195-8cc0f480d730","resolution":{"observed_at":"2026-08-12T14:12:47.277502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.897091Z","title":"Creative beam search: Llm-as-a-judge for improving response generation,","venue":null,"work_id":"d2d5f6a4-4f3d-4481-998a-289690ea56a1","year":null},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.282217Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:df10cb0bdd3c2ffb4efde05d3b5a4bdbfe29f2f8e0dfe0d67871b14b53b019aa","observation_id":"b863d239-3770-4c5f-8d9c-8198e6fb6126","resolution":{"observed_at":"2026-08-12T14:12:47.900777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-12T14:12:47.290012Z","title":"Gptscore: Evaluate as you desire,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.290012Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:b203fab2b73234280a73cc1c4334325e6409219d01b5b609b98d61f43ed3212b","observation_id":"0233b9bb-89b8-421d-bdb4-9b5246eadc00","resolution":{"observed_at":"2026-08-12T14:12:47.290012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05657","last_updated":"2023-10-09T12:12:55Z","snapshot_observed_at":"2026-08-16T18:32:37.657518Z","submitted_at":"2023-10-09T12:12:55Z","title":"A Closer Look into Automatic Evaluation Using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05657","snapshot_observed_at":"2026-08-12T14:12:47.293766Z","title":"A closer look into automatic evaluation using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.293766Z"},"links":{"cited_paper":"/paper/2310.05657","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:266b72a3bcdd3f43654d48de74db705de02de73e86f9b49b35e5a3ca7a24a49e","observation_id":"53e2fd14-1328-4777-9240-8d802af2a910","resolution":{"observed_at":"2026-08-12T14:12:47.293766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.297661Z","title":"Evalullm: Llm assisted evaluation of generative outputs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.297661Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:87db7d95b778d95f6eaa34cc65fa680f8956321868838dc9327d92e0a4d8d883","observation_id":"4ae8a5de-53b8-4469-91db-b30b703f5893","resolution":{"observed_at":"2026-08-12T14:12:47.297661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.885471Z","title":"A confederacy of models: a comprehensive evaluation of LLMs on creative writing,","venue":null,"work_id":"857be181-2022-4135-90ac-61d8a34c571a","year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.301174Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:cde12e143fee4bb93d5bfc6545dd53e74b8412dbe3776d6ac17e6543a8beeed8","observation_id":"4c73c27f-1893-4f22-8036-f2ac20edf33f","resolution":{"observed_at":"2026-08-12T14:12:47.889664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19740","last_updated":"2025-01-18T03:27:45Z","snapshot_observed_at":"2026-08-16T18:50:18.229811Z","submitted_at":"2023-10-30T17:04:35Z","title":"Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19740","snapshot_observed_at":"2026-08-12T14:12:47.304643Z","title":"Collaborative evaluation: Exploring the synergy of large language models and humans for open-ended generation evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.304643Z"},"links":{"cited_paper":"/paper/2310.19740","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:b0d9a1ce483babd18a7bcba931446c0a96cdf28e200ac7db9df1a12dbebafdb6","observation_id":"638d01f5-8136-4085-8d0e-74f6584c07c6","resolution":{"observed_at":"2026-08-12T14:12:47.304643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.309239Z","title":"Automated scoring of scientific creativity in german,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.309239Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:63a072ad84d9d2d0871701f9319b4a0d3e54007288731528ddcef21156a3c7de","observation_id":"8b01018b-66c5-4500-aa11-4389f58bcc77","resolution":{"observed_at":"2026-08-12T14:12:47.309239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21203/rs.3.rs-3890828/v1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.411067Z","title":"Automated scoring of open-ended question complexity: A large language model approach,","venue":null,"work_id":"87e5d413-fb48-4e83-b58f-0bdaff015851","year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.312716Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:5cfacae0ed6c6b279a5bf165a81be7452f9febbf7c30594e3900d654768e7a32","observation_id":"162e16b8-a14d-4f06-8421-35f72c7ba193","resolution":{"observed_at":"2026-08-12T14:12:47.416884Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12491","last_updated":"2024-01-23T05:19:47Z","snapshot_observed_at":"2026-08-16T14:25:20.527390Z","submitted_at":"2024-01-23T05:19:47Z","title":"Assessing and Understanding Creativity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12491","snapshot_observed_at":"2026-08-12T14:12:47.316111Z","title":"Assessing and understanding creativity in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.316111Z"},"links":{"cited_paper":"/paper/2401.12491","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:f6edf2edb3f2cca4d4a34af7adfaa1158648dd12ba03e731b208ad018bb3acae","observation_id":"4acdc936-c5d5-4c8f-83b8-16caa96d3eb0","resolution":{"observed_at":"2026-08-12T14:12:47.316111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.319769Z","title":"Creativity and machine learning: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.319769Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:18c69e36be4cd9b1004b3612032302ddc8afcf7c2a093cad8f15ae6017852e5c","observation_id":"ae36eb3c-641c-4cf3-b28b-253757f997ca","resolution":{"observed_at":"2026-08-12T14:12:47.319769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.323109Z","title":"Creativity: Yesterday, today and tomorrow,","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.323109Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:7b8fd7e0f94418c414894bca5f94917f901b600d2ef7fd972ef81411f21b8a1f","observation_id":"6f73682e-72de-49eb-8926-b9ea8e97c0ca","resolution":{"observed_at":"2026-08-12T14:12:47.323109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.326634Z","title":"Automating creativity assessment with semdis: An open platform for computing semantic distance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.326634Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:c2ed6fb63aaba76424760e962fe64691cc656a7b2305f59476668682dae728b3","observation_id":"afe31441-2219-444a-9a86-1de836569786","resolution":{"observed_at":"2026-08-12T14:12:47.326634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.874094Z","title":"Beyond semantic distance: Automated scoring of divergent thinking greatly improves with large language models,","venue":null,"work_id":"d42619bf-c848-4f3e-ab77-222c7ff61ddf","year":2023},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.330336Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:a9c3c764d087916ededb69cdd91b0591d002b4e924c3187456d870dee061065a","observation_id":"5419b9c4-4bb4-4836-8771-3a0882744aaa","resolution":{"observed_at":"2026-08-12T14:12:47.878738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08932","last_updated":"2022-06-10T15:36:45Z","snapshot_observed_at":"2026-08-19T17:10:50.814049Z","submitted_at":"2022-06-10T15:36:45Z","title":"Putting GPT-3's Creativity to the (Alternative Uses) Test","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08932","snapshot_observed_at":"2026-08-12T14:12:47.333948Z","title":"Putting gpt-3’s creativity to the (alternative uses) test,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.333948Z"},"links":{"cited_paper":"/paper/2206.08932","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:34217f89e59d503d49ed5d946e3de1836eee998e9711046e0f4a7cd69a7da60a","observation_id":"253c0aae-08fe-42f2-9fa2-9a05ec34d610","resolution":{"observed_at":"2026-08-12T14:12:47.333948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.337834Z","title":"Torrance tests of creative thinking,","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.337834Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:b7e8de59f8c9b0764fc55ea705ee61b1e1cefd5a46e4e7b86e65059766207950","observation_id":"c818009f-f335-49b7-a721-e521c6fbb4b7","resolution":{"observed_at":"2026-08-12T14:12:47.337834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.341362Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.341362Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:5dcbf82fee6039f23ec9f9f3adb211038ce6f4081100ef56d982a7598ea912d7","observation_id":"d85789b3-94bb-44d5-8b9f-b10c15df6769","resolution":{"observed_at":"2026-08-12T14:12:47.341362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.862357Z","title":"Less is more for long document summary evaluation by LLMs,","venue":null,"work_id":"1379ae23-1bf1-44f8-a6dc-287ed9ef1960","year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.344849Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:48064b5eb6080154e48c6bfe96ad2cb38e46c3d71d236a6cfed21a3809615b15","observation_id":"acefef08-b23a-4275-8c06-a26ba88f4f26","resolution":{"observed_at":"2026-08-12T14:12:47.866583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.348216Z","title":"Lost in the middle: How language models use long contexts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.348216Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:c28d109ae7835cbd732ff58a7e2d61a764b9951942f699998310082c83d01434","observation_id":"02e10b32-ba65-465f-ad39-9f1896681d36","resolution":{"observed_at":"2026-08-12T14:12:47.348216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:12:47.844760Z","title":"Leveraging llm-respondents for item evaluation: a psychometric analysis,","venue":null,"work_id":"d04bad38-630b-4b2e-9bef-0da2578d3a68","year":null},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.352405Z"},"links":{"citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:9feb221bed1ddb14a0a43fc61489871fe302f91ee9523bae1f03634095c2efe3","observation_id":"381b285a-4ac9-4445-974f-4ee6b26826e6","resolution":{"observed_at":"2026-08-12T14:12:47.848942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10899","last_updated":"2024-07-15T16:49:26Z","snapshot_observed_at":"2026-08-16T13:34:04.253151Z","submitted_at":"2024-07-15T16:49:26Z","title":"Leveraging LLM-Respondents for Item Evaluation: a Psychometric Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10899","snapshot_observed_at":"2026-08-12T14:12:47.356051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.356051Z"},"links":{"cited_paper":"/paper/2407.10899","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:9e49e5f0bea68a77f3be6de7e83849c3a5d6445b4e8654575109c4e9f5fd8abe","observation_id":"ce6b503f-0aac-46c0-850f-e51a38e4e244","resolution":{"observed_at":"2026-08-12T14:12:47.356051Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00099","last_updated":"2024-10-07T16:45:42Z","snapshot_observed_at":"2026-08-17T21:43:54.700506Z","submitted_at":"2024-04-30T18:00:02Z","title":"Creative Beam Search: LLM-as-a-Judge For Improving Response Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00099","snapshot_observed_at":"2026-08-12T14:12:47.285969Z","title":"Available: https://arxiv.org/abs/2405.00099","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T14:12:47.285969Z"},"links":{"cited_paper":"/paper/2405.00099","citing_paper":"/paper/2411.15560"},"observation_digest":"sha256:caaef1930ede2a4edc33fb04ac3ee88670923502db622e8c379ee84c8ad5d5fb","observation_id":"4392029e-7e3d-4c28-8660-9359a1595adb","resolution":{"observed_at":"2026-08-12T14:12:47.285969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15560","last_updated":"2024-11-26T09:25:22Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-19T18:19:23.713156Z","submitted_at":"2024-11-23T13:34:50Z","title":"Do LLMs Agree on the Creativity Evaluation of Alternative Uses?"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 4 inbound Pith citation observations for arXiv:2411.15560."}