{"as_of":"2026-08-10T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfffc1788ce18d4ec79d607f229a033546a4b9a2a5b087c0f7afe2b5b6049f19","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:13:12.902147Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T07:22:25.349398Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"cited_work":{"arxiv_id":"2507.00769","doi":"10.48550/arxiv.2507.00769","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jack Grieve","venue":"ArXiv.org","work_id":"aa286d0c-46f7-482b-a992-959dbb5b1202","year":2025},"citing_paper":{"arxiv_id":"2605.04831","last_updated":"2026-05-06T12:28:17Z","snapshot_observed_at":"2026-07-06T23:17:33.252539Z","submitted_at":"2026-05-06T12:28:17Z","title":"StoryAlign: Evaluating and Training Reward Models for Story Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T17:29:13.549559Z"},"links":{"cited_paper":"/paper/2507.00769","citing_paper":"/paper/2605.04831"},"observation_digest":"sha256:2e3d0c0195a41b4b1b4a898317f4806d31ef361c0b73deb79ae28433567be004","observation_id":"1ce6660c-0d80-466f-b9e7-3c2317bc2b09","resolution":{"observed_at":"2026-05-11T17:31:07.707466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"cited_work":{"arxiv_id":"2507.00769","doi":"10.48550/arxiv.2507.00769","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jack Grieve","venue":"ArXiv.org","work_id":"aa286d0c-46f7-482b-a992-959dbb5b1202","year":2025},"citing_paper":{"arxiv_id":"2606.01145","last_updated":"2026-07-06T16:09:36Z","snapshot_observed_at":"2026-07-30T15:24:45.114962Z","submitted_at":"2026-05-31T10:27:18Z","title":"Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T17:35:01.285534Z"},"links":{"cited_paper":"/paper/2507.00769","citing_paper":"/paper/2606.01145"},"observation_digest":"sha256:2226e87c503b2130448645d96a8de13a0795eea1feba3561b2a63884a1fbe6fc","observation_id":"483e377e-1c38-40ac-b50f-427e716ce30b","resolution":{"observed_at":"2026-06-28T17:42:25.073554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"cited_work":{"arxiv_id":"2507.00769","doi":"10.48550/arxiv.2507.00769","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jack Grieve","venue":"ArXiv.org","work_id":"aa286d0c-46f7-482b-a992-959dbb5b1202","year":2025},"citing_paper":{"arxiv_id":"2606.01145","last_updated":"2026-07-06T16:09:36Z","snapshot_observed_at":"2026-07-30T15:24:45.114962Z","submitted_at":"2026-05-31T10:27:18Z","title":"Reasoning4Sciences: Bridging Reasoning Language Models to All Scientific Branches","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-01T07:22:25.349398Z"},"links":{"cited_paper":"/paper/2507.00769","citing_paper":"/paper/2606.01145"},"observation_digest":"sha256:6b5af55e13c4b2a3f6d1cc1b33e09127a0bcb9b1a0590b84c477e4746b9ecf17","observation_id":"bb475fb5-907b-4599-8794-87e0c302ca8e","resolution":{"observed_at":"2026-07-01T07:25:28.228212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"cited_work":{"arxiv_id":"2507.00769","doi":"10.48550/arxiv.2507.00769","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jack Grieve","venue":"ArXiv.org","work_id":"aa286d0c-46f7-482b-a992-959dbb5b1202","year":2025},"citing_paper":{"arxiv_id":"2606.24819","last_updated":"2026-06-23T17:05:19Z","snapshot_observed_at":"2026-08-04T20:05:27.820745Z","submitted_at":"2026-06-23T17:05:19Z","title":"HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-25T23:08:27.995672Z"},"links":{"cited_paper":"/paper/2507.00769","citing_paper":"/paper/2606.24819"},"observation_digest":"sha256:e1317d7caf15366f4777987764a6bfc033c27c56104780002cf753c6e0170191","observation_id":"e18507b1-8146-4282-a1eb-620798cc0b66","resolution":{"observed_at":"2026-07-04T18:00:01.338538Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00769/citation-record","integrity":"/paper/2507.00769/integrity","json":"/paper/2507.00769/citation-record.json","paper":"/paper/2507.00769"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.18116","last_updated":"2025-04-25T06:48:55Z","snapshot_observed_at":"2026-08-07T15:59:18.913539Z","submitted_at":"2025-04-25T06:48:55Z","title":"Think, Prune, Train, Improve: Scaling Reasoning without Scaling Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18116","snapshot_observed_at":"2026-08-06T21:12:44.575215Z","title":"Fabio Duarte","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.575215Z"},"links":{"cited_paper":"/paper/2504.18116","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:d0d0c1ca263de235833e388a20af962ea2c6d77df9cde0bf86624cf81000b657","observation_id":"ef8ed2bf-a7c3-4489-99eb-6f312d11a0c4","resolution":{"observed_at":"2026-08-06T21:12:44.575215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:13.961684Z","title":"Michele Elam","venue":null,"work_id":"653df731-1107-467f-8b51-dcad115b6fde","year":2025},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.647758Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:7ea0d09c9fa1f83e434cb5f0272d6e203559241270ea3770564950dcc20291cb","observation_id":"160a1d43-6ae7-4e53-bd73-e4231c4001a8","resolution":{"observed_at":"2026-08-06T21:13:13.988740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08420","last_updated":"2025-04-27T01:03:12Z","snapshot_observed_at":"2026-08-05T16:28:29.633722Z","submitted_at":"2021-10-16T00:21:42Z","title":"Understanding Dataset Difficulty with $\\mathcal{V}$-Usable Information","version":3},"cited_work":{"arxiv_id":"2110.08420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.08420","snapshot_observed_at":"2026-08-06T21:13:13.689784Z","title":"Understanding Dataset Difficulty with $\\mathcal{V}$-Usable Information","venue":"cs.CL","work_id":"b85d5e33-4b0a-4c36-8c99-53949479de9e","year":2021},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.712552Z"},"links":{"cited_paper":"/paper/2110.08420","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:30178eb447649185f35cdc68541f69fb55485985eeec16267db4580155a36440","observation_id":"3734a281-009a-463b-92e3-f5f32ad260de","resolution":{"observed_at":"2026-08-06T21:13:13.716456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.04833","last_updated":"2018-05-13T07:07:08Z","snapshot_observed_at":"2026-07-06T06:38:48.758485Z","submitted_at":"2018-05-13T07:07:08Z","title":"Hierarchical Neural Story Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.04833","snapshot_observed_at":"2026-08-06T21:12:44.783846Z","title":"Hierarchical neural story generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.783846Z"},"links":{"cited_paper":"/paper/1805.04833","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:9aaa9dc14edb727de00bea2fb8bfa51a79f226bd9a16297e072c56b0d555268a","observation_id":"0f362a63-d5b8-4501-b82a-401b6dac941a","resolution":{"observed_at":"2026-08-06T21:12:44.783846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15268","last_updated":"2025-01-27T11:35:04Z","snapshot_observed_at":"2026-07-06T19:20:37.430389Z","submitted_at":"2024-09-23T17:58:07Z","title":"Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15268","snapshot_observed_at":"2026-08-06T21:12:44.870655Z","title":"Bofei Gao, Feifan Song, Zhe Yang, Zefan Cai, Yibo Miao, Qingxiu Dong, Lei Li, Chenghao Ma, Liang Chen, Runxin Xu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.870655Z"},"links":{"cited_paper":"/paper/2409.15268","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:f4f95975651591b0f0b26637e0738b3aec0ffd951388e34d67bc5c1ed6b2e01f","observation_id":"790eb472-0233-4070-a125-d8f79dc8d3ce","resolution":{"observed_at":"2026-08-06T21:12:44.870655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T21:12:44.939856Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.939856Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:7c26eee3886818553a8445be60059bfde538af2315f9065ace9fc12bd29cdbbc","observation_id":"c53d829a-8867-473e-965c-79136e8a2a20","resolution":{"observed_at":"2026-08-06T21:12:44.939856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15784","last_updated":"2025-04-22T10:52:23Z","snapshot_observed_at":"2026-08-07T16:00:16.845264Z","submitted_at":"2025-04-22T10:52:23Z","title":"Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15784","snapshot_observed_at":"2026-08-06T21:13:12.724054Z","title":"org/abs/2504.15784","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.724054Z"},"links":{"cited_paper":"/paper/2504.15784","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:dc94da674a48c66cac0c7b48a7488ca7305b52472954f00de1cde0c255194aa8","observation_id":"5454d203-8d80-4b60-8f56-e155b6c3a38d","resolution":{"observed_at":"2026-08-06T21:13:12.724054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-06T21:13:12.744670Z","title":"Dakota Mahan, Duy Van Phung, Rafael Rafailov, Chase Blagden, Nathan Lile, Louis Castricato, Jan-Philipp Fränken, Chelsea Finn, and Alon Albalak","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.744670Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:105c17973a089ffa420e291e8d03ace56b2d6e4599c15480e2953f83ab9a8a58","observation_id":"7e702214-1cbc-444d-b801-93ab3005e6b5","resolution":{"observed_at":"2026-08-06T21:13:12.744670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:13.877105Z","title":"Danielle S McNamara, Scott A Crossley, and Philip M McCarthy","venue":null,"work_id":"15e2ba42-71bc-4904-a7e0-2dca8fe72c99","year":2027},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.763796Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:983880a67da251c2a3dbe97b5fed9d6da8d41b9e0f1ffc34a5e4418b0523ffc2","observation_id":"540ace0e-2b2d-453c-87f7-81efab574bbd","resolution":{"observed_at":"2026-08-06T21:13:13.916229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"p/1319215","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:13.312381Z","title":"URL https://store.macmillanlearning.com/us/product/ The-Practice-of-Creative-Writing/p/1319215955","venue":null,"work_id":"6d3925be-9ba8-4030-90d6-7fd50ea960e3","year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.796800Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:c5b5ef9395bcbca4862f035082810e3b627bf22c18c899d80e4761c7914aec9a","observation_id":"e2a442eb-6d4a-4234-a29d-d7e774f546db","resolution":{"observed_at":"2026-08-06T21:13:13.352387Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-06T21:13:12.830159Z","title":"org/abs/2305.17926","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.830159Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:d37c76bcf7039fa75c25271a1ce05026ddfcb2e2d08fa81790221e0d6c3172f1","observation_id":"7f42e472-9288-48a4-b21e-52497005cb66","resolution":{"observed_at":"2026-08-06T21:13:12.830159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-07-06T19:05:05.530925Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-06T21:13:12.843092Z","title":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Brian Ichter, Fei Xia, Ed H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.843092Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:19ec483ab1de13c310501950105a550f28944203323997ceb7b315f3a9ed15d3","observation_id":"da944267-1197-4876-a579-307bef239571","resolution":{"observed_at":"2026-08-06T21:13:12.843092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T21:13:12.854546Z","title":"Sara Cushing Weigle","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.854546Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:a86131548fca3602cced2043628319a803f8ca8a1c5224e8ed264cf9983f465a","observation_id":"cb23fb3a-4549-4e08-ba92-dce7597f81b9","resolution":{"observed_at":"2026-08-06T21:13:12.854546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15240","last_updated":"2025-02-22T10:21:46Z","snapshot_observed_at":"2026-07-06T19:06:41.697671Z","submitted_at":"2024-08-27T17:57:45Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15240","snapshot_observed_at":"2026-08-06T21:13:12.874087Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.874087Z"},"links":{"cited_paper":"/paper/2408.15240","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:ba74e7d9de9374d05798217a6f3fc7445dbeaf0efc700665ee6ebd0d17af2a9a","observation_id":"0a6a7bc0-6122-4e84-b9a1-4aade24a303d","resolution":{"observed_at":"2026-08-06T21:13:12.874087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-06T21:13:12.902147Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.902147Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:2a11c5157b17b5f11d783d4c9512906318095cb15d21d70de4f34a5507ed14bd","observation_id":"e8d50100-4b50-41ba-87b6-88cd5fd5e405","resolution":{"observed_at":"2026-08-06T21:13:12.902147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:14.030491Z","title":"Ralph Allan Bradley and Milton E Terry","venue":null,"work_id":"89ad17fe-008a-4a70-8d2a-7694beadb4b1","year":1960},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":1960,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.302548Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:f961e0c3a86ec8915b15e88100c1f4c5d72f4fd7ac250b88a7b5ca1a938e1ddf","observation_id":"bd4f0ce7-ed4d-46c5-a31b-24a4de1bb202","resolution":{"observed_at":"2026-08-06T21:13:14.072352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2034260","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:13.484868Z","title":"Heather Sellers","venue":null,"work_id":"48cb9702-bf5c-4781-ae0e-17e74fec4c91","year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":1961,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.782574Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:4b5f13382936f26bf41ba563b832938f10928a32a360ef86e2432e5be7db4827","observation_id":"396c0b59-ba62-47b4-8706-57861229aab1","resolution":{"observed_at":"2026-08-06T21:13:13.511638Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:44.121415Z","title":"Sher Badshah and Hassan Sajjad","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":1982,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.121415Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:9899dffa1c9c3a015bad1927313383c293d70cda53a1def537b0e5c2076e4ebe","observation_id":"4e8f375f-9296-4f6d-b565-707d3a1291c8","resolution":{"observed_at":"2026-08-06T21:12:44.121415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-06T21:13:12.864529Z","title":"15 Jiayi Ye, Yanbo Wang, Yue Huang, Dongping Chen, Qihui Zhang, Nuno Moniz, Tian Gao, Werner Geyer, Chao Huang, Pin-Yu Chen, Nitesh V Chawla, and Xiangliang Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.864529Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:93cd1537cb9a1d67fb7d6b2102b1ba3f78012600400332cb6c87d3d1f6c4ea51","observation_id":"6cdb43df-3c7c-47d1-b6df-57627e9f6525","resolution":{"observed_at":"2026-08-06T21:13:12.864529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:14.115891Z","title":"Danial Alihosseini, Ehsan Montahaei, and Mahdieh Soleymani Baghshah","venue":null,"work_id":"9968578c-2646-49bb-8a74-073ac9574752","year":2025},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.004545Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:6ee0ccea4205b227ce16cb61cffd522bc82ecafecda496af8d17833f195d1ed2","observation_id":"c73d6e15-03c8-42fd-b98f-58feffac5554","resolution":{"observed_at":"2026-08-06T21:13:14.145774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w19-2311","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:13.010308Z","title":"doi: 10.18653/v1/W19-2311","venue":null,"work_id":"49b1603e-1ce6-492e-a89b-f8a3379f83a4","year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.053218Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:d40d5e7e754b80e88fb7f45214849dc0d6278dbe57a163436e6e22596cf25d92","observation_id":"8c121b04-ca26-4562-a6da-517cc74fe131","resolution":{"observed_at":"2026-08-06T21:13:13.021589Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-06T21:13:12.819935Z","title":"Peiyi Wang, Lei Li, Liang Chen, Zefan Cai, Dawei Zhu, Binghuai Lin, Yunbo Cao, Qi Liu, Tianyu Liu, and Zhifang Sui","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.819935Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:23f096f764ce461f728d5ebab40f23635b37fb85eabc84d044d9c5f972543783","observation_id":"3dd84b21-46ad-4476-be1d-040e1a3b7021","resolution":{"observed_at":"2026-08-06T21:13:12.819935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-06T21:12:45.023262Z","title":"Swe-bench: Can language models resolve real-world github issues? arXiv preprint arXiv:2310.06770,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:45.023262Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:b0a869864ee54ca71fa0bb6b62972601f4eb7c4c3ae86366ddb08d6c3dd5b030","observation_id":"e1f6de1b-dcb4-4290-ba53-2d2310d64a66","resolution":{"observed_at":"2026-08-06T21:12:45.023262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-06T21:13:12.773984Z","title":"Jiayi Pan, Xingyao Wang, Graham Neubig, Navdeep Jaitly, Heng Ji, Alane Suhr, and Yizhe Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:13:12.773984Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:3242e66453dcd753b0c2af537ee2c795801034b8c9f8910a56b3b4cfaa68755a","observation_id":"97d114a7-7b7c-4d69-9b6d-911abf566ec4","resolution":{"observed_at":"2026-08-06T21:13:12.773984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/exsy.13292","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:13:12.945177Z","title":"URL https: //doi.org/10.1111/exsy.13292","venue":null,"work_id":"ac10b993-d735-4434-a4e5-953cf13c4908","year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.379126Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:f163e70c1f741f9742e5b6874cb011491613b54a13f7bcf9f3fa465ba3717b9c","observation_id":"3f0f115e-15bc-4373-8a33-6c11120d099c","resolution":{"observed_at":"2026-08-06T21:13:12.961108Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:44.221989Z","title":"Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.221989Z"},"links":{"citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:4b2237e880cebc136ea11e445fecd20191bc5c036715a35cbeed7394b6f02195","observation_id":"e6d6e5d1-a24b-4a5b-8604-3191bdde2e67","resolution":{"observed_at":"2026-08-06T21:12:44.221989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17126","last_updated":"2025-03-21T13:21:45Z","snapshot_observed_at":"2026-08-07T16:46:38.974452Z","submitted_at":"2025-03-21T13:21:45Z","title":"Modifying Large Language Model Post-Training for Diverse Creative Writing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17126","snapshot_observed_at":"2026-08-06T21:12:44.473350Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:44.473350Z"},"links":{"cited_paper":"/paper/2503.17126","citing_paper":"/paper/2507.00769"},"observation_digest":"sha256:3f85d7039d7b8503796dda9677bcaf088b52902d4a31b6ef19b263e5a30e4cdc","observation_id":"4d53d8de-684d-42e3-a7ef-c7511b2986a6","resolution":{"observed_at":"2026-08-06T21:12:44.473350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00769","last_updated":"2025-07-01T14:10:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T03:44:26.641524Z","submitted_at":"2025-07-01T14:10:36Z","title":"LitBench: A Benchmark and Dataset for Reliable Evaluation of Creative Writing"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":5,"verified_fuzzy":4},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 4 inbound Pith citation observations for arXiv:2507.00769."}