{"as_of":"2026-08-14T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9efb6d7ef56935c495d79574b34d1e22fab2d3d69097310e24ab31aad5d8959f","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T18:44:28.766639Z","state":"measured"},{"denominator":134,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":134,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":116,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:34:16.109049Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T10:27:02.394079Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2408.09049","last_updated":"2026-04-19T19:02:30Z","snapshot_observed_at":"2026-08-08T20:15:07.345025Z","submitted_at":"2024-08-16T23:24:10Z","title":"Inertia in Moral and Value Judgments of Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-23T22:05:17.165589Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2408.09049"},"observation_digest":"sha256:9f4117e0f415671ad57af61b032ef3cfb579c5c72decb67b59152b0f6a1911b7","observation_id":"b6ad9c75-d36d-41fe-b11b-7d1cdf70caca","resolution":{"observed_at":"2026-05-23T22:05:50.087921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2410.02064","last_updated":"2025-04-22T01:24:23Z","snapshot_observed_at":"2026-08-12T17:44:46.549587Z","submitted_at":"2024-10-02T22:26:21Z","title":"Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T19:51:14.630756Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2410.02064"},"observation_digest":"sha256:cddbc8b18c78142114c40bb82a3e237d9050f74056ac1c88cbf9eee7c237ef4a","observation_id":"8ad9e232-bdf9-4907-b2f8-29f0e184af6e","resolution":{"observed_at":"2026-05-23T19:53:23.262358Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2410.21819","last_updated":"2025-06-21T08:39:06Z","snapshot_observed_at":"2026-08-14T13:23:53.106970Z","submitted_at":"2024-10-29T07:42:18Z","title":"Self-Preference Bias in LLM-as-a-Judge","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:46:32.515449Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2410.21819"},"observation_digest":"sha256:c5b3d5a7318b7e71151edfc0d14fe98ef5f68b5f7c4eec777783e12814b5975e","observation_id":"3d787a9f-3e54-494b-aa6a-a31a0b37c7ed","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-12T20:34:16.109049Z","title":"Bowman and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09577","last_updated":"2024-11-17T20:04:46Z","snapshot_observed_at":"2026-08-12T22:42:37.256704Z","submitted_at":"2024-11-14T16:35:17Z","title":"SimTube: Generating Simulated Video Comments through Multimodal AI and User Personas","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:34:16.109049Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2411.09577"},"observation_digest":"sha256:09b558c43950d6e449e232d470d6da30beecb06ecee140cf4bf590143dd41953","observation_id":"64c53fff-a207-48da-97f7-0de4cc5d41b3","resolution":{"observed_at":"2026-08-12T20:34:16.109049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-12T17:08:26.654572Z","title":"R.; and Feng, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12877","last_updated":"2025-03-06T20:06:51Z","snapshot_observed_at":"2026-08-13T04:54:44.477524Z","submitted_at":"2024-11-19T21:47:08Z","title":"The Illusion of Empathy: How AI Chatbots Shape Conversation Perception","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T17:08:26.654572Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2411.12877"},"observation_digest":"sha256:4ba55852c4a643c040863100b8e076bc3c131628079c77f5b7e3231307ad95af","observation_id":"c9a68d38-3b3a-4b4d-bed0-ef4950ac7d86","resolution":{"observed_at":"2026-08-12T17:08:26.654572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-12T15:24:17.506298Z","title":"Preprint, arXiv:2404.13076","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.14272","last_updated":"2024-11-21T16:28:32Z","snapshot_observed_at":"2026-08-14T03:07:01.287464Z","submitted_at":"2024-11-21T16:28:32Z","title":"Efficient Aspect-Based Summarization of Climate Change Reports with Small Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T15:24:17.506298Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2411.14272"},"observation_digest":"sha256:33c6627aaac9c4498cde48084d4e9e35ce798d2320e9e1ee1b498a197af48e04","observation_id":"00bab622-5de5-4eaf-ad4d-0c121f53aa78","resolution":{"observed_at":"2026-08-12T15:24:17.506298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-12T13:37:15.817222Z","title":"arXiv preprint arXiv:2404.13076","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.16077","last_updated":"2024-11-25T04:07:16Z","snapshot_observed_at":"2026-08-13T22:08:51.896224Z","submitted_at":"2024-11-25T04:07:16Z","title":"SAGEval: The frontiers of Satisfactory Agent based NLG Evaluation for reference-free open-ended text","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:37:15.817222Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2411.16077"},"observation_digest":"sha256:769ddac4740f2c11720b5e21a87597ac2eaf4185add3712a77f1daf75a2eafaa","observation_id":"eb71aab2-9895-4280-bedc-5cf82cbbfa18","resolution":{"observed_at":"2026-08-12T13:37:15.817222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-11T22:37:55.664752Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-08-11T22:30:47.514883Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T22:37:55.664752Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2412.03304"},"observation_digest":"sha256:41228ecc7d5c6ab4b19c237615bffd9f3e499802cb96e4cb80a6c38ebe63f8be","observation_id":"aa766792-8143-4ef5-bf0e-bf3cb1f7ab7f","resolution":{"observed_at":"2026-08-11T22:37:55.664752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-11T21:28:19.134006Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04576","last_updated":"2024-12-05T19:46:53Z","snapshot_observed_at":"2026-08-12T20:54:33.211922Z","submitted_at":"2024-12-05T19:46:53Z","title":"Show, Don't Tell: Uncovering Implicit Character Portrayal using LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:28:19.134006Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2412.04576"},"observation_digest":"sha256:2ef6c0a59fdb176e8d271851913e144068b0911ace8ccad33cafceab6f39e02e","observation_id":"91e4fdbf-9aba-42a9-869e-91d59075299d","resolution":{"observed_at":"2026-08-11T21:28:19.134006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-08-11T23:22:45.789386Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":177,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:226c309b513920a8ebabc263e2cff3e2427a772491b2566bc1480480d505a5b1","observation_id":"3f9f0f66-694b-4dfe-828d-9e95598adb77","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-11T14:40:29.503176Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11763","last_updated":"2024-12-16T13:28:29Z","snapshot_observed_at":"2026-08-14T05:55:25.930535Z","submitted_at":"2024-12-16T13:28:29Z","title":"QUENCH: Measuring the gap between Indic and Non-Indic Contextual General Reasoning in LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:40:29.503176Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2412.11763"},"observation_digest":"sha256:335411f70f19ca6abcec7fde5a1591fd37b862659681b619b8f0c2bbd7a666ea","observation_id":"49fd37c9-6cc2-4171-96c6-5553d8b27e9d","resolution":{"observed_at":"2026-08-11T14:40:29.503176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-11T14:36:16.059013Z","title":"ArXiv, abs/2404.13076","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11832","last_updated":"2024-12-16T14:55:57Z","snapshot_observed_at":"2026-08-12T15:30:59.089158Z","submitted_at":"2024-12-16T14:55:57Z","title":"A Distributed Collaborative Retrieval Framework Excelling in All Queries and Corpora based on Zero-shot Rank-Oriented Automatic Evaluation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:36:16.059013Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2412.11832"},"observation_digest":"sha256:eef75dd3ceab53bdc28177f2c04e66dcead0103b73843073e187dbde1021446c","observation_id":"24791312-1495-4c26-8b59-d9a64dea32eb","resolution":{"observed_at":"2026-08-11T14:36:16.059013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-11T12:58:26.937180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13666","last_updated":"2025-07-25T06:20:38Z","snapshot_observed_at":"2026-08-14T10:51:16.669311Z","submitted_at":"2024-12-18T09:48:53Z","title":"Evaluation of LLM Vulnerabilities to Being Misused for Personalized Disinformation Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T12:58:26.937180Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2412.13666"},"observation_digest":"sha256:4382cd30eb8a8bf07e35ed77c4126281bf54f2c371d0ed797420500450d03f69","observation_id":"b46ea476-4908-44e3-ad12-f0438f16939e","resolution":{"observed_at":"2026-08-11T12:58:26.937180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2501.09775","last_updated":"2026-05-03T15:15:38Z","snapshot_observed_at":"2026-08-13T22:22:41.175026Z","submitted_at":"2025-01-16T10:27:51Z","title":"Multiple Choice Questions: Reasoning Makes Large Language Models (LLMs) More Self-Confident, Especially When They are Wrong","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T05:37:22.955895Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2501.09775"},"observation_digest":"sha256:762c365f3055ab6fcd353038ebe514bcee146048c095e0b127fa57c253daa8bb","observation_id":"aa79b3a9-6e4c-4b1b-b5a9-b7fa7962d0a3","resolution":{"observed_at":"2026-05-23T05:37:36.055475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-10T15:02:43.274806Z","title":"R., and Feng, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17178","last_updated":"2025-05-27T07:58:46Z","snapshot_observed_at":"2026-08-13T06:12:48.981684Z","submitted_at":"2025-01-24T17:01:14Z","title":"Tuning LLM Judge Design Decisions for 1/1000 of the Cost","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T15:02:43.274806Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2501.17178"},"observation_digest":"sha256:2758406820007f1dc38d6521c4ff5d40fadc63ead5e8ea0134075a0369fc3a1d","observation_id":"0f1a9170-4b93-41c0-9fd0-fa6ecc3be8dd","resolution":{"observed_at":"2026-08-10T15:02:43.274806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-09T05:23:59.966207Z","title":", Bowman, S R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03253","last_updated":"2025-05-05T13:47:32Z","snapshot_observed_at":"2026-08-14T01:23:01.443219Z","submitted_at":"2025-02-05T15:08:43Z","title":"How do Humans and Language Models Reason About Creativity? A Comparative Analysis","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T05:23:59.966207Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2502.03253"},"observation_digest":"sha256:f9bbfd9cbed876d40b010d398cccc308910ec406afda97af6877345cc02ce6f0","observation_id":"11b10f94-2a9c-451e-aee3-6ca9f4d3ae77","resolution":{"observed_at":"2026-08-09T05:23:59.966207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-08T16:14:57.437069Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10441","last_updated":"2025-02-10T09:19:52Z","snapshot_observed_at":"2026-08-13T09:39:06.521644Z","submitted_at":"2025-02-10T09:19:52Z","title":"AI Alignment at Your Discretion","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T16:14:57.437069Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2502.10441"},"observation_digest":"sha256:bd06ef5ef3799cabf81f15e4e2d7db8e3aaf38b751c1d8d3eda9663ad46d5ff4","observation_id":"53b8c123-a100-4905-ad58-b225e8b1981d","resolution":{"observed_at":"2026-08-08T16:14:57.437069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-08T16:55:23.990465Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2503.04756","last_updated":"2025-02-09T23:57:33Z","snapshot_observed_at":"2026-08-10T03:58:49.986474Z","submitted_at":"2025-02-09T23:57:33Z","title":"Peeking Behind Closed Doors: Risks of LLM Evaluation by Private Data Curators","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T16:55:23.990465Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2503.04756"},"observation_digest":"sha256:c466cf5e84b0e6fb14c4306d391b2ab4825515ccfdb92e685169ea6558313f98","observation_id":"4270e169-fa7e-4639-aa44-edc42768674f","resolution":{"observed_at":"2026-08-08T16:55:23.990465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2504.14044","last_updated":"2025-04-18T19:24:17Z","snapshot_observed_at":"2026-08-03T12:16:52.455151Z","submitted_at":"2025-04-18T19:24:17Z","title":"Multi-Stage Retrieval for Operational Technology Cybersecurity Compliance Using Large Language Models: A Railway Casestudy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T18:27:19.450554Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2504.14044"},"observation_digest":"sha256:89af1171365765e98ed045e3e9d6f046353dafd32d37f32306add3b110b8f56e","observation_id":"22e590c6-4e69-47fd-9f01-a28c08ad1826","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T15:19:17.178061Z","title":"Llm evaluators recognize and favor their own generations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15872","last_updated":"2025-05-23T10:16:01Z","snapshot_observed_at":"2026-08-13T21:14:11.003292Z","submitted_at":"2025-05-21T14:44:40Z","title":"InfoDeepSeek: Benchmarking Agentic Information Seeking for Retrieval-Augmented Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:19:17.178061Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2505.15872"},"observation_digest":"sha256:653b1168af908a28e85c11bf6fbc5ec9a0cd950c021990602b1f4f4a37538b82","observation_id":"1675159f-a359-4928-b17f-45b930d2eaeb","resolution":{"observed_at":"2026-08-07T15:19:17.178061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T14:58:36.804850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16849","last_updated":"2025-05-28T07:44:23Z","snapshot_observed_at":"2026-08-13T07:10:56.155402Z","submitted_at":"2025-05-22T16:11:35Z","title":"Walk&Retrieve: Simple Yet Effective Zero-shot Retrieval-Augmented Generation via Knowledge Graph Walks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:36.804850Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2505.16849"},"observation_digest":"sha256:4b459af21e7c79bdfccb2d8335b890d94699dd59d5032e958fa491a202b05187","observation_id":"4631f2bc-8179-4f1e-8198-984328c59ca8","resolution":{"observed_at":"2026-08-07T14:58:36.804850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T15:05:24.225917Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17149","last_updated":"2025-05-22T09:02:15Z","snapshot_observed_at":"2026-08-13T15:46:46.044917Z","submitted_at":"2025-05-22T09:02:15Z","title":"Large Language Models for Predictive Analysis: How Far Are They?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:05:24.225917Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2505.17149"},"observation_digest":"sha256:5b2f4e3c6cfe2f8b16150e35e720bbf6ebdac8c091f14d8cb786a2d708e671c2","observation_id":"a5c44c37-4683-4d05-b1b3-15e79cd9f1b0","resolution":{"observed_at":"2026-08-07T15:05:24.225917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T13:59:50.789445Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20266","last_updated":"2025-05-26T17:43:13Z","snapshot_observed_at":"2026-08-11T06:06:44.497213Z","submitted_at":"2025-05-26T17:43:13Z","title":"syftr: Pareto-Optimal Generative AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:50.789445Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2505.20266"},"observation_digest":"sha256:b8fb92a3d2aff0b06e46c9b7ecad627e1373af8ad52c2582f7eac01bd973e784","observation_id":"ff79056f-6f10-4e40-8146-140ca201ef0a","resolution":{"observed_at":"2026-08-07T13:59:50.789445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T13:45:59.026744Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20973","last_updated":"2025-05-28T09:35:54Z","snapshot_observed_at":"2026-08-12T23:35:43.977103Z","submitted_at":"2025-05-27T10:05:26Z","title":"Towards Conversational Development Environments: Using Theory-of-Mind and Multi-Agent Architectures for Requirements Refinement","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:45:59.026744Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2505.20973"},"observation_digest":"sha256:9d3fa0d7540b1f80d4be658b0eab9e5b1246d234379d93933fcd3ae339f25962","observation_id":"47c1e098-0725-4fd0-8b0d-eb49ce71aa30","resolution":{"observed_at":"2026-08-07T13:45:59.026744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T10:46:27.078452Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04494","last_updated":"2025-06-04T22:25:47Z","snapshot_observed_at":"2026-08-09T19:47:54.409122Z","submitted_at":"2025-06-04T22:25:47Z","title":"SQLens: An End-to-End Framework for Error Detection and Correction in Text-to-SQL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:46:27.078452Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2506.04494"},"observation_digest":"sha256:9a493f83e48091198c3be445ef8f3891eb712db161acf06229fb668947a9b1b3","observation_id":"aa0623f9-8c14-4145-b51f-12e4a0a176ba","resolution":{"observed_at":"2026-08-07T10:46:27.078452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T10:30:37.672436Z","title":"Panickssery, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05068","last_updated":"2025-06-06T11:26:38Z","snapshot_observed_at":"2026-08-10T18:45:40.540769Z","submitted_at":"2025-06-05T14:13:54Z","title":"Does It Make Sense to Speak of Introspection in Large Language Models?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:30:37.672436Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2506.05068"},"observation_digest":"sha256:5204e21e81a694b347cb81143d3c1ee5fac2ec6baec3e347f5679b205f8a1ddf","observation_id":"d381cae9-b08a-46da-97a9-afd1bd5c7c5f","resolution":{"observed_at":"2026-08-07T10:30:37.672436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T05:50:49.513946Z","title":"Preprint, arXiv:2404.13076","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06877","last_updated":"2025-06-24T13:55:38Z","snapshot_observed_at":"2026-08-14T17:50:12.831302Z","submitted_at":"2025-06-07T17:54:56Z","title":"Right Is Not Enough: The Pitfalls of Outcome Supervision in Training LLMs for Math Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:49.513946Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2506.06877"},"observation_digest":"sha256:ace42967096556493ff1d0aaffdae21ff805431f052f00dd152ae537284ca85b","observation_id":"e104101e-e157-47ab-9789-edbe58235f57","resolution":{"observed_at":"2026-08-07T05:50:49.513946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-07T05:34:26.937721Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07673","last_updated":"2026-07-21T11:15:43Z","snapshot_observed_at":"2026-08-09T03:05:20.348569Z","submitted_at":"2025-06-09T11:50:41Z","title":"How Benchmark Prediction from Fewer Data Misses the Mark","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:26.937721Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2506.07673"},"observation_digest":"sha256:c4aa580a418a965ee81c641ddf6fe602458c609e7d2542484be9670c1e953537","observation_id":"30ef8940-83f3-4a49-8f21-17c2e82ebbe2","resolution":{"observed_at":"2026-08-07T05:34:26.937721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-06T20:57:41.793378Z","title":"R., and Feng, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01413","last_updated":"2025-07-02T07:06:49Z","snapshot_observed_at":"2026-08-09T16:11:02.776047Z","submitted_at":"2025-07-02T07:06:49Z","title":"Evaluating LLM Agent Collusion in Double Auctions","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:57:41.793378Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2507.01413"},"observation_digest":"sha256:26de3fb6c1a9355404ac200f002fc322a83f860e0f3170147b7b792683f777c6","observation_id":"a14b3870-6674-4ae9-bbd0-3c95a9225e71","resolution":{"observed_at":"2026-08-06T20:57:41.793378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-06T16:33:02.884796Z","title":"arXiv preprint arXiv:2404.13076","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13302","last_updated":"2025-07-17T17:11:14Z","snapshot_observed_at":"2026-08-10T04:41:51.265110Z","submitted_at":"2025-07-17T17:11:14Z","title":"The Generative Energy Arena (GEA): Incorporating Energy Awareness in Large Language Model (LLM) Human Evaluations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:02.884796Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2507.13302"},"observation_digest":"sha256:c6fede8fae203145b0cf6b5af8868c8b7b006b4604adbd12a898afdc10334540","observation_id":"c2fac121-3779-4f6e-9a6b-077b66871fe1","resolution":{"observed_at":"2026-08-06T16:33:02.884796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-06T15:02:21.733580Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17015","last_updated":"2025-07-22T20:57:09Z","snapshot_observed_at":"2026-08-07T12:17:11.302795Z","submitted_at":"2025-07-22T20:57:09Z","title":"Can External Validation Tools Improve Annotation Quality for LLM-as-a-Judge?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:02:21.733580Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2507.17015"},"observation_digest":"sha256:c685287fe3fd9c3df58295b8507290dac487d567f12201f79d45607abebd111c","observation_id":"ff84316f-d482-4e36-9d8b-12c0ac14e873","resolution":{"observed_at":"2026-08-06T15:02:21.733580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-06T10:28:55.416142Z","title":"Preprint, arXiv:2404.13076","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23776","last_updated":"2025-07-31T17:58:25Z","snapshot_observed_at":"2026-08-14T04:54:39.960307Z","submitted_at":"2025-07-31T17:58:25Z","title":"Cascaded Information Disclosure for Generalized Evaluation of Problem Solving Capabilities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:28:55.416142Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2507.23776"},"observation_digest":"sha256:0b733dee141a77e634f385f20d9d85c0374145a8be2e42b11748bd0a132b8ce9","observation_id":"0112b2ea-cc66-4340-9db0-44ed6570f111","resolution":{"observed_at":"2026-08-06T10:28:55.416142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-05T22:40:42.222615Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-13T13:10:01.975246Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:40:42.222615Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2508.06709"},"observation_digest":"sha256:0c9253a37cdf1ad744d5b9663ccadf1bf07b3d2c2e38ae45a8cc7d7cb7510268","observation_id":"e1b4a454-ab3b-4ee8-b80d-7bc864ed07a2","resolution":{"observed_at":"2026-08-05T22:40:42.222615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-05T16:32:54.605015Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18255","last_updated":"2025-09-02T17:12:12Z","snapshot_observed_at":"2026-08-13T15:01:58.323767Z","submitted_at":"2025-08-25T17:45:06Z","title":"Hermes 4 Technical Report","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T16:32:54.605015Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2508.18255"},"observation_digest":"sha256:87b3b963523cc8bb202d7268f3f83adff387725e040a620fdb9fb19063e7c7ca","observation_id":"41f18b2d-7d8e-4ec7-9fe3-c26d127b57bf","resolution":{"observed_at":"2026-08-05T16:32:54.605015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-05T10:51:44.497879Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03647","last_updated":"2026-06-22T18:38:14Z","snapshot_observed_at":"2026-08-14T15:01:20.275048Z","submitted_at":"2025-09-03T18:52:55Z","title":"Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:51:44.497879Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2509.03647"},"observation_digest":"sha256:f10122e9e045636bb0d20397b2efe7af43201aca4881552d9457d15683589826","observation_id":"d3be7bdb-19ae-4b70-853f-6e0d66ffbc5c","resolution":{"observed_at":"2026-08-05T10:51:44.497879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-04T11:19:49.140681Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.05709","last_updated":"2026-06-04T12:15:57Z","snapshot_observed_at":"2026-08-14T19:05:18.524817Z","submitted_at":"2025-10-07T09:22:22Z","title":"Correcting Prompt Dependence in LLM Benchmarks: A Bayesian Hierarchical Model with Embedding-Space Clustering","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T11:19:49.140681Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2510.05709"},"observation_digest":"sha256:1422545c6f4999cf25eb4196e0bfc06eb026821a51db893c49d5b60095f32dce","observation_id":"f9e2d1a7-cba9-4927-9f62-d1632947881c","resolution":{"observed_at":"2026-08-04T11:19:49.140681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2511.01490","last_updated":"2026-04-28T14:06:15Z","snapshot_observed_at":"2026-08-14T18:14:23.273917Z","submitted_at":"2025-11-03T11:57:11Z","title":"Synthetic Eggs in Many Baskets: The Impact of Synthetic Data Diversity on LLM Fine-Tuning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T01:17:12.349379Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2511.01490"},"observation_digest":"sha256:5a5a6a92d6a9ca05b6e44e25175708add59b42c6bee48ace23251e7c3c181dbc","observation_id":"964cce02-b2a8-4eff-a5cc-077d67ab2ccb","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-03T06:46:26.318507Z","title":"Llm evaluators recognize and favor their own generations.arXiv preprint arXiv:2404.13076, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.318507Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:3bf6fe772c89ce606690216b17de90e86efa95485acf4234474a69fe3da8556c","observation_id":"e05ec9cd-5555-4d59-9cce-b93d2cab1d80","resolution":{"observed_at":"2026-08-03T06:46:26.318507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T17:52:54.781379Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.20324","last_updated":"2026-07-21T00:19:03Z","snapshot_observed_at":"2026-08-07T10:38:46.914990Z","submitted_at":"2026-03-20T00:50:53Z","title":"When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T17:52:54.781379Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2603.20324"},"observation_digest":"sha256:c510e4e0719874e1d727c12e83fd0f3ee920e80b22bf50990eb0efc307d2d897","observation_id":"fe068385-672f-4acc-8838-5f54f5456a33","resolution":{"observed_at":"2026-08-02T17:52:54.781379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.06233","last_updated":"2026-04-03T13:53:23Z","snapshot_observed_at":"2026-08-10T23:40:17.010548Z","submitted_at":"2026-04-03T13:53:23Z","title":"Blind Refusal: Language Models Refuse to Help Users Evade Unjust, Absurd, and Illegitimate Rules","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T19:24:54.381722Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.06233"},"observation_digest":"sha256:76c9ae798612e86cf72c221ae4e694b5ec75ae4e5b60e4afe9783005b5f0b00a","observation_id":"3ee0af1d-7a91-4b7e-93e7-1f082686a1c9","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:19.955943Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:f238b1aaeaea61f6c86d631d1cba87890f152468e8312ef91a4473be9a8eda5c","observation_id":"1155bc7e-469a-40ca-ae71-d1a593c9050f","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T16:40:55.436057Z","title":"Arjun Panickssery, Samuel R Bowman, and Shi Feng","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:55.436057Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:f4b045225c90f213be6bd24b8b0a74e8f67642e9e53822aaeabfbd5e1b479d74","observation_id":"e3ee2514-3842-445b-af4c-ae31f1626fc7","resolution":{"observed_at":"2026-08-02T16:40:55.436057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-04T05:36:43.346642Z","title":"Arjun Panickssery, Samuel R Bowman, and Shi Feng","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-13T00:16:00.739066Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:36:43.346642Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:9bd52f13820cc0642762383b4be51bbd4574efd3eb3bb2d9f546be21d3b667e3","observation_id":"b9785487-4c8a-40aa-bb92-59263e52e98a","resolution":{"observed_at":"2026-08-04T05:36:43.346642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.16310","last_updated":"2026-01-30T15:32:14Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-01-30T15:32:14Z","title":"RAG-DIVE: A Dynamic Approach for Multi-Turn Dialogue Evaluation in Retrieval-Augmented Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T09:13:55.204404Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.16310"},"observation_digest":"sha256:252f2e90ff0804de98b2c023f6ab96efc870a070f67fe5db5b191b887f806f79","observation_id":"7dfb4733-05f4-4488-8edd-af6e6f648f84","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.23178","last_updated":"2026-06-24T13:27:28Z","snapshot_observed_at":"2026-08-14T02:31:37.751335Z","submitted_at":"2026-04-25T07:18:30Z","title":"Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T08:14:18.535385Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.23178"},"observation_digest":"sha256:522b1813d8fe62fc2b2faca3cbbaf6098b4407fb4915f9c98dd3b3945ab440a8","observation_id":"61d69125-6ba6-47c1-87cd-e55399f84958","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.24346","last_updated":"2026-04-27T11:39:18Z","snapshot_observed_at":"2026-08-11T14:08:06.435114Z","submitted_at":"2026-04-27T11:39:18Z","title":"SycoPhantasy: Quantifying Sycophancy and Hallucination in Small Open Weight VLMs for Vision-Language Scoring of Fantasy Characters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T04:44:35.423054Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.24346"},"observation_digest":"sha256:83aa3fe71a750e0c1fc43af5a8fc8e6cf317b0ad688bd1fbb736ce86db8d3010","observation_id":"3b3a299b-074e-41ac-96ba-05882f1d4594","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.24544","last_updated":"2026-04-27T14:39:41Z","snapshot_observed_at":"2026-08-11T08:14:30.176004Z","submitted_at":"2026-04-27T14:39:41Z","title":"STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:30.528601Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.24544"},"observation_digest":"sha256:e47741046b8e27313d9b9ae243c6e5d0368bfa2966d32a95607b12a7e9e4b5d1","observation_id":"7c76ed3c-2c4e-4e46-84a1-5b478ca39ff6","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.25212","last_updated":"2026-06-25T01:51:11Z","snapshot_observed_at":"2026-08-04T03:34:24.488076Z","submitted_at":"2026-04-28T04:30:55Z","title":"Noncrossing Duality and the Geometry of Positive Tropical Linear Spaces","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-01T09:23:20.044291Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.25212"},"observation_digest":"sha256:327744184fc32b4ec748aa37c4cdb67079cec5dcfb840d75a9824af2977b8d0d","observation_id":"92271494-216a-49d7-a05d-28c2a6d139ad","resolution":{"observed_at":"2026-07-01T09:25:39.921635Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2604.25213","last_updated":"2026-04-28T04:33:26Z","snapshot_observed_at":"2026-08-11T03:54:42.594461Z","submitted_at":"2026-04-28T04:33:26Z","title":"When the Forger Is the Judge: GPT-Image-2 Cannot Recognize Its Own Faked Documents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:17.319933Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2604.25213"},"observation_digest":"sha256:9cdd3904b22c25ee114fc934e57626daf4b05c687ca24cea945de681dbbaa07e","observation_id":"bd81b812-3647-492b-8910-0e72f0fd08fb","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.01311","last_updated":"2026-05-02T07:55:55Z","snapshot_observed_at":"2026-08-14T17:27:11.274779Z","submitted_at":"2026-05-02T07:55:55Z","title":"The Partial Testimony of Logs: Evaluation of Language Model Generation under Confounded Model Choice","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T14:30:58.313848Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.01311"},"observation_digest":"sha256:32f895e7e16c447ace61ba13032adf738d57a4396ed5c685ffd37b551e1e6f31","observation_id":"42bb5091-77d0-40b4-9126-0cd81c93d2a3","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.03472","last_updated":"2026-05-25T12:03:37Z","snapshot_observed_at":"2026-08-07T09:49:04.905679Z","submitted_at":"2026-05-05T07:56:20Z","title":"Auditing Stealth Sycophancy in Mental-Health Dialogue: Structured Clinical-State Diagnostics and Clean Matched Benchmarks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T00:23:36.245000Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.03472"},"observation_digest":"sha256:60ee981cffa8f51f993935e0eabf044b4d19248c58f3df9d7e27de2ce2bbd353","observation_id":"5585b901-868a-4eb7-8b74-35f06feef6c3","resolution":{"observed_at":"2026-07-01T00:25:09.454515Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.04539","last_updated":"2026-07-17T05:12:53Z","snapshot_observed_at":"2026-08-13T10:43:03.626016Z","submitted_at":"2026-05-06T06:36:09Z","title":"RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T16:57:49.396570Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.04539"},"observation_digest":"sha256:9b0042acb1f279e46a3d169eccf31fb63e2727250770aaaced80e576b10f0cc4","observation_id":"bd80a5bd-5a76-44e7-9ab9-29add114a840","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.04539","last_updated":"2026-07-17T05:12:53Z","snapshot_observed_at":"2026-08-13T10:43:03.626016Z","submitted_at":"2026-05-06T06:36:09Z","title":"RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T03:26:54.426050Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.04539"},"observation_digest":"sha256:c70b383387ff8f7a620bfbceed5bea519e8d078fa3da6327239d93f7ff93d6ca","observation_id":"84b2d1c8-e56d-405f-bc81-680bc3bec2ab","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.04539","last_updated":"2026-07-17T05:12:53Z","snapshot_observed_at":"2026-08-13T10:43:03.626016Z","submitted_at":"2026-05-06T06:36:09Z","title":"RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:08:39.328446Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.04539"},"observation_digest":"sha256:8ca2f34c4c22a34fa34dfec50bb76cd8c2c49e34d512a717b66b1728281c86c6","observation_id":"0df374ed-2447-44b8-af40-ff713cfc46ce","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T14:53:22.998757Z","title":"Bowman, and Shi Feng.LLM evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.04539","last_updated":"2026-07-17T05:12:53Z","snapshot_observed_at":"2026-08-13T10:43:03.626016Z","submitted_at":"2026-05-06T06:36:09Z","title":"RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:53:22.998757Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.04539"},"observation_digest":"sha256:1ff02fcc4928604d82cf123c65f8503b1b4fd46e12568541c1f89673499d9304","observation_id":"3a9ffa62-4e76-445e-a94f-ef20c61f42d8","resolution":{"observed_at":"2026-08-02T14:53:22.998757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.06390","last_updated":"2026-05-14T21:52:09Z","snapshot_observed_at":"2026-08-13T00:25:42.864465Z","submitted_at":"2026-05-07T15:06:37Z","title":"Automated alignment is harder than you think","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T09:47:05.526632Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.06390"},"observation_digest":"sha256:fe2632fb56cbdd73632d84bd7bc95e90fab604f8f77d04a62d7cc237e49c6ade","observation_id":"1a772f4b-7f63-44ca-84da-ab9c91adba96","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-12T16:29:47.459756Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:c1eef16db91776c158ae91e197db848877143eb7978a6a6dacea07e7da4f4c5a","observation_id":"c8c56dd2-ae08-41c1-a880-a984a517a4e2","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.14517","last_updated":"2026-05-14T08:00:23Z","snapshot_observed_at":"2026-08-14T18:30:26.694438Z","submitted_at":"2026-05-14T08:00:23Z","title":"Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T01:50:01.032543Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.14517"},"observation_digest":"sha256:6db738b19824d544bdd225563648640fe5b311ff92156e1eeced6f87f8a8840d","observation_id":"d9389ff7-0297-4d30-932e-5906c5000064","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.17554","last_updated":"2026-06-25T15:53:39Z","snapshot_observed_at":"2026-08-02T10:05:30.262076Z","submitted_at":"2026-05-17T17:32:52Z","title":"Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:58:47.229407Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.17554"},"observation_digest":"sha256:b1142410d7075b2ab15479a420b9cf454736cacd9cfae3168445d18d2450e1c2","observation_id":"dc9c9793-796b-4c6b-94c6-8d9f4300128d","resolution":{"observed_at":"2026-06-30T19:05:01.031097Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.19099","last_updated":"2026-05-18T20:37:14Z","snapshot_observed_at":"2026-08-12T18:16:41.897652Z","submitted_at":"2026-05-18T20:37:14Z","title":"DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T10:16:38.920528Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.19099"},"observation_digest":"sha256:7e936b85881d194237036a1e04535c9147388bf95582d0e9a7522ad8b5cea62e","observation_id":"03c187cb-2cb8-4f6d-b9de-c559218bc649","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.19220","last_updated":"2026-05-19T00:47:02Z","snapshot_observed_at":"2026-08-14T09:57:26.401962Z","submitted_at":"2026-05-19T00:47:02Z","title":"Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-20T06:53:44.993529Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.19220"},"observation_digest":"sha256:7ed4519e70338c8a3afe93b720a12bf9d55fb158ace659890f1ecb16181a57a4","observation_id":"1e9f3457-1218-40e9-991f-581a7c04d50c","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.19529","last_updated":"2026-05-19T08:30:39Z","snapshot_observed_at":"2026-08-02T04:47:49.542188Z","submitted_at":"2026-05-19T08:30:39Z","title":"Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T06:13:06.598618Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.19529"},"observation_digest":"sha256:87c494b00aed2ad6523209d9457d2fb514ff8aadb1597f9a7c98a8366c822e37","observation_id":"be36840e-8f59-4008-853d-320446c05b05","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.20312","last_updated":"2026-05-19T17:00:33Z","snapshot_observed_at":"2026-08-14T16:32:16.273991Z","submitted_at":"2026-05-19T17:00:33Z","title":"Pramana: A Protocol-Layer Treatment of Claim Verification in Autonomous Agent Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T02:10:13.030288Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.20312"},"observation_digest":"sha256:caf8c9c7317a99b83568c32ebcbcf7f38b5dc916a5057570e6cb39fe5a9ea1e2","observation_id":"086b1bbf-d5c1-4c91-9528-cb556e90c2df","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.22502","last_updated":"2026-05-21T13:54:11Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T13:54:11Z","title":"Compiling Agentic Workflows into LLM Weights: Near-Frontier Quality at Two Orders of Magnitude Less Cost","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-22T06:26:31.841138Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.22502"},"observation_digest":"sha256:e510eeee679020328c65c773582d338d6ec07d562ca3c5b92329a399bbd9f5ab","observation_id":"d4871818-cf6b-4abf-8172-bddee35d49a2","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.22714","last_updated":"2026-06-09T17:40:55Z","snapshot_observed_at":"2026-08-03T02:17:57.312538Z","submitted_at":"2026-05-21T16:51:04Z","title":"AMEL: Accumulated Message Effects on LLM Judgments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T05:08:30.607268Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.22714"},"observation_digest":"sha256:94add58b363abc5efb6b5286e84d4a123726f348dcec58cb8ab4a58317ae1b43","observation_id":"4602ff13-cb26-43ab-ac7d-c4c35a43d82e","resolution":{"observed_at":"2026-05-22T18:44:28.909456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.22714","last_updated":"2026-06-09T17:40:55Z","snapshot_observed_at":"2026-08-03T02:17:57.312538Z","submitted_at":"2026-05-21T16:51:04Z","title":"AMEL: Accumulated Message Effects on LLM Judgments","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T17:04:22.688250Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.22714"},"observation_digest":"sha256:ed8c62cf2ab218dabc154b5f421c7929f67b64e9bef09a42feb38e075a5900ef","observation_id":"224160ec-611c-4dd2-8bfc-bce2f95a16d5","resolution":{"observed_at":"2026-06-30T17:04:56.460770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.25652","last_updated":"2026-06-16T07:14:34Z","snapshot_observed_at":"2026-08-14T12:45:58.215955Z","submitted_at":"2026-05-25T09:58:28Z","title":"A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.25652"},"observation_digest":"sha256:c6a7be691a4b5e8e9a885df09a4bd59ddbc57e4086b4a806dfd1b1a88790ddb3","observation_id":"f0fccc42-0e8b-4263-ad5b-51cebae75a85","resolution":{"observed_at":"2026-06-29T22:13:59.045484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.26400","last_updated":"2026-05-26T00:08:21Z","snapshot_observed_at":"2026-08-14T19:49:49.538673Z","submitted_at":"2026-05-26T00:08:21Z","title":"Plans for Evaluating Structured Generative Search Summaries","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T16:26:58.658036Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.26400"},"observation_digest":"sha256:c9fa5962938b1a1d9b58cf6ca3dd2bb0b67c4075f2741a08b45b1959179674e5","observation_id":"5d1384b0-29d4-42e9-9394-7b9f78a1df6d","resolution":{"observed_at":"2026-06-29T16:33:39.098123Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.26918","last_updated":"2026-05-26T12:16:41Z","snapshot_observed_at":"2026-08-12T23:53:10.937634Z","submitted_at":"2026-05-26T12:16:41Z","title":"Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T18:17:52.284353Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.26918"},"observation_digest":"sha256:676db435d45b6637941a96e34575ef0d4ec821b68d7cf62d0ae5f2308af99d3f","observation_id":"ca11954a-5440-4534-a444-be37301db93d","resolution":{"observed_at":"2026-06-29T18:23:50.870842Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.27249","last_updated":"2026-05-26T16:27:07Z","snapshot_observed_at":"2026-08-10T07:16:17.675003Z","submitted_at":"2026-05-26T16:27:07Z","title":"Gumbel Machine: Counterfactual Student Writing Generation via Gumbel Noise Steering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T16:47:30.514271Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.27249"},"observation_digest":"sha256:d9eb004ab38685d911c75c26ecfcf05ed9582bad3b8528b3d59d824034647a63","observation_id":"aac68ec3-2357-412c-af72-2410bce24d70","resolution":{"observed_at":"2026-06-29T16:53:40.892169Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.27914","last_updated":"2026-06-09T02:24:01Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T03:41:11Z","title":"Does Capability Transfer to Subjective Behavior -- and Would Our Instruments Tell Us? A Self-Evolving, Trust-by-Construction Evaluation Paradigm","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-29T12:54:36.818698Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.27914"},"observation_digest":"sha256:2e3b6fd129f62bc9f70858766b1a437533c46e1ea0bf7ae089a55e103d9f6142","observation_id":"f9458aa7-00b6-4ba5-aa06-3e9c3e730ffd","resolution":{"observed_at":"2026-06-29T13:03:26.708876Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.28183","last_updated":"2026-06-30T13:35:37Z","snapshot_observed_at":"2026-08-08T00:42:34.699734Z","submitted_at":"2026-05-27T09:03:59Z","title":"BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:07.673561Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.28183"},"observation_digest":"sha256:98a2e6e53cf07de647f18f447a989773fea74a4df0f94a12d94052ef7328b4a3","observation_id":"612f9d56-5b7b-46e9-b572-d33c35edc7f3","resolution":{"observed_at":"2026-06-29T12:53:26.595076Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2605.28183","last_updated":"2026-06-30T13:35:37Z","snapshot_observed_at":"2026-08-08T00:42:34.699734Z","submitted_at":"2026-05-27T09:03:59Z","title":"BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T07:59:42.981532Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2605.28183"},"observation_digest":"sha256:74df45ff8361701bea2999f869e2a84cac3568c2d635fcc59a9d2ca75fa97ba0","observation_id":"76640b33-bdb6-4b2e-bdd6-6760516ccf37","resolution":{"observed_at":"2026-07-01T08:05:31.149817Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.04923","last_updated":"2026-08-12T03:06:52Z","snapshot_observed_at":"2026-08-14T21:13:06.851314Z","submitted_at":"2026-06-03T14:18:23Z","title":"Reproducing, Analyzing, and Detecting Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T07:28:09.142557Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.04923"},"observation_digest":"sha256:e7587555dc176e3629a06cab3ff790ed6d43c9c3fe45e3939c659b66d00d42a5","observation_id":"0c048db2-ceb2-4b26-9b35-27f32a6b8f03","resolution":{"observed_at":"2026-07-02T06:16:43.747093Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.05443","last_updated":"2026-06-03T21:06:01Z","snapshot_observed_at":"2026-08-12T15:52:17.199570Z","submitted_at":"2026-06-03T21:06:01Z","title":"MIRAI: Prediction and Generation of High-Impact Academic Research","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T02:29:38.654022Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.05443"},"observation_digest":"sha256:c09ef3bf37a085187002b7354b3c5ccd2162c7c6f3944bff8146e37801ea7491","observation_id":"993b4273-bacb-4f2c-b3da-ac882ca7ee59","resolution":{"observed_at":"2026-07-02T12:06:55.988288Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.05901","last_updated":"2026-07-22T08:48:51Z","snapshot_observed_at":"2026-08-12T12:43:35.191260Z","submitted_at":"2026-06-04T09:07:06Z","title":"Reducing Hallucinations in Complex Question Answering using Simple Graph-based Retrieval-Augmented Generation (long version)","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T01:15:20.867740Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.05901"},"observation_digest":"sha256:01ddb05a00edfd51c0c2eff482c49003bac8fcbb896d8ae65e29d17692e51fc3","observation_id":"f52edc08-0430-40ac-9ac5-bba9bbaeb894","resolution":{"observed_at":"2026-07-02T13:26:59.396726Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T12:21:42.740103Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05901","last_updated":"2026-07-22T08:48:51Z","snapshot_observed_at":"2026-08-12T12:43:35.191260Z","submitted_at":"2026-06-04T09:07:06Z","title":"Reducing Hallucinations in Complex Question Answering using Simple Graph-based Retrieval-Augmented Generation (long version)","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T12:21:42.740103Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.05901"},"observation_digest":"sha256:667ed796f025b8a5e9431563334996fcc1e8d58924708f7775b9e5c73066fc6e","observation_id":"6bc326df-a6e9-42cf-ae0d-0403ce696e1c","resolution":{"observed_at":"2026-08-02T12:21:42.740103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.20093","last_updated":"2026-06-18T11:12:46Z","snapshot_observed_at":"2026-08-11T09:10:30.046949Z","submitted_at":"2026-06-18T11:12:46Z","title":"Self-Preference Is Weak or Absent in Verifiable Instruction-Following Revision: A Four-Model Test Under Genuine Authorship","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T17:26:22.687010Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.20093"},"observation_digest":"sha256:2547b4e6c787591cc49495a697d3bfcbf3a8e231cc13b8ed46de5edbea8930b4","observation_id":"f1b2ea92-b418-4767-9c43-48bde695430c","resolution":{"observed_at":"2026-07-04T03:59:33.325115Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.22329","last_updated":"2026-06-21T04:35:43Z","snapshot_observed_at":"2026-07-31T23:50:31.635694Z","submitted_at":"2026-06-21T04:35:43Z","title":"BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T11:06:07.303335Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.22329"},"observation_digest":"sha256:5c2386813d674d938a57d2c14b81f5f709a0f971d8fd799ef6a240ea2ac06ae7","observation_id":"c92eec94-0e14-465b-80b7-70387c349623","resolution":{"observed_at":"2026-07-04T08:49:41.502683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-12T17:43:10.201466Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":2},"reference_index":207,"source":"arxiv_source","source_observed_at":"2026-06-26T09:19:50.623741Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:a4ad526fc46c7e5863c0f83d95955abb248b924f09d8f101b4f22efafc75f574","observation_id":"c2d4a730-8c8d-4242-b191-cd558e79200b","resolution":{"observed_at":"2026-07-04T09:59:44.859847Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-12T17:43:10.201466Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":3},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-06-29T01:18:19.195007Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:e0fdcfce8bc60b03ed05d6aa56b9840da51a6d1deca9457f66cdd97acbaba1e2","observation_id":"e98114e5-c12e-4aaf-b6c4-49f6d4fb1000","resolution":{"observed_at":"2026-07-01T18:55:59.685310Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.23164","last_updated":"2026-06-22T11:05:11Z","snapshot_observed_at":"2026-07-06T23:57:57.606047Z","submitted_at":"2026-06-22T11:05:11Z","title":"Same question, different history: language, national identity, and credit in large language models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T08:35:08.947990Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.23164"},"observation_digest":"sha256:95af4b4d20b831208cbeb8267daeda61f3ace684ddf8b5d096866221cb93e70c","observation_id":"7d6d7bdd-aa01-4fa1-9990-692e1e358d81","resolution":{"observed_at":"2026-07-04T10:39:45.890306Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.23403","last_updated":"2026-06-22T14:26:48Z","snapshot_observed_at":"2026-08-02T14:06:38.475602Z","submitted_at":"2026-06-22T14:26:48Z","title":"Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T08:16:51.419186Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.23403"},"observation_digest":"sha256:e476cb819793ef482a81460fdc511cf42839a37c6da5a1237f41b1d6a4e51cb4","observation_id":"fe034b2e-076a-4f39-80f7-6982ff3fc2ce","resolution":{"observed_at":"2026-07-04T10:59:46.352976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.24026","last_updated":"2026-06-23T00:04:31Z","snapshot_observed_at":"2026-08-02T11:37:58.639463Z","submitted_at":"2026-06-23T00:04:31Z","title":"Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T00:47:00.310205Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.24026"},"observation_digest":"sha256:794525017b6af93ff058c57a7f8648f1ee8414f4641d766604f46dd6dda60209","observation_id":"52dfce92-da63-4df8-a78d-5f6854a86556","resolution":{"observed_at":"2026-07-04T16:19:57.636033Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.29280","last_updated":"2026-06-28T08:58:17Z","snapshot_observed_at":"2026-08-08T09:21:20.952164Z","submitted_at":"2026-06-28T08:58:17Z","title":"Deterministic Decisions for High-Stakes AI. A Zero-Egress Pipeline with the Deployability of RAG and the Accuracy of Machine Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T08:06:18.672841Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.29280"},"observation_digest":"sha256:2a71e427489e28db5ba099ee70dde4ae423c04f72f7b40dd1f49933f05b075b5","observation_id":"b95f64ae-201f-41c2-833a-c69eae1ee06e","resolution":{"observed_at":"2026-06-30T08:14:25.793313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.30256","last_updated":"2026-06-29T13:05:43Z","snapshot_observed_at":"2026-08-12T14:52:35.440376Z","submitted_at":"2026-06-29T13:05:43Z","title":"EMPATH: A Multilingual Auditor-Judge Benchmark for Safety Evaluation of Emotional-Support Chatbots","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T06:09:32.771308Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.30256"},"observation_digest":"sha256:653ace4d69e771f9ac94740ba8ad97c8cc3246f019208591ac50335c9d3c6a0e","observation_id":"57dcb337-3dba-4f3d-bc30-e937444b6dab","resolution":{"observed_at":"2026-06-30T06:14:18.003107Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2606.30556","last_updated":"2026-06-29T16:51:31Z","snapshot_observed_at":"2026-08-07T13:43:00.994295Z","submitted_at":"2026-06-29T16:51:31Z","title":"Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-30T05:59:58.183264Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2606.30556"},"observation_digest":"sha256:5fd684d119bb0c345f0430ee9b0e4206bd5240afa4e8ec3e4ffa99e7daa053af","observation_id":"3a8b2b1a-4bb8-476a-beb4-73b75ee05a76","resolution":{"observed_at":"2026-06-30T06:04:21.542266Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2607.01152","last_updated":"2026-07-02T01:52:53Z","snapshot_observed_at":"2026-08-07T23:31:57.854748Z","submitted_at":"2026-07-01T16:31:11Z","title":"AGC-Bench: Measuring Artificial General Creativity","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-02T12:33:53.029578Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.01152"},"observation_digest":"sha256:f51b3fe8ad0a8065d360e6735a7394e62e8b8ed1c3ffeed3cdf11d2ad41794bf","observation_id":"eac85c47-0c14-49f1-a73a-0f7a6ec6b203","resolution":{"observed_at":"2026-07-02T12:36:56.078980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2607.01152","last_updated":"2026-07-02T01:52:53Z","snapshot_observed_at":"2026-08-07T23:31:57.854748Z","submitted_at":"2026-07-01T16:31:11Z","title":"AGC-Bench: Measuring Artificial General Creativity","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-03T21:25:14.030920Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.01152"},"observation_digest":"sha256:2c87d823620e0780e4a3a2f5420b37f0910feed097951c4aef5e035b88bd77eb","observation_id":"20cf4520-2494-4af9-95fb-95fd090a7aec","resolution":{"observed_at":"2026-07-03T21:28:58.100940Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-11T04:31:30.304599Z","title":"LLM evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05638","last_updated":"2026-07-06T20:58:49Z","snapshot_observed_at":"2026-08-11T15:51:16.293041Z","submitted_at":"2026-07-06T20:58:49Z","title":"EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-11T04:31:30.304599Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.05638"},"observation_digest":"sha256:65de66d14758bb5049796cd06ceca5ee55aa03178596cbc877d39db350bb5c3f","observation_id":"fb9b4ffe-3174-4067-8e82-d2a3d73095a1","resolution":{"observed_at":"2026-07-11T04:31:30.304599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2607.08065","last_updated":"2026-07-28T19:32:36Z","snapshot_observed_at":"2026-08-07T16:08:54.727583Z","submitted_at":"2026-07-09T02:46:51Z","title":"When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-10T00:56:31.193905Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.08065"},"observation_digest":"sha256:87d11c6d3bb34d913efeed313819178e8cc137ba0c3e1ee32aa3d4888869456d","observation_id":"d12c5f09-2d28-41b5-9b0a-af4ef3273d9b","resolution":{"observed_at":"2026-07-10T00:56:40.949844Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T07:59:16.438403Z","title":"and Feng, Shi , booktitle =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08065","last_updated":"2026-07-28T19:32:36Z","snapshot_observed_at":"2026-08-07T16:08:54.727583Z","submitted_at":"2026-07-09T02:46:51Z","title":"When LLMs Agree, Are They Right? Auditing Self-Consistency and Cross-Model Agreement as Confidence Signals","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T07:59:16.438403Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.08065"},"observation_digest":"sha256:a891b4c955153f520d5860f044196d9d9ff5f809a02f3eef6cf7d534a77ad200","observation_id":"6f5c6fd4-a7d4-42c4-bb3d-51443e668ded","resolution":{"observed_at":"2026-08-02T07:59:16.438403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2607.08066","last_updated":"2026-07-09T02:48:36Z","snapshot_observed_at":"2026-08-13T03:24:37.270410Z","submitted_at":"2026-07-09T02:48:36Z","title":"Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-07-10T00:52:47.537142Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.08066"},"observation_digest":"sha256:9532e5882a4c9c6dc9719def898632ce45deeec4117d7941c253520991e1392d","observation_id":"dabcdac3-ffb5-45fd-9477-fe485d4f41f5","resolution":{"observed_at":"2026-07-10T00:56:41.062491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":"2404.13076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-10T10:27:02.394079Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","venue":"cs.CL","work_id":"ec9ad2bb-47a2-46c7-b8e9-05f69142decd","year":2024},"citing_paper":{"arxiv_id":"2607.08268","last_updated":"2026-07-09T09:10:49Z","snapshot_observed_at":"2026-08-13T01:43:32.835279Z","submitted_at":"2026-07-09T09:10:49Z","title":"Different Teachers, Different Capabilities: Sub-1B On-Device Distillation for Structured Text Enrichment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T10:20:46.103409Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.08268"},"observation_digest":"sha256:e12b4ee3db52ce0ce752330e67c9c74220337fe61fd5fbb7f1ab8f3e33a2dc23","observation_id":"8d280af0-842a-48a9-b803-0013f8727146","resolution":{"observed_at":"2026-07-10T10:27:02.395348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T07:44:08.574095Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09306","last_updated":"2026-07-30T11:40:45Z","snapshot_observed_at":"2026-08-14T10:58:50.041021Z","submitted_at":"2026-07-10T11:39:40Z","title":"Exposure is not manifestation: measurement target and output resolution jointly determine which behavioural-faithfulness evaluator wins","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T07:44:08.574095Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.09306"},"observation_digest":"sha256:703decbc1b0c1e82ad0b93d13a1e8f3910d91064525fc642c646c9d01865df27","observation_id":"b6db7c52-4cb7-4940-8b8b-7490af6ffdea","resolution":{"observed_at":"2026-08-02T07:44:08.574095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-13T03:00:51.318412Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09438","last_updated":"2026-07-10T14:09:04Z","snapshot_observed_at":"2026-08-13T12:49:40.220419Z","submitted_at":"2026-07-10T14:09:04Z","title":"Test-Time Scaling for Small VLMs on Multilingual Visual MCQ","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T03:00:51.318412Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.09438"},"observation_digest":"sha256:b44b3964dbc968cfec22f456e589f294bfeeb6d96bd595b92c7651fb09eafa74","observation_id":"b9547897-a3d4-4137-8cd2-34840a19cedd","resolution":{"observed_at":"2026-07-13T03:00:51.318412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-14T01:18:31.914413Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09979","last_updated":"2026-07-10T21:09:01Z","snapshot_observed_at":"2026-08-14T10:48:11.673852Z","submitted_at":"2026-07-10T21:09:01Z","title":"Using LLMs to Adjudicate Static-Analysis Alerts with Error Reduction Techniques","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T01:18:31.914413Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.09979"},"observation_digest":"sha256:d69e331c07c14dd1e3e13507cdb4f170ff305fa5d6975e03bcddcc36ae51408e","observation_id":"a867c62c-c34c-4039-b64c-6050286e24eb","resolution":{"observed_at":"2026-07-14T01:18:31.914413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-07-14T06:40:17.865408Z","title":"Panickssery, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11151","last_updated":"2026-07-13T06:46:56Z","snapshot_observed_at":"2026-08-14T14:59:10.783998Z","submitted_at":"2026-07-13T06:46:56Z","title":"AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T06:40:17.865408Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.11151"},"observation_digest":"sha256:069fb8c08da4088aec5998e44531b529d0d8d39b09dcc2fb0ad64517b932f348","observation_id":"45b5ff09-409e-4fe8-aadf-9ec1e549ff9c","resolution":{"observed_at":"2026-07-14T06:40:17.865408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-02T01:21:37.369091Z","title":"Panickssery, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14713","last_updated":"2026-07-16T08:24:27Z","snapshot_observed_at":"2026-08-10T18:20:32.897512Z","submitted_at":"2026-07-16T08:24:27Z","title":"Does Multi-Agent Debate Improve AI Feedback on Research Papers?","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T01:21:37.369091Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.14713"},"observation_digest":"sha256:290075d9d983d2df78637dc9e3394f09c2d19840691a5eb2ed09342c4426a56b","observation_id":"a788b32a-97bc-4c67-8963-7817758cecf1","resolution":{"observed_at":"2026-08-02T01:21:37.369091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-01T23:43:08.913869Z","title":"2404.13076 , archiveprefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15277","last_updated":"2026-07-16T17:59:31Z","snapshot_observed_at":"2026-08-13T02:49:08.522823Z","submitted_at":"2026-07-16T17:59:31Z","title":"Partition, Prompt, Aggregate: Statistical Self-Consistency in Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T23:43:08.913869Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2607.15277"},"observation_digest":"sha256:7b462eb5717759bc8e5a871aaa7fb549ec260d56e16b57212b4d6d20778ea551","observation_id":"2c6e025c-a15a-4108-849f-d1a3973c8ea3","resolution":{"observed_at":"2026-08-01T23:43:08.913869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.13076/citation-record","integrity":"/paper/2404.13076/integrity","json":"/paper/2404.13076/citation-record.json","paper":"/paper/2404.13076"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13712","last_updated":"2024-07-02T01:39:50Z","snapshot_observed_at":"2026-08-13T11:35:56.536586Z","submitted_at":"2023-05-23T05:59:21Z","title":"Knowledge of Knowledge: Exploring Known-Unknowns Uncertainty with Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.13712","doi":"10.48550/arxiv.2305.13712","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.13712","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Knowl- edge of knowledge: Exploring known-unknowns un- certainty with large language models","venue":"arXiv (Cornell University)","work_id":"e271ab52-56a6-48f1-a7a0-b9eb17240520","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2305.13712","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:8cf149b82a36bc898eb8d1c466115770685171101edc3caeea210dc65ec2d2c6","observation_id":"dcc07dca-9d29-43a7-8dd4-6c5cc3e93b96","resolution":{"observed_at":"2026-05-22T18:44:28.852504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:b969b783bb38a79c218fb02266b2da09dfd75edaf45770becd44b61930357f6d","observation_id":"51465281-ecae-4508-998e-3f7b72b3479a","resolution":{"observed_at":"2026-05-22T18:44:28.845174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00667","last_updated":"2023-09-01T17:27:37Z","snapshot_observed_at":"2026-08-13T10:22:28.516325Z","submitted_at":"2023-09-01T17:27:37Z","title":"Taken out of context: On measuring situational awareness in LLMs","version":1},"cited_work":{"arxiv_id":"2309.00667","doi":"10.48550/arxiv.2309.00667","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00667","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C., Balesni, M., Kaufmann, M., Tong, M., Korbak, T., Kokotajlo, D., and Evans, O","venue":"arXiv (Cornell University)","work_id":"da8f7a2a-8d4a-4152-8afc-3a06710f511f","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2309.00667","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:373f082dd75a304cf0412d80542cc9012250de0fb30edd423627e47870885513","observation_id":"e6899d29-4ce0-417e-8f85-ca0c29b0360c","resolution":{"observed_at":"2026-05-22T18:44:28.849090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06595","last_updated":"2023-12-26T15:57:47Z","snapshot_observed_at":"2026-08-13T10:35:33.038752Z","submitted_at":"2023-08-12T15:27:51Z","title":"VisIT-Bench: A Benchmark for Vision-Language Instruction Following Inspired by Real-World Use","version":4},"cited_work":{"arxiv_id":"2308.06595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.06595","snapshot_observed_at":"2026-07-04T08:49:42.520344Z","title":"Visit-bench: A benchmark for vision-language instruction following inspired by real-world use","venue":null,"work_id":"43af94c6-d4f4-4441-a85d-3c252dc55850","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2308.06595","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:5071f25276a97ab9439a5886befcdf63c75d8e33bd52553f519c846b1b7daca0","observation_id":"645e2664-f561-446e-b5f4-cb4fb8d7985d","resolution":{"observed_at":"2026-05-22T18:44:28.800274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1037/h0057532","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.1037/h0057532","venue":"Journal of Applied Psychology","work_id":"e634ddc2-97ab-4aa9-8b11-99dd4080c4a6","year":1948},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:45fb45ce22b336cd83dcc3d1254ffd4cf0ecb19f7dc50962fcb84635e9812fcb","observation_id":"fdb6f66e-2cf4-4ca9-9fda-67092216283b","resolution":{"observed_at":"2026-05-22T18:44:28.792101Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":"2302.04166","doi":"10.48550/arxiv.2302.04166","metadata_source":"pith","pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPTScore: Evaluate as You Desire","venue":"cs.CL","work_id":"13d9a137-d114-4c30-aa62-3b8d25d9eb7c","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:fc3e594a5c5cee5d551daa870cb4e41987fce0b87e749b6534a61626c13d4aff","observation_id":"009d39b9-0577-47c3-a4e4-3805523c6671","resolution":{"observed_at":"2026-05-22T18:44:28.804592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.889027+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.889027+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3389/feduc.2023","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"doi: 10.3389/feduc.2023","venue":null,"work_id":"67efa670-3047-43c4-a5cd-58148c1ce430","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:3bbff20ecca3f72b5107df92ef9debfcaac08f9ff172cc68295f8ff8e7eb082f","observation_id":"702d8014-845d-46e6-98f1-9a2cd8c3a526","resolution":{"observed_at":"2026-05-22T18:44:28.794619Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01314","last_updated":"2020-11-02T20:59:26Z","snapshot_observed_at":"2026-08-09T10:56:58.271928Z","submitted_at":"2020-11-02T20:59:26Z","title":"Automatic Detection of Machine Generated Text: A Critical Survey","version":1},"cited_work":{"arxiv_id":"2011.01314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.01314","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jawahar, G., Abdul-Mageed, M., and Lakshmanan, L","venue":null,"work_id":"4ea59dc6-153f-46a2-8589-0c744678c2bf","year":2011},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2011.01314","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:055b4c9e3cb7f86fed72a3b125e651ab046bd77f886615fae6f61cd62001f069","observation_id":"54824b3e-a20f-4d0c-b65f-0cc98bde91f4","resolution":{"observed_at":"2026-05-22T18:44:28.809325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":"2207.05221","doi":"10.1145/3618260.3649777","metadata_source":"pith","pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models (Mostly) Know What They Know","venue":"cs.CL","work_id":"8ca58a10-da41-4f70-baae-7e449512e345","year":2022},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:7aa54884035c6b16a58f7c932e27816c7aaa86362be948b98c919c766abd78af","observation_id":"1dcfae41-a0d0-4958-86b7-7ad8b65c6949","resolution":{"observed_at":"2026-05-22T18:44:28.812968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T07:53:13.382372+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17012","last_updated":"2024-09-25T16:57:20Z","snapshot_observed_at":"2026-08-13T10:02:41.448203Z","submitted_at":"2023-09-29T06:53:10Z","title":"Benchmarking Cognitive Biases in Large Language Models as Evaluators","version":3},"cited_work":{"arxiv_id":"2309.17012","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.17012","snapshot_observed_at":"2026-07-07T12:53:50.367532Z","title":"I., Kim, Z","venue":"cs.CL","work_id":"4ade443e-5ed6-40cd-8063-e42ffa273080","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2309.17012","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:9abab9ca25be982468338330a0d1e33969cd8e6adc43b23005eb9325360da887","observation_id":"f899883b-0a27-470b-8d38-f46471bf40bf","resolution":{"observed_at":"2026-05-22T18:44:28.816877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01152","last_updated":"2024-03-02T09:39:13Z","snapshot_observed_at":"2026-08-14T18:18:00.401919Z","submitted_at":"2024-03-02T09:39:13Z","title":"A Survey of AI-generated Text Forensic Systems: Detection, Attribution, and Characterization","version":1},"cited_work":{"arxiv_id":"2403.01152","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.01152","snapshot_observed_at":"2026-07-04T17:40:00.590102Z","title":"A survey of ai-generated text forensic systems: Detection, attribution, and characteriza- tion","venue":null,"work_id":"ae38cbfb-9045-42fe-9970-f9095f2f28bf","year":2024},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2403.01152","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:34816cf681853efd2094c83a94ca88eb34583ebd43ae7739daa28c9e12dc0aaf","observation_id":"8c3b4fca-8c02-4bb3-9d92-43b1627d2c44","resolution":{"observed_at":"2026-05-22T18:44:28.820895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-14T19:30:52.458536Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":"2309.00267","doi":"10.48550/arxiv.2309.00267","metadata_source":"pith","pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","venue":"cs.CL","work_id":"81d8781d-2933-4e89-97ee-9bbfc6d4ca0c","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:68608d58ad8c1c3a2316c58e92b2bb84daf8d059cf87da0d43464f79b1e851db","observation_id":"fff6c62b-8db7-43c0-a1a7-62905b091570","resolution":{"observed_at":"2026-05-22T18:44:28.825111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07871","last_updated":"2018-11-19T18:48:04Z","snapshot_observed_at":"2026-08-14T17:56:37.514110Z","submitted_at":"2018-11-19T18:48:04Z","title":"Scalable agent alignment via reward modeling: a research direction","version":1},"cited_work":{"arxiv_id":"1811.07871","doi":"10.48550/arxiv.1811.07871","metadata_source":"pith","pith_arxiv_id":"1811.07871","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable agent alignment via reward modeling: a research direction","venue":"cs.LG","work_id":"1e9c4f6d-b369-4bd2-8e6e-1ec00318c924","year":2018},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/1811.07871","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:62fc71f2187883358114a4957349d5cee0b1da5c3de1b03ad8170eb4947e9064","observation_id":"cb019c6b-8076-4151-a9e9-5fb79ce59bcc","resolution":{"observed_at":"2026-05-22T18:44:28.828850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"original-date: 2023-05- 25T09:35:28Z","venue":null,"work_id":"5c3632d6-d55e-41e9-9052-67641e895f0e","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:d9be2ee0fc5e68ac73b0dfa49b4084fde8a4f5e8562034e48740d7358e5e53af","observation_id":"d2851bc6-048b-4ff5-8ed3-3ad223b0d344","resolution":{"observed_at":"2026-05-22T18:44:28.908782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09766","last_updated":"2024-06-07T09:41:36Z","snapshot_observed_at":"2026-08-14T09:54:51.219287Z","submitted_at":"2023-11-16T10:43:26Z","title":"LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores","version":4},"cited_work":{"arxiv_id":"2311.09766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.09766","snapshot_observed_at":"2026-07-07T12:53:50.204969Z","title":"Llms as narcissistic evaluators: When ego inflates evaluation scores, 2024 b","venue":"cs.CL","work_id":"78b2f05f-bf08-4c50-83e9-84526d25af2d","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2311.09766","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:7f8e59ef13531429e2c6fec5c556cb0c4d32bf046d20c795664b684b9a3ee0ec","observation_id":"d2160a96-009f-4a07-81c8-52bb9ac2f147","resolution":{"observed_at":"2026-05-22T18:44:28.834486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-08-12T13:30:30.615172Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":"2303.17651","doi":"10.1007/s10664-008-","metadata_source":"pith","pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":"cs.CL","work_id":"59181e7f-e58e-45d3-8146-4477a9f53d5a","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:69b057986d822c505635c6ba8ef618824c54b9966762abb72252ecb17684d5a9","observation_id":"29194dcf-ade2-4c4c-8384-ae1fbbaa8982","resolution":{"observed_at":"2026-05-22T18:44:28.838271Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/k16-1028","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/K16-1028","venue":null,"work_id":"c6848274-3353-4417-9ad4-b34ccead1119","year":2016},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:2f264d68f5825dd3df3d1c6fd39c02e56b44ee7480f4c80aa157e9e0bfb01527","observation_id":"80d8964d-6ab0-4501-92ff-6e823b96f15c","resolution":{"observed_at":"2026-05-22T18:44:28.787534Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-08-14T18:36:49.421687Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":"1808.08745","doi":"10.48550/arxiv.1808.08745","metadata_source":"pith","pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","venue":"cs.CL","work_id":"83dfe48d-b12e-425e-a8c9-d62ac86d1373","year":2018},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:4e437052b058f4ea005f73ef961f3e3668ad3b09dd28e43b35322efb879c1a77","observation_id":"a2a9abef-832b-469f-8455-021f8dfc1a48","resolution":{"observed_at":"2026-05-22T18:44:28.855759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:d61af80baae776d23c3cdf4f3296822ff593782066a30f7d266f163f1c005f84","observation_id":"095a6bf5-3ce4-4e29-ac5e-e8b24df512bb","resolution":{"observed_at":"2026-05-22T18:44:28.858878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06627","last_updated":"2024-06-06T21:39:09Z","snapshot_observed_at":"2026-08-14T11:41:26.368212Z","submitted_at":"2024-02-09T18:59:29Z","title":"Feedback Loops With Language Models Drive In-Context Reward Hacking","version":3},"cited_work":{"arxiv_id":"2402.06627","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.06627","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feed- back loops with language models drive in-context reward hacking","venue":null,"work_id":"f19be27e-f4fb-4d21-8325-7c08c5fab196","year":2024},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2402.06627","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:fef36b4af8547ef7613c919bc2775f513a1f7d6d92cef70f329960a555a28bc3","observation_id":"d582b9b6-d5ed-4597-91f2-37a359ee5adf","resolution":{"observed_at":"2026-05-22T18:44:28.862606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08576","last_updated":"2023-11-14T22:45:44Z","snapshot_observed_at":"2026-08-13T05:25:13.418007Z","submitted_at":"2023-11-14T22:45:44Z","title":"Towards Evaluating AI Systems for Moral Status Using Self-Reports","version":1},"cited_work":{"arxiv_id":"2311.08576","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08576","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dillon Plunkett, Adam Morris, Keerthi Reddy, and Jorge Morales","venue":null,"work_id":"fa455f6b-67c3-47a4-b203-4ed2425c0bf2","year":2025},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2311.08576","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:73662db61d3d2f8090b09b204b1c39ff64f30772243790f780a0f885ab96e8f6","observation_id":"8b7a79d1-ea2a-4d6e-b455-5176afe3af84","resolution":{"observed_at":"2026-05-22T18:44:28.866163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11483","last_updated":"2023-08-22T14:54:59Z","snapshot_observed_at":"2026-08-13T10:29:39.390654Z","submitted_at":"2023-08-22T14:54:59Z","title":"Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions","version":1},"cited_work":{"arxiv_id":"2308.11483","doi":"10.48550/arxiv.2308.11483","metadata_source":"pith","pith_arxiv_id":"2308.11483","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv:2308.11483 [cs]","venue":"cs.CL","work_id":"dc1c3724-8cc1-4cd1-b54a-1e63446b90c3","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2308.11483","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:c10c777d0a9e0b61d97bce83e20cf0a41bbc6ded6a52093cdfa32002f04ab981","observation_id":"f9a0386e-0bc0-4eac-97a0-b2285f92fbad","resolution":{"observed_at":"2026-05-22T18:44:28.869826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-08-13T17:24:30.719766Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:d7ccfe39324c2a10a63eb60d8ab5c464b855d3909cfc94fde3a39c76dddabf1b","observation_id":"5366f98b-251d-442b-82df-442143ec8918","resolution":{"observed_at":"2026-05-22T18:44:28.873093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07611","last_updated":"2023-10-22T00:37:06Z","snapshot_observed_at":"2026-08-14T07:01:47.500494Z","submitted_at":"2023-10-11T15:56:00Z","title":"Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models","version":2},"cited_work":{"arxiv_id":"2310.07611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.07611","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2310.07611 [cs]","venue":null,"work_id":"3a60ab26-3636-4d3b-bf70-b3e54df0f9b6","year":null},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2310.07611","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:18cfaf97b214bbbb697935d5eb3a4a8c367adc4fa56c203b5ff3d84f0aa22923","observation_id":"3cf4097b-9dce-4f2d-aa9a-407bb4794189","resolution":{"observed_at":"2026-05-22T18:44:28.876395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":"2206.04615","doi":"10.1162/tacl_a_00688","metadata_source":"pith","pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","venue":"cs.CL","work_id":"bb63abb3-0d50-4362-b97c-b5e725b03b39","year":2022},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:ab5f72ae7835b83f8fe3ac5c3de6fa094319127b548b97a472f72aaa65ee9822","observation_id":"bc9ed97e-d90f-4a90-99fe-84a9c60fcef2","resolution":{"observed_at":"2026-05-22T18:44:28.879481Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:b54268c07a0d0756c01068edf0b811b1542491f1f28c656f6949c42671e85075","observation_id":"5349df24-9bfb-4cd8-a64d-f8a025190f46","resolution":{"observed_at":"2026-05-22T18:44:28.882961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07529","last_updated":"2024-06-01T06:14:37Z","snapshot_observed_at":"2026-08-14T05:10:18.713276Z","submitted_at":"2024-01-15T08:19:22Z","title":"MM-SAP: A Comprehensive Benchmark for Assessing Self-Awareness of Multimodal Large Language Models in Perception","version":3},"cited_work":{"arxiv_id":"2401.07529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.07529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-sap: A comprehensive benchmark for assessing self-awareness of multimodal large language models in perception","venue":null,"work_id":"16879219-6fcc-45ad-b842-934dbf6be18f","year":2024},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2401.07529","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:56e04a6b8972c9554d747c978c1f6a5cd35abc0a710c2b30ca7a32ddc87d1dd5","observation_id":"c6838485-6b2c-4ede-bb90-d3c423c6922f","resolution":{"observed_at":"2026-05-22T18:44:28.886552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10862","last_updated":"2021-09-27T21:12:49Z","snapshot_observed_at":"2026-08-04T13:56:39.444746Z","submitted_at":"2021-09-22T17:34:18Z","title":"Recursively Summarizing Books with Human Feedback","version":2},"cited_work":{"arxiv_id":"2109.10862","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.10862","snapshot_observed_at":"2026-07-03T09:07:47.851004Z","title":"Recursively Summarizing Books with Human Feedback","venue":"cs.CL","work_id":"aeb94d9f-1a59-4bbb-b591-0ccd732aa0f8","year":2021},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2109.10862","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:ced3aa2b1a2d6c0248cc3a95d90d92c29b7839cbe9fbfd715bf72a54d7b16e58","observation_id":"007423c5-0146-4ca1-83c2-8c5cd31ee503","resolution":{"observed_at":"2026-05-22T18:44:28.889779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14724","last_updated":"2024-04-19T09:12:32Z","snapshot_observed_at":"2026-08-13T05:43:19.504363Z","submitted_at":"2023-10-23T09:01:13Z","title":"A Survey on LLM-Generated Text Detection: Necessity, Methods, and Future Directions","version":3},"cited_work":{"arxiv_id":"2310.14724","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.14724","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on llm-gernerated text detection: Necessity, methods, and future directions","venue":null,"work_id":"02a1338b-c138-4074-a31b-fc9fce46175c","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2310.14724","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:98217ccd8ac9871c54ddbad85b739833ec8d75973ad2a54c15c5b91c779918c1","observation_id":"84c582e3-e9ab-4b39-85c1-ce314e3dcb98","resolution":{"observed_at":"2026-05-22T18:44:28.893321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11436","last_updated":"2024-06-18T04:41:07Z","snapshot_observed_at":"2026-08-13T23:03:12.444829Z","submitted_at":"2024-02-18T03:10:39Z","title":"Pride and Prejudice: LLM Amplifies Self-Bias in Self-Refinement","version":2},"cited_work":{"arxiv_id":"2402.11436","doi":"10.48550/arxiv.2402.11436","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11436","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rickard Stureborg, Dimitris Alikaniotis, and Yoshi Suhara","venue":"arXiv (Cornell University)","work_id":"ae09097d-58a5-40bc-8f92-14d333fc4a2d","year":2024},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2402.11436","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:f35c30767b1dd0ef380844f0199eb03b9f34a51668402d1bf1c9b244b3bae766","observation_id":"de6edc4f-4e31-4076-b32c-c778efd9f3e6","resolution":{"observed_at":"2026-05-22T18:44:28.896390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15654","last_updated":"2023-10-24T09:10:26Z","snapshot_observed_at":"2026-08-13T05:42:23.316843Z","submitted_at":"2023-10-24T09:10:26Z","title":"A Survey on Detection of LLMs-Generated Content","version":1},"cited_work":{"arxiv_id":"2310.15654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.15654","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Y ., and Cheng, W","venue":null,"work_id":"d86b0504-b475-408f-9e09-85a5b1d85df6","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2310.15654","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:1701463e3050ef6471ad7f6b7a28fdc106ef066eed773c46a4623e0e844efc3e","observation_id":"045ac1d4-3916-4db9-aacf-473ab1fb8b69","resolution":{"observed_at":"2026-05-22T18:44:28.899519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18153","last_updated":"2023-05-30T15:14:06Z","snapshot_observed_at":"2026-08-13T11:30:12.166532Z","submitted_at":"2023-05-29T15:30:13Z","title":"Do Large Language Models Know What They Don't Know?","version":2},"cited_work":{"arxiv_id":"2305.18153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18153","snapshot_observed_at":"2026-07-04T09:59:44.928520Z","title":"Do large language models know what they don’t know? arXiv preprint arXiv:2305.18153","venue":null,"work_id":"74eba3ec-bb8a-41cb-ade7-748534fc1802","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2305.18153","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:809265711bd9507d31133dcc017235293da67f35d9f8a7441df1adf1d6830e41","observation_id":"5ea14b52-8aee-431c-83c4-14dab7ddef84","resolution":{"observed_at":"2026-05-22T18:44:28.903039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01240","last_updated":"2023-08-02T15:54:22Z","snapshot_observed_at":"2026-08-13T10:42:27.268658Z","submitted_at":"2023-08-02T15:54:22Z","title":"Evaluating Instruction-Tuned Large Language Models on Code Comprehension and Generation","version":1},"cited_work":{"arxiv_id":"2308.01240","doi":"10.48550/arxiv.2308.01240","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01240","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating instruction-tuned large language models on code comprehension and generation","venue":"arXiv (Cornell University)","work_id":"9cc7a7f0-b78d-441a-a82e-59cb9c3081ca","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2308.01240","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:09762f2fc96db91160dd29a28fee6c7ba2dc8e80f7a57ed1f7b024f7bcbd1e92","observation_id":"bde149ff-327d-4cbf-93c6-85e846f42169","resolution":{"observed_at":"2026-05-22T18:44:28.906549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07641","last_updated":"2024-04-16T04:50:08Z","snapshot_observed_at":"2026-08-13T05:52:00.323833Z","submitted_at":"2023-10-11T16:38:11Z","title":"Evaluating Large Language Models at Evaluating Instruction Following","version":2},"cited_work":{"arxiv_id":"2310.07641","doi":"10.48550/arxiv.2310.07641","metadata_source":"pith","pith_arxiv_id":"2310.07641","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating large language models at evaluating instruction following","venue":"cs.CL","work_id":"dbb8d8ee-cad1-4787-981e-d4c0c8a549b7","year":2023},"citing_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T18:44:28.766639Z"},"links":{"cited_paper":"/paper/2310.07641","citing_paper":"/paper/2404.13076"},"observation_digest":"sha256:4ff1834864d7bd4833f3e2b7a005f46d602879afffda3952bcc53acb4da6610a","observation_id":"8ba96294-b41e-4a08-8522-45e72df13aac","resolution":{"observed_at":"2026-05-22T18:44:28.841917Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T17:44:10.538968Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":28,"verified_fuzzy":1},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 100 inbound Pith citation observations for arXiv:2404.13076."}