{"as_of":"2026-08-05T04:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ae13a7a4369fa6e793bc3f83756d5b52d8532a469fa8ec3e2d9e5ed2bed991a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:18:54.154755Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2509.22055","last_updated":"2026-04-11T08:49:59Z","snapshot_observed_at":"2026-07-06T22:30:50.642382Z","submitted_at":"2025-09-26T08:36:45Z","title":"RedNote-Vibe: A Dataset for Capturing Temporal Dynamics of AI-Generated Text in Lifestyle Social Media","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T13:46:48.348859Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2509.22055"},"observation_digest":"sha256:afbd60b25541b83dfa7dcdc5dadba4fd74839f43e2b071ed65e6b50bb9e71989","observation_id":"b56aec3f-1b02-45fa-8577-3816428ecdc9","resolution":{"observed_at":"2026-05-18T13:51:26.124111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2509.26464","last_updated":"2026-05-19T17:20:14Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T16:13:56Z","title":"Extreme Self-Preference in Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T20:57:37.199128Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2509.26464"},"observation_digest":"sha256:06d10cd9b8290668b57124caee46b4b0534e5c7f98e071c751b68f1a6fdb606a","observation_id":"1af5245e-b6bd-4899-9cf6-12a53103a301","resolution":{"observed_at":"2026-05-21T21:00:39.082645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2510.07517","last_updated":"2026-04-09T17:03:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-08T20:29:46Z","title":"When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T08:50:53.486588Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2510.07517"},"observation_digest":"sha256:ef5b52569caf9d9470605fd254cc1d47166078ae19a4b02dc66969b9b19ddeb6","observation_id":"6022807f-8a57-4574-bd20-c2abb734a229","resolution":{"observed_at":"2026-05-18T08:51:08.533941Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-03T06:35:37.070203Z","title":"doi: 10.18653/v1/P17-1099","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22548","last_updated":"2026-06-22T18:27:35Z","snapshot_observed_at":"2026-08-03T06:35:34.477414Z","submitted_at":"2026-01-30T04:38:18Z","title":"Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T06:35:37.070203Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2601.22548"},"observation_digest":"sha256:ff9305bd7ec6c556c6dd2914d36daa50d33538276a3e033da8c69dc4139e7e70","observation_id":"40c16883-2fe6-48d7-a8f9-8420bfe1dbba","resolution":{"observed_at":"2026-08-03T06:35:37.070203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2602.11157","last_updated":"2025-12-08T06:48:17Z","snapshot_observed_at":"2026-08-04T23:09:56.365393Z","submitted_at":"2025-12-08T06:48:17Z","title":"Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T01:27:16.967080Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2602.11157"},"observation_digest":"sha256:dab700ef764a2bacec3505dff21788b59386119c6fbbe3e730ab6e89a1625ea7","observation_id":"6bcbd550-bf76-455c-8374-2092d0880441","resolution":{"observed_at":"2026-05-17T01:28:48.785362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2604.05593","last_updated":"2026-04-07T08:43:30Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T08:43:30Z","title":"Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T19:38:11.595077Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.05593"},"observation_digest":"sha256:7315696be4b9fe4a9ef4cf3fc36866c0f5974ff8db0ce82f23bb157e0a39f862","observation_id":"4d2d3d9e-46ad-4bc4-8ec8-5f727af6279c","resolution":{"observed_at":"2026-05-10T22:40:51.666192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-05T04:25:16.540322Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:19.955943Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:6309eebc771fd68a9fac40321aa0256ca7b3996d6a087ba10334cc0a5eb1e8fe","observation_id":"2cfb26b7-9e07-417b-906a-14e481c77c59","resolution":{"observed_at":"2026-05-11T00:50:50.434134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-02T16:40:55.448677Z","title":"Play favorites: A statistical method to measure self-bias in llm-as-a-judge.arXiv preprint arXiv:2508.06709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-05T04:25:16.540322Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:55.448677Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:641743ee5b23e18940b73aff4360f5a03323300231ef9757bec1812573f0fcf0","observation_id":"44be8642-c2da-490b-b916-08fbd24dc89a","resolution":{"observed_at":"2026-08-02T16:40:55.448677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-04T05:36:43.365289Z","title":"Play favorites: A statistical method to measure self-bias in llm-as-a-judge.arXiv preprint arXiv:2508.06709,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-05T04:25:16.540322Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:36:43.365289Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:623a381d508dca7b8f48a8c1830fdb647cc79c6e2f60c61a5599853eb8a64cb7","observation_id":"e0c2e89e-0807-40cc-aad1-04f92cd4a65d","resolution":{"observed_at":"2026-08-04T05:36:43.365289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2605.17173","last_updated":"2026-05-16T22:08:54Z","snapshot_observed_at":"2026-07-31T05:31:22.376059Z","submitted_at":"2026-05-16T22:08:54Z","title":"Why Do Safety Guardrails Degrade Across Languages?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T14:17:41.347193Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2605.17173"},"observation_digest":"sha256:0a2504759285bd3c6f3a5fd616959316437857e5aff21a2cd5e4910614616a55","observation_id":"3e25a0e9-63c4-4f43-a7de-2c632048062e","resolution":{"observed_at":"2026-05-20T14:18:21.034567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2606.03650","last_updated":"2026-06-04T10:01:47Z","snapshot_observed_at":"2026-08-03T23:04:18.231389Z","submitted_at":"2026-06-02T13:41:43Z","title":"CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:46:24.554332Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2606.03650"},"observation_digest":"sha256:56eaae7faadca500ca6e46feb20b51b8d831f5372d221304ee79bd9030acdf3d","observation_id":"328827ab-7ee7-488b-8ec1-322163c9e6d9","resolution":{"observed_at":"2026-07-02T02:36:27.462423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2508.06709","doi":"10.48550/arxiv.2508.06709","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://arxiv.org/abs/2508.06709.2508.06709","venue":"ArXiv.org","work_id":"03aa7daa-6b25-43d7-9f74-a0a4973e37ef","year":2025},"citing_paper":{"arxiv_id":"2606.06454","last_updated":"2026-06-04T17:49:00Z","snapshot_observed_at":"2026-07-06T23:46:15.936608Z","submitted_at":"2026-06-04T17:49:00Z","title":"Scaffold, Not Vocabulary? A Controlled, Two-Tier, Pre-Registered Study of a Popperian Code-Generation Skill","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T00:08:06.720586Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2606.06454"},"observation_digest":"sha256:eb7bee98002121f3eb46ee524bda64af6fc5f177cdbf7fe93a9502bdfaa34a13","observation_id":"daf7bb2d-8931-4544-87ec-51046d0acc16","resolution":{"observed_at":"2026-07-02T14:47:04.549846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:27:30.742825+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-07-14T10:22:55.558755Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10626","last_updated":"2026-07-12T07:39:45Z","snapshot_observed_at":"2026-07-16T23:18:53.035360Z","submitted_at":"2026-07-12T07:39:45Z","title":"Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-14T10:22:55.558755Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2607.10626"},"observation_digest":"sha256:a29fb61c318078282a24440c619391ee2cd5541ccdcb1b6480ed8ef92e4d24aa","observation_id":"2bfa219f-0831-4e2d-8252-5e3a3f8ba9d5","resolution":{"observed_at":"2026-07-14T10:22:55.558755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-03T11:54:20.710057Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29196","last_updated":"2026-07-31T09:15:56Z","snapshot_observed_at":"2026-08-05T04:12:44.134625Z","submitted_at":"2026-07-31T09:15:56Z","title":"Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T11:54:20.710057Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2607.29196"},"observation_digest":"sha256:c87b68ab0e353a140a9e0ae7a7841bc0983eafe86c204ea85853c9a792e1c7ab","observation_id":"fa650952-5d5a-4684-b682-9a9d4e91de11","resolution":{"observed_at":"2026-08-03T11:54:20.710057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06709","snapshot_observed_at":"2026-08-05T04:18:54.154755Z","title":"Spiliopoulou, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00794","last_updated":"2026-08-04T16:49:21Z","snapshot_observed_at":"2026-08-05T04:31:51.845427Z","submitted_at":"2026-08-01T17:50:12Z","title":"Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:18:54.154755Z"},"links":{"cited_paper":"/paper/2508.06709","citing_paper":"/paper/2608.00794"},"observation_digest":"sha256:f18c8717d65900cbd8dc5563f85f2184a371d6c1af76334c9b9b53c93ebc8393","observation_id":"c40e4a63-4ed1-40a0-99a9-2c20f9ab037e","resolution":{"observed_at":"2026-08-05T04:18:54.154755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06709/citation-record","integrity":"/paper/2508.06709/integrity","json":"/paper/2508.06709/citation-record.json","paper":"/paper/2508.06709"},"outbound":[],"paper":{"arxiv_id":"2508.06709","last_updated":"2025-08-08T21:22:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T12:48:05.556532Z","submitted_at":"2025-08-08T21:22:12Z","title":"Play Favorites: A Statistical Method to Measure Self-Bias in LLM-as-a-Judge"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2508.06709."}