{"as_of":"2026-08-06T16:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a41f06adfd22e3296349c5cfbdebe60426f55b1508e50b517adf12edb57ab633","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T18:04:00.800663Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.28882/citation-record","integrity":"/paper/2605.28882/integrity","json":"/paper/2605.28882/citation-record.json","paper":"/paper/2605.28882"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"University of Chicago Press, Chicago, reissue edition, 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:6b8980c550b9dcc81f1f31b9660c1e40a1d710703e0d510c69c114a87d19223e","observation_id":"7eab84ec-066d-4aed-aac9-81d6d2145826","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.semeval-1.314","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Semeval-2023 task 11: Learning with disagreements (lewidi)","venue":null,"work_id":"b70d1d1d-0092-4205-9ea5-141d5f2e13ba","year":2023},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:d9ad0c950e2c0fd9c8597c5dec9f97d1bdf5fd9c4a8728213a34d31c06b9af73","observation_id":"988a6d0c-82c5-4dec-a57e-1d1eb425c2ac","resolution":{"observed_at":"2026-06-29T18:13:48.323762Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T02:51:25.845183+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T02:51:25.845183+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Validating LLM-as-a-judge systems under rating indeterminacy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:da31c8b4561a7067a114789339a6dd2e087b262e4dec9d7512d73aaf107367e0","observation_id":"da8cfb79-a5cd-45e1-a0d8-a100cde6c944","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":"2505.08775","doi":"10.48550/arxiv.2505.08775","metadata_source":"pith","pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","venue":"cs.CL","work_id":"5d613c2c-158f-488c-9981-fc9b82a5e093","year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:274bc5bff83658266ecc214d9f7edcdef673920e2cdc23a298f5e7f6fab2bbe7","observation_id":"4d6cbee0-353b-4378-805b-420a9de5904b","resolution":{"observed_at":"2026-06-29T18:13:49.189804Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.21849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:13:49.190982Z","title":"HeartBench: Probing core dimensions of anthropomorphic intelligence in llms.arXiv preprint arXiv:2512.21849, 2025","venue":null,"work_id":"6455d02c-ec45-43dd-a402-8d15a419caa8","year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:47a267e7b32ae4765ab517c54baecd4f8fc3327d75b1c39a928c5ee4f81c6698","observation_id":"00618c0c-da3b-4c2f-acc3-6336ab8c7115","resolution":{"observed_at":"2026-06-29T18:13:49.192974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:34:57.362731Z","title":"Multi-bench: A multi-turn interactive benchmark for assessing emotional intelligence ability of spoken dialogue models","venue":null,"work_id":"67e3348d-1a9b-4869-bcf0-a69f0d6c72e1","year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:3b4186f6e0cf48f4359722c24edc5d50741bedca51f376cdaa1da28940de8e0a","observation_id":"abf7ad78-48aa-4d2a-80d0-6b80d6de739b","resolution":{"observed_at":"2026-06-29T18:13:49.190238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Skywork-Reward-V2: Scaling preference data curation via human-AI synergy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:9f320b796ad3ff9ad57dc0b6bcb208f9b247cd8c6234194bf752d53fc5544470","observation_id":"3736ca13-2752-4d55-abd6-cd3252c53e3d","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:46f9f3b7d9a963849b636e714dd823fdbbd12392d55542ffcd6d95b64b7537e5","observation_id":"1c1fe6b2-b699-4443-ac98-c76f40da6bc4","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"RM-R1: Reward modeling as reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:ed4d8f69afc6235d92f9f9ffe089d0cefd9452212a66509a927490dd13ebcba5","observation_id":"729649ca-736a-4bf2-bed1-c538eb21304d","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Livebench: A challenging, contamination-limited LLM benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:1aa43bb5d022a9dad726e3c4f48ce9d96e8689a1bdd0f21d345e76cb465bded4","observation_id":"4c9ced56-ab7c-4d85-bf30-dc7c805662d0","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:bb2c49b756cfbb4a53aa5c55dc72da5e2228713d611ed82f4a28ec5c9e3f67fd","observation_id":"db69a882-4b21-476a-945c-0ea4d33c2a0b","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Benchmark self-evolving: A multi-agent framework for dynamic LLM evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:f90c3b87fbd089f9ac66d8902c6bd0f9951794bf0c05f8ec75a3064bd43d2309","observation_id":"c4f7414c-1378-4091-be51-4e20ac278e05","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Fung, Kun Wang, Linfeng Zhang, and Jing Shao","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:25a69d5e33c69dba571d8d8c35f454fd8176d835ce120dc0a8e4070af1058213","observation_id":"c5699056-e998-4346-9c0c-fe3165cd042f","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Judging LLM-as-a-Judge with MT-Bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:840d9d3756a0699709a8efde7b59278fb164f0b50612a70ee66f72a982bbd612","observation_id":"f6792340-f7d2-4752-8eb5-e6b45ea5825d","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:028b4fd4c44e106cbad887461ac8169f53e1abfe0676e16a7dd0367f9902e382","observation_id":"94bcfd35-23ec-47f1-a1ac-ff19f600433d","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"WildBench: Benchmarking LLMs with challenging tasks from real users in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:89d4138c263e804e1da0fa52eb45cbe6f040937ad761186ab1026bcddd63dfec","observation_id":"40278fee-525d-4fbd-bb8a-18b19f689b16","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Inverse constitutional AI: Compressing preferences into principles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:4904d476b7ac8ed44bd26dce427fb61cb2175fd77ec9dbfea01903afbf4f8da3","observation_id":"bdff6030-904b-4253-986d-2d8b8d33c3da","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T09:49:44.762854Z","title":"Online rubrics elicitation from pairwise comparisons","venue":null,"work_id":"997bca21-08ad-4445-841f-1609abeb4657","year":2019},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:c1b02ebe4e332caf8a5661d129d9ab605e62e529e1074a62545a3cc2ecbfc2eb","observation_id":"efe97fb6-ade9-4c95-a3b1-042428b54510","resolution":{"observed_at":"2026-06-29T18:13:49.183921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:19:38.647682Z","title":"arXiv preprint arXiv:2602.01511 , year=","venue":null,"work_id":"e335e839-8b57-4dd7-9e80-eea9b45fff33","year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:beed1b2e44c82c9bbe8776fe17f6766aad5746538a01e2f6575004c39451095b","observation_id":"efc0b0ba-ab85-4470-b6e1-1b82c9b03732","resolution":{"observed_at":"2026-06-29T18:13:49.178759Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11027","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:13:49.191394Z","title":null,"venue":null,"work_id":"e16445ea-42bc-4c5f-a05d-9a62c7ee04c8","year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:0a6ee9cf0b80334e85d2ea7b71c1d054cfecfd7208d829aa2e40a25725d089aa","observation_id":"3c76e661-7024-4f5c-a0e9-a0d703539f81","resolution":{"observed_at":"2026-06-29T18:13:49.193174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-eacl.335","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning to judge: LLMs designing and applying evaluation rubrics","venue":null,"work_id":"22f1854c-7be2-4e2a-a8ab-d608297d5483","year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:9eb3f447552bcf1ee8a0133d5774962574a5c6ba69ab675f3fe9fb35085e0035","observation_id":"fe72e9a1-22b6-4c34-905f-5250e15ba952","resolution":{"observed_at":"2026-06-29T18:13:48.313718Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Benchmarking large language models under data contamination: A survey from static to dynamic evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:3b92ec808c5a9373e86c3e38f284dacd84c487e83e25b78eaa0f09bccf0ff377","observation_id":"387b202b-22ca-419a-bb0a-111d8c231ad7","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.093376Z","title":"In: Christodoulopoulos, C., Chakraborty, T., Rose, C., Peng, V","venue":null,"work_id":"e6d6ecae-3575-45e2-8c99-76359a926a1a","year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:2399febd450380db65b3af5e39f6bf87f3ec7f037999b5911d6ee4f02e5d4fa2","observation_id":"cf3b615f-bf02-4867-b3ea-d42b03816d62","resolution":{"observed_at":"2026-06-29T18:13:48.325935Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:08:10.343755+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:08:10.343755+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"DyVal: Dy- namic evaluation of large language models for reasoning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:2827b687435b2b0d654e7124d56ca9db943c6c4f6b8deb8772be47be9f35a0c9","observation_id":"43f9b0bb-704a-4694-baa0-552a3d6c40a5","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Chiu, Avinash Thangali, Zĳie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, and Prakhar Mehrotra","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:2dc55afcaf8403974e1e3d41748c4422d885cff1fc6392dd3e63ddead43c48bd","observation_id":"1928993e-a767-4ddf-bf19-9fefd2d142e7","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Learning beyond gradients","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:3bf39b807329e941b96b636c819de063dc9963124b0e97a2149f7835faffc000","observation_id":"282db915-d95a-4145-b519-02b43352dc8f","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:4e765984317a28726a211d776f752f79736067012dbf4ad82ba220aa52047e3b","observation_id":"6381ffcb-ce0d-478b-b507-9bc5e1fe5474","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Large language models are human-level prompt engineers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:cb751aa0e2a92a7019051a7e2e6cf38de33056b78a33a5f631a4cf4c41d58fe9","observation_id":"801d4e97-705e-45e1-ad5b-f0d718b8be59","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.494","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatic","venue":null,"work_id":"c6e320a8-2022-43f8-a035-e44179d11c02","year":2023},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:0d120cfb987a05d30b18c192cc1fb023e63997f2b7c7ca898b678d66456f4ae2","observation_id":"c279b7cb-96cf-46c8-bce2-4caffd8f5673","resolution":{"observed_at":"2026-06-29T18:13:48.325771Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:18.239632+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:18.239632+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Optimizing generative ai by backpropagating language model feedback.Nature, 639: 609–616, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:db6d84de834dd363b376b74ab3020db23988ab881806141b112b8cec83d3c26b","observation_id":"96b83854-ee63-4a9b-a59e-60a10d4a1e1a","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4777.367645","doi":"10.1145/3654777.3676450","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zamfirescu-Pereira, Bjoern Hartmann, Aditya Parameswaran, and Ian Arawjo","venue":null,"work_id":"b6cba0fd-ebfa-4232-81a4-9f6e008f67f8","year":2024},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:36c112b26d13cbd6bb96e92f0c6872e757263830729258ccac0615850ea55eb8","observation_id":"d01137d4-e996-4c76-be93-792fb5f66eb3","resolution":{"observed_at":"2026-06-29T18:13:48.321689Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Shen, Xinchi Qiu, Chenxi Whitehouse, Lisa Alazraki, Shashwat Goel, Francesco Barbieri, Timon Willi, Akhil Mathur, and Ilias Leontiadis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:b87cf6737b580184e22c53ba5db7fd386b35d09f80715a97dff22bccc1c65a6b","observation_id":"8518202e-b9a7-4ae9-95c5-568626bddc04","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Uma, Tommaso Fornaciari, Dirk Hovy, Silviu Paun, Barbara Plank, and Massimo Poesio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:6f9724de9a8e1287bb8cbf76f8a701010a82596c608a0b6d63c8628974d5f020","observation_id":"555129db-f72d-4879-a376-b590cd1d5021","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1613/jair.1.12752","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uma, Tommaso Fornaciari, Dirk Hovy, Silviu Paun, Barbara Plank, and Massimo Poesio","venue":"Journal of Artificial Intelligence Research","work_id":"906b9cb8-dbc2-48f5-aafa-8167e7d018d9","year":2022},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:5146ca39e3b423de1810a24110b316f41c5ce5b559e9299b37c5f211c7033cec","observation_id":"0546bdb2-3d20-437e-99f9-71d4bf81bbb3","resolution":{"observed_at":"2026-06-29T18:13:48.321521Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:30.831611+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:30.831611+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Gemini 3 Pro: Model card.https://deepmind.google/models/model-cards/ gemini-3-pro/, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:01999ef8285e8906f25f846a4e4e0e8c1fdb743f7843a4189ba6054cd7829f84","observation_id":"97758661-b303-4b84-8ba4-443a1f332e98","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Claude Opus 4.7 system card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:c2a173a99ce81920608a9b565618041c6354c72c675af8205542a40da893716d","observation_id":"902b1408-9020-4141-876f-c2b5d6375553","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:a4634ade1c9ce04e20e377b1f927a1618ea5dcd9dcb274780a05ce4fa061572e","observation_id":"1613dc83-fa67-4f49-91ef-a6d485b57073","resolution":{"observed_at":"2026-06-29T18:13:49.174958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Introducing claude opus 4.6, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:7c277249165be787d7df8d0843183c65422603319e68087d922199135694886b","observation_id":"49991501-7b7b-4da6-a42e-999990ff9201","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Auto-rubric: Learning from implicit weights to explicit rubrics for reward modeling, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:b00b9ca5daf3d478c0a1e7fb7487b945a5902d01660c77ae457648e5bced6bea","observation_id":"913f4177-f85c-4c8b-9d10-8b8d5e7e8877","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07743","doi":"10.48550/arxiv.2510.07743","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.07743 , year=","venue":"ArXiv.org","work_id":"b59a07ee-6a84-42cb-8d41-9b665841aa2b","year":2019},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:38ba7ac7d5bec2119a37ed1c2a4a0a79742759fc1c4a8ce97c325a44931ba78a","observation_id":"f656384a-74ae-4e62-b68d-352672dc0312","resolution":{"observed_at":"2026-06-29T18:13:49.175507Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:313a4e4ddaea764fbaf4096e8c384b6a98a29bbc664ea7eb4a5aeebfc205d1c7","observation_id":"e67ab9f5-04e7-4c29-b868-c0d82b7d238c","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"URLhttps://openreview.net/forum?id=G0dksFayVq","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:d3505b07225ee800d10e6f2d1477fbb2ddef1de1c4c15a6d3a7e9d82a61762b3","observation_id":"028deff5-2483-4784-a0ce-3ad93c07dbed","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:0313a3bdc3d456f4d7a282a847c33ff7f060dfa97f6419b27d7d8c41c86f2605","observation_id":"e026a991-c67c-4a39-9e28-563816ea8ef5","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":"2211.14275","doi":"10.2196/53233","metadata_source":"pith","pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving math word problems with process- and outcome-based feedback","venue":"cs.LG","work_id":"94492239-b1d5-435e-bea5-7f51992d0614","year":2022},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:546ee88647a2462064ed8ad498f378bfe619a91ade48153c88270d7c3b17c670","observation_id":"fe783d9a-da6b-4fcf-ac22-8356d1db08b8","resolution":{"observed_at":"2026-06-29T18:13:49.172281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.510","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T13:36:58.254898Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"85cb163c-682e-453b-a6a0-83882efc0942","year":2024},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:0dd648ce7eb800168b4f719cc9a577e26c0d9536471e888f23a4cebe3b52c5f6","observation_id":"2901730d-b3e5-4477-a3da-2e22207d732f","resolution":{"observed_at":"2026-06-29T18:13:48.323942Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:52:29.842744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:52:29.842744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:3da170491e8449d2efe9fc78195dd4227a5c8141b2671ccc2522a8af68e2615c","observation_id":"18c32e29-07e7-4b4c-8cd8-7cbd01e2034a","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:33e6cc199b36dd78c8fad45689de6d704f5687cf0b6292dc1b75234a68273834","observation_id":"dd8bd577-31df-4c79-98fe-ed5bb16adf04","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"I went through something similar last year","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:8e6cb16f7e819cf2a3c1bc727015050945148707d8ce4ab14a9c7ba57296def3","observation_id":"68eed104-adda-4069-ac36-80376ffe05ab","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:1ce4e051ff402c9ea6f073ec390b2f20ab6208f59c7a73f3194e68eb1304c335","observation_id":"e726f204-9428-416c-a8be-24ca4941a573","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:7a454804554341f5b9af8e01c20067349e2b2c54d42781789e8016268a5a4550","observation_id":"140232de-29e4-4ea0-970c-ff1798e8efd6","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:6124cb12873567bf093dc8bcec165bbbdd352ec7f31aa7adfcf6d184addc7e07","observation_id":"0860c4a1-13ec-403c-b912-dd5792cdf739","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:0b5ac40cbaf73d3273703a9c9a627439e0c158bcabc7a6a819af76a8c13f9594","observation_id":"efec031a-5bc1-4ba8-85d0-364bf7e170d4","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:d19c542d58e989d08ccf677faa3c7271a4e15c54b306541b01b76ab1cceeda02","observation_id":"1ffac7b0-9585-46b0-bec6-bd6bb38a8c2e","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:0dda435326d319b6f819e3a7b3789bf561dbbc010d371a163eb52466e53b2b45","observation_id":"6f5ed012-27d9-42ce-9ef1-d717156583bf","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:542394624f9aebcb4b706d80192447b9889b5d706afb5ca16c8da9f3c26d4bd3","observation_id":"6487cae4-6055-4bab-98b5-d004fbe9555f","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:04:00.800663Z","title":"A.3.2 OpenJudge Rubric OpenJudge produces 5 thematic categories, each with 6–7 evaluation tips: Category 1: Factual Accuracy, Logical Consistency, and Computational Correctness","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T18:04:00.800663Z"},"links":{"citing_paper":"/paper/2605.28882"},"observation_digest":"sha256:9f548101b89d90b0b188bcc4d3bc56b04191b2af0c7f4589c84f029b9a059fa9","observation_id":"f9d08653-fca2-4353-94a0-2c696610eb9a","resolution":{"observed_at":"2026-06-29T18:04:00.800663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28882","last_updated":"2026-05-26T16:53:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:38:23.512460Z","submitted_at":"2026-05-26T16:53:14Z","title":"GrowLoop: Self-Evolving Conversation Evaluation Seeded by Human"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":40,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2605.28882."}