{"as_of":"2026-08-07T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59fc005acf399e7a7a98b2a1dfa902e7410d3d216e2ff28b8bf59935ba326ba2","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:06:13.824469Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12148/citation-record","integrity":"/paper/2506.12148/integrity","json":"/paper/2506.12148/citation-record.json","paper":"/paper/2506.12148"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:19.023116Z","title":null,"venue":null,"work_id":"487cec3d-685b-416d-9341-f16ef6c205a9","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.391358Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:ecd1d30d314ae3c1c026c6398a1cea691ab724f219c405e3127b816e7c3bce2e","observation_id":"292e83d3-851e-489d-859a-b6463e048e26","resolution":{"observed_at":"2026-08-07T01:06:19.093192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.828452Z","title":null,"venue":null,"work_id":"a88c1fde-7b70-4a73-811b-916eabed365d","year":2009},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.468614Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:03e5eb29eef8745342a7b4ead6683eea15bf4dd5ef2b8e3f5ec995830350cc9d","observation_id":"88f2bc62-90c0-4318-9c1a-74c794071b10","resolution":{"observed_at":"2026-08-07T01:06:18.905747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.659092Z","title":null,"venue":null,"work_id":"574adc77-734f-4509-851f-3be14ba01cb2","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.587057Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:4a8d98779bec9e77d98068b28eb14f5a81b243c0694b81f61ff052a5fba626de","observation_id":"00afc726-9112-4e7b-b2e7-fc1159f3903e","resolution":{"observed_at":"2026-08-07T01:06:18.731897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.654957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.654957Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:a73ae601d0b5fee28938418aa1de026c143581de78474009301d795716b006fe","observation_id":"54676e8d-363c-4a0b-bcf0-fadd4c1db234","resolution":{"observed_at":"2026-08-07T01:06:08.654957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.484955Z","title":null,"venue":null,"work_id":"1fcb7d71-22ac-4ad4-80f7-549256215ab9","year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.749389Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:302e2fa0f8e78199bbb65e1bf8fddcd1b543d4167e1c04bd54382cc44635b852","observation_id":"d73c9db5-3288-42d1-b80b-9be930f42f42","resolution":{"observed_at":"2026-08-07T01:06:18.560502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18403","last_updated":"2025-06-02T11:31:19Z","snapshot_observed_at":"2026-07-06T18:37:21.973331Z","submitted_at":"2024-06-26T14:56:13Z","title":"LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18403","snapshot_observed_at":"2026-08-07T01:06:08.843925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.843925Z"},"links":{"cited_paper":"/paper/2406.18403","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:d1756104a08fb78018e06bf228eb134c79c6c5ed472c39c2163347a96e0cedfe","observation_id":"a6320319-de2b-45dd-8b78-e569c378aecc","resolution":{"observed_at":"2026-08-07T01:06:08.843925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T01:06:08.903210Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.903210Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:2cafc34eb6f707f11727a87f02b6423983792f2447e279fe2788865fdc26002a","observation_id":"c2c388da-08b8-437f-9576-e73b9fee28e6","resolution":{"observed_at":"2026-08-07T01:06:08.903210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.320931Z","title":"Quantifying memorization across neural language models","venue":null,"work_id":"82599fbf-02ef-416a-8eb0-b5046014a86a","year":null},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:08.998401Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:d6762b9e8dd67c537d85ddaf1d5bd95290f4b1e3fc0a5c3cfb4950b717d66958","observation_id":"36c92940-484b-4193-8abc-0f7bf1bdfd61","resolution":{"observed_at":"2026-08-07T01:06:18.391538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.076763Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.076763Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:9ae492867a180dcca7b31b71c219d2a9c99c677cc85662585be34a9ed17355c6","observation_id":"97f9fcd5-9cb9-4534-92f6-d638fb4c8a4f","resolution":{"observed_at":"2026-08-07T01:06:09.076763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:18.143947Z","title":null,"venue":null,"work_id":"14870a41-86c2-4ffe-88fa-43aec4773e4b","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.159218Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:fdf5a9e36a0081be5f42a6faf246ba2e8d9cf19832d95a432143eb679da68023","observation_id":"8a20df55-94b2-4a97-9a7a-0a114cccff8a","resolution":{"observed_at":"2026-08-07T01:06:18.216213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.972218Z","title":null,"venue":null,"work_id":"24210c43-fa47-4b6e-baa6-dc3e38f0c4b5","year":2025},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.245706Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:57dc35d345d2967780ebdb83db85dd2f571b583c045e9ab62a7832f3198e471a","observation_id":"8f2fd6e8-718b-4509-ab82-acb0d8df9d48","resolution":{"observed_at":"2026-08-07T01:06:18.053203Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.336423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.336423Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:f86808f7fefc15a7502429196c23f196beb0af2863fa493b7480207531fbeb77","observation_id":"cf3fddad-ee70-4577-979b-af556235e8d6","resolution":{"observed_at":"2026-08-07T01:06:09.336423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.778102Z","title":null,"venue":null,"work_id":"6c67318a-020e-4a38-a1c8-d63fa0f979f7","year":2014},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.423840Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:f374fc382d6489e68183d61aa8ca49889f5646d747bb97f97f48f21ec42d503c","observation_id":"5c00185d-b306-4dcc-a2d3-c3441be727be","resolution":{"observed_at":"2026-08-07T01:06:17.876476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.489969Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.489969Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e8ea179fda757e2712d3f60aea5451531d7d7d8e1b3302c318a10bd8efe966e7","observation_id":"bc1b6a7f-e7bf-4b2b-a7af-76d752b8ac2a","resolution":{"observed_at":"2026-08-07T01:06:09.489969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-07-06T18:30:19.486766Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-07T01:06:09.583331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.583331Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e4314e9d3c3c1ccd7a6c6a4a1320ac43fbbd0536a9836775ef81172163b96df9","observation_id":"008eed55-694a-4f47-b6c7-f3108658c80e","resolution":{"observed_at":"2026-08-07T01:06:09.583331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.656090Z","title":null,"venue":null,"work_id":"27754596-a2ad-441c-b955-6f3557bb8f67","year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.654129Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e7ce6b512c5100efa525c3ef85c0eb33ac354501861abaaf9b511b6ed41301ce","observation_id":"90cb8bbc-340a-42c4-8eb0-41853c74a9f9","resolution":{"observed_at":"2026-08-07T01:06:17.711163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.761770Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.761770Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:c0f532e0db91827a7a0dbc36c419823cc03945156af65c85fed53b1898312177","observation_id":"58a1bf6c-ece8-4d57-9f9d-713ceb9acb4e","resolution":{"observed_at":"2026-08-07T01:06:09.761770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.711","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:14.194242Z","title":null,"venue":null,"work_id":"c8236f8d-c9bb-4be2-9dae-79017f434f5e","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.840553Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e3decd681e6e270527b5abbb57a4791b7db5204f0227abda83661bd4c7a18f4e","observation_id":"c9573411-eea0-4148-9f8a-b2f760830017","resolution":{"observed_at":"2026-08-07T01:06:14.283350Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.483356Z","title":null,"venue":null,"work_id":"51fd5eb7-845c-4510-8b01-d983783b42ec","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:09.948336Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:7a144d8d124ac102d2d68c858dc0300e1aae6b965f67983e33131d0209178df9","observation_id":"52fb7bba-82d6-4843-9df7-2e156402375e","resolution":{"observed_at":"2026-08-07T01:06:17.536779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03215","last_updated":"2022-05-24T13:15:25Z","snapshot_observed_at":"2026-07-06T11:55:13.881828Z","submitted_at":"2021-10-07T07:00:57Z","title":"Towards Continual Knowledge Learning of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03215","snapshot_observed_at":"2026-08-07T01:06:10.053228Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.053228Z"},"links":{"cited_paper":"/paper/2110.03215","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e717ea4958af929db72956e6ed5a83c67bffc38e01cf7fe2405bc4b92f17e4ea","observation_id":"b3d36d37-8d7a-4c0f-a90d-ebb440432834","resolution":{"observed_at":"2026-08-07T01:06:10.053228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14146","last_updated":"2023-09-25T13:59:39Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T13:59:39Z","title":"Examining Temporal Bias in Abusive Language Detection","version":1},"cited_work":{"arxiv_id":"2309.14146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.14146","snapshot_observed_at":"2026-08-07T01:06:14.586146Z","title":"Examining Temporal Bias in Abusive Language Detection","venue":"cs.CL","work_id":"28043e32-f694-4ff2-9fff-3a6447a5ab5b","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.163464Z"},"links":{"cited_paper":"/paper/2309.14146","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:4393aa22eea0531d782096f57be091f45c8332ebd3777965b8296fcfd4222b16","observation_id":"ae0f9e18-b099-4270-b793-0dae6848c6de","resolution":{"observed_at":"2026-08-07T01:06:14.650515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.269767Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.269767Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:ab7affd9d5784dd4578b95bdf5a86cc2f33d33c219bc4a3b65de71c6202a782e","observation_id":"c16d5593-d26d-46e2-bf1d-adfc9d8d4b31","resolution":{"observed_at":"2026-08-07T01:06:10.269767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.319407Z","title":null,"venue":null,"work_id":"b7b5129e-f462-4beb-8495-b9c981a0b5be","year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.387958Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:0b45479b9433a2f2df4808c400734337119321c82fef07396a735a909ee18411","observation_id":"bfb6b384-6940-4ce8-a375-2685355605f1","resolution":{"observed_at":"2026-08-07T01:06:17.417963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:17.117398Z","title":null,"venue":null,"work_id":"870bee62-73ff-4d6e-8e3c-59633d25e927","year":2011},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.496097Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:ce6e03f9c132593adc1179bc642b134de4e5b2ce8d7876525621db1f9f9705be","observation_id":"60c717b3-c858-461e-9788-d4635be3a4aa","resolution":{"observed_at":"2026-08-07T01:06:17.240788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.899770Z","title":null,"venue":null,"work_id":"507505bb-0a03-4eff-b8be-fb564aa1cfc6","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.606968Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:74cb2e2fd3a7961a1fc861cf96fa97b8a3b2733eb4989696c6593cfa57bdaa5b","observation_id":"90b6d151-dfef-490d-9548-c85d15b2a46e","resolution":{"observed_at":"2026-08-07T01:06:16.986364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.720412Z","title":null,"venue":null,"work_id":"4a9296aa-af7c-4227-a2a8-9d82baea01ec","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.725011Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:4436b256f47cb8a454861c2802811e4a8518df255bc26ec6750c7110b1792a11","observation_id":"9e7d22c4-0e69-428a-a951-3528065ffed6","resolution":{"observed_at":"2026-08-07T01:06:16.805795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T01:06:10.833177Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.833177Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:2786b3917b2dd58ae41c128c7569941d08ca6b208b76ef33d147ac3880639b9a","observation_id":"192dd590-04c7-412d-9ef1-f42eda2f4738","resolution":{"observed_at":"2026-08-07T01:06:10.833177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.918001Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.918001Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:9e28747b1cb4a099e022701e9607d7e1dbe949691b5e4d8aed4377d46accb76e","observation_id":"ed49a2a3-1191-487a-97cf-baceede5ecf0","resolution":{"observed_at":"2026-08-07T01:06:10.918001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.532535Z","title":null,"venue":null,"work_id":"958b8550-aac6-47be-8b13-bd51fb2edeb4","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:10.994223Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e26b6ad56109a1580ca28b0c8ecd500decf28acd1bb753592b6b380b3d4618ac","observation_id":"e12205b3-944b-46c7-93ec-424a794bb29f","resolution":{"observed_at":"2026-08-07T01:06:16.624567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.355537Z","title":null,"venue":null,"work_id":"69334418-fcf6-46f3-899a-a3ef292df9a7","year":2020},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.121544Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:94942edd5df09c0bad50ae8247e67ffda9810d84c9666e7e8da16ae3c6ca6069","observation_id":"ed7f30bd-7407-4fc9-9c6f-b3a74a5f8610","resolution":{"observed_at":"2026-08-07T01:06:16.421349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.163819Z","title":null,"venue":null,"work_id":"8bcf6197-7a42-4293-9231-4d26bc81de33","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.191623Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:0cf7e2fee251a37d68939d686de7d19449016e9ab4241c9ae1e4da3343b4da78","observation_id":"e7cc30b2-1663-40be-b5ac-1923f4f9fd4f","resolution":{"observed_at":"2026-08-07T01:06:16.259152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:16.007325Z","title":null,"venue":null,"work_id":"425d1b77-2928-415b-80ce-5576696465c0","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.309509Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:43a98486fa134f7d4cd1a84ad292832cd1472ff8c2c39dbe1babe4ad2c77202d","observation_id":"c2c83654-c5d4-4250-8056-12fe5bd98003","resolution":{"observed_at":"2026-08-07T01:06:16.095106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.422890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.422890Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:f0a1dfbd8fe13336d7bc158535854428029a5f165d406d46f6424e1a511b4398","observation_id":"3d8eac42-c676-4966-9e84-d92b8a5d0203","resolution":{"observed_at":"2026-08-07T01:06:11.422890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.548125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.548125Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:c643390548d2f9cc74c4feba263df9e32c4aa8ed19f2d07f51943405dbe9237f","observation_id":"ca677080-4632-48c2-9f3b-37d3cb908ca4","resolution":{"observed_at":"2026-08-07T01:06:11.548125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.820705Z","title":null,"venue":null,"work_id":"ef3accf6-2e86-4e45-bd1f-617f2d068b35","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.657505Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:02f1840af0047a08dc90c8de0f168a0f57c199f0f370cdb6ba07a8963392cde5","observation_id":"ae72fa0f-072c-4848-bd8f-6b6267640822","resolution":{"observed_at":"2026-08-07T01:06:15.905144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.633047Z","title":null,"venue":null,"work_id":"a0fefdac-1031-4e78-afcd-f15c49f81eaf","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.735239Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:f92074b1aa54fa49fe6138b68eae98cc2d05c5b29a041eb1e049cf235ae5f3e3","observation_id":"4022a241-00b0-45f9-9fc8-918ecf83d23b","resolution":{"observed_at":"2026-08-07T01:06:15.700052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03612","last_updated":"2022-02-08T02:53:48Z","snapshot_observed_at":"2026-08-01T15:43:54.871003Z","submitted_at":"2022-02-08T02:53:48Z","title":"HistBERT: A Pre-trained Language Model for Diachronic Lexical Semantic Analysis","version":1},"cited_work":{"arxiv_id":"2202.03612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.03612","snapshot_observed_at":"2026-08-07T01:06:14.390573Z","title":"HistBERT: A Pre-trained Language Model for Diachronic Lexical Semantic Analysis","venue":"cs.CL","work_id":"be90475f-77fd-463b-8e79-886ecd896230","year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.857428Z"},"links":{"cited_paper":"/paper/2202.03612","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:5c47c0fda95edf5005423589543eee99432f75e693ad1a1376a2c618f506409a","observation_id":"02e2f012-4635-4789-8636-7a3d1e67d98b","resolution":{"observed_at":"2026-08-07T01:06:14.452631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.979252Z","title":"Rosin and Kira Radinsky","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:11.979252Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:df4554c070aaefae6c1d74f8200d3d30efe387ac5d62344623ff476c974b5690","observation_id":"d22abb5f-677b-4a92-be1d-8f57bbf8a8ae","resolution":{"observed_at":"2026-08-07T01:06:11.979252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.100353Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.100353Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:b9b75f35f8cb507cd7cbf1d579b6e0274579f0564f78530ba61c340e19ca71b6","observation_id":"e4b8df33-f631-41f7-b126-dd0ef1d3caf2","resolution":{"observed_at":"2026-08-07T01:06:12.100353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.185614Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.185614Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:25e2877f7212f3754b90689fc06b497423926d33b120ca8872eee8d73a975f07","observation_id":"dabd322f-338c-4e92-bb22-063f1f30611e","resolution":{"observed_at":"2026-08-07T01:06:12.185614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.303011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.303011Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:774ed16d8b1ab7c6989cf9005d69ed3457f0f5a24111b12cb91c2aba2192cd48","observation_id":"83bdf392-77d3-4393-9a2b-1a8f5ae1ca28","resolution":{"observed_at":"2026-08-07T01:06:12.303011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.482572Z","title":null,"venue":null,"work_id":"e5ac40ad-f429-4777-93bf-7945eaf1b4d8","year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.417939Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:5b526a8ac54c1c65fdb1275d9ca3eb986694358fc8859c81fd035b8b74c807bc","observation_id":"e4e2ca2a-63e4-41a7-9fc7-6eebbbdb5449","resolution":{"observed_at":"2026-08-07T01:06:15.526501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.535848Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.535848Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:ddefea60e40e77c03956044c4f145d490e3a211812269a14be4c9e7f98e24cd7","observation_id":"d1d6cabf-8b09-46f5-a290-784a78b6371e","resolution":{"observed_at":"2026-08-07T01:06:12.535848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.643476Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.643476Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:71b659580881f56d88a44a60befbf305fb68909eb93ba46a97994f774cd1c894","observation_id":"beb04adc-2aca-498c-965d-cacd422da9dc","resolution":{"observed_at":"2026-08-07T01:06:12.643476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.707712Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.707712Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:089ed576538f2ef6a863e0e07d0c47038cd27863a9b73dbf2e09c3e7b82ae59a","observation_id":"065f2831-b530-432d-b3a1-68760009e3ab","resolution":{"observed_at":"2026-08-07T01:06:12.707712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.318210Z","title":null,"venue":null,"work_id":"f37f34aa-744f-456f-aeaf-b3c3f3b66d4d","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.776123Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:072369e1c2027f92dd4eaba77d0ba10910eba3a97f3204315dfb9a19f56bfee4","observation_id":"670cdfbc-50ca-4c25-8fca-d73cce020ac6","resolution":{"observed_at":"2026-08-07T01:06:15.405136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.861746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.861746Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:38d2638a578afa6c7ca64df51f0aca9e31362348e35e2bdc5b8f75a6dcd89e46","observation_id":"863c2f32-87a3-4728-a5eb-f7cc0dde7b1e","resolution":{"observed_at":"2026-08-07T01:06:12.861746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:15.152352Z","title":null,"venue":null,"work_id":"f128b381-6f7c-414a-921b-e1bbfdbb9fdc","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:12.977746Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:1404808bb60cd9ff6369a6d1cccccf95c0532eef1c3fcfbf7ee25b48c5042c4e","observation_id":"6798217d-542a-43af-a7af-0c5ea25e4ecf","resolution":{"observed_at":"2026-08-07T01:06:15.219541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.100974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.100974Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:d245703bb81e04160bdf5c6ffa0d4f7892ebb52421b5c2dcd6b243e044dd9793","observation_id":"f8b0c2c7-8d37-4a77-afca-9ad2c74f0ab4","resolution":{"observed_at":"2026-08-07T01:06:13.100974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:14.977646Z","title":null,"venue":null,"work_id":"c676d634-d7b3-4eae-8ba6-2d5fd4ba54b5","year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.204743Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:622cf868e3430a7aac1d318240c1ffac6596bc616c9c06c857e5288162dc6ef9","observation_id":"85a66b5b-36a1-4dd4-bb72-77ad10609880","resolution":{"observed_at":"2026-08-07T01:06:15.054616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.282274Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.282274Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:23ff258b6f4099e3e75fcaf7189a0a90ab4e6acd035cdf9640f7e54359f5a179","observation_id":"c7ecf7bc-feb0-4a78-95b7-64469a3e955e","resolution":{"observed_at":"2026-08-07T01:06:13.282274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18927","last_updated":"2024-10-24T17:14:40Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-24T17:14:40Z","title":"SafeBench: A Safety Evaluation Framework for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18927","snapshot_observed_at":"2026-08-07T01:06:13.360109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.360109Z"},"links":{"cited_paper":"/paper/2410.18927","citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:8b2ca124d06251d088256f7901a1caa26788855a31e4e793bb3205da162301f8","observation_id":"d5647fa7-95cb-4631-8574-7e64036abdc8","resolution":{"observed_at":"2026-08-07T01:06:13.360109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.749","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.938616Z","title":null,"venue":null,"work_id":"3ef512d2-7377-4573-86ad-fda6cbb76564","year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.420771Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:e2629dbe917d03c5128492dc943992575111a9f1da2e280e605c8c8633dd89ed","observation_id":"66cdd967-cbe0-4c98-b484-18c14eb8eb3f","resolution":{"observed_at":"2026-08-07T01:06:14.010683Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.540083Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.540083Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:a231b78d2deb55516c4f0c175910ea39c0f5b465b8d4f96717acb65737ef3458","observation_id":"70d2199d-df87-4b94-b820-dc77a828f5c1","resolution":{"observed_at":"2026-08-07T01:06:13.540083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:14.812926Z","title":null,"venue":null,"work_id":"a49e32b6-590f-45af-9c2f-75143efa4c5a","year":2024},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.613755Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:72faa49dae87704e4511ce602f7b97f7330edfd73f11cfd9ac11a9caefc4a456","observation_id":"104d6ed4-5814-4b19-b75a-ba1ac8f635cd","resolution":{"observed_at":"2026-08-07T01:06:14.873465Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.723317Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.723317Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:55bc3f0a0b08b9a28ee72587aad121bc15d29a8c6c3dc19a9574596ce7cfd9e1","observation_id":"86ea44ac-46cb-4303-974b-fe6ef2052e83","resolution":{"observed_at":"2026-08-07T01:06:13.723317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:13.824469Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T01:06:13.824469Z"},"links":{"citing_paper":"/paper/2506.12148"},"observation_digest":"sha256:1a300b704f89d8b98d42d2120edcc2db26f044e49bdb7477a67c75b203c1f8e2","observation_id":"f89af8f3-ce43-463c-85aa-3d0fd6c864f6","resolution":{"observed_at":"2026-08-07T01:06:13.824469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.12148","last_updated":"2025-06-13T18:08:19Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T00:54:57.748378Z","submitted_at":"2025-06-13T18:08:19Z","title":"Hatevolution: What Static Benchmarks Don't Tell Us"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.12148."}