{"as_of":"2026-08-19T18:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b22aa20b928fae28a5781399bc5cac1b7d921aea0113bb47dd3660694e32d84","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:04:39.270261Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T13:11:53.361408Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T13:16:58.186477Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.11373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11373","snapshot_observed_at":"2026-07-02T13:16:58.186477Z","title":null,"venue":null,"work_id":"3107b980-c847-488a-b444-705c9aaf32f1","year":null},"citing_paper":{"arxiv_id":"2607.00601","last_updated":"2026-07-01T08:27:21Z","snapshot_observed_at":"2026-08-18T11:27:15.473864Z","submitted_at":"2026-07-01T08:27:21Z","title":"\"Don't Say It!\": Constraints, Compliance, and Communication when Language Models Play Taboo","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-02T13:11:53.361408Z"},"links":{"cited_paper":"/paper/2412.11373","citing_paper":"/paper/2607.00601"},"observation_digest":"sha256:da03fb2faf0637208875aba6cd7b7bb6584f9687de240cfa5a593c776e420fbb","observation_id":"73901c8d-411a-4fc7-be78-0ef9fa024dac","resolution":{"observed_at":"2026-07-02T13:16:58.188109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11373/citation-record","integrity":"/paper/2412.11373/integrity","json":"/paper/2412.11373/citation-record.json","paper":"/paper/2412.11373"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-11T15:04:39.051311Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.051311Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:765ee28fced3dcb417980152297aa1079a6fcf880d7a4d6138f957ff9f8b90c5","observation_id":"e1053adb-1045-4dbc-a31d-8c41abcc6de6","resolution":{"observed_at":"2026-08-11T15:04:39.051311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.056864Z","title":"Gpt for games: A scoping review (2020-2023),","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.056864Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:aa4258f9c8c18a5a64bd6ebac13d6f74377261ed8874c05a7fa7ba6129aa9d47","observation_id":"fddc3e02-0dd5-4f13-8059-5433409a8b32","resolution":{"observed_at":"2026-08-11T15:04:39.056864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.162984Z","title":"Level generation through large language models,","venue":null,"work_id":"f80baf14-defc-4fbb-8fac-f4055b2997ad","year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.062190Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:49d2a24baecdbf2bc67e8c58d6f7808c96a7eba63baafcecd473daf5a29c43bd","observation_id":"af584fee-f280-479d-80a1-6178b5e0780f","resolution":{"observed_at":"2026-08-11T15:04:40.167761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.147971Z","title":"Langbirds: An agent for angry birds using a large language model,","venue":null,"work_id":"f9bc98ed-f33e-4ca5-8a59-3cbc9c885b85","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.067697Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:71de02e9e10bba9d9dec0373ff713d281df1a2af6dc60c877dd011f0aee7f2fd","observation_id":"3c72bc04-38ad-4691-a0f7-4c4a35c596c4","resolution":{"observed_at":"2026-08-11T15:04:40.152805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00690","last_updated":"2024-03-01T17:22:16Z","snapshot_observed_at":"2026-08-16T14:13:40.636909Z","submitted_at":"2024-03-01T17:22:16Z","title":"Playing NetHack with LLMs: Potential & Limitations as Zero-Shot Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00690","snapshot_observed_at":"2026-08-11T15:04:39.072749Z","title":"Playing nethack with llms: Potential & limitations as zero-shot agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.072749Z"},"links":{"cited_paper":"/paper/2403.00690","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:d48862e9f677e109872f69d20be74abeba149a1250b1354332142807a3a3d3c1","observation_id":"522511b7-a741-47d7-a14b-91d7241ce5bd","resolution":{"observed_at":"2026-08-11T15:04:39.072749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.03500","last_updated":"2020-09-07T19:37:21Z","snapshot_observed_at":"2026-08-18T15:07:46.024344Z","submitted_at":"2020-07-07T14:37:27Z","title":"The Go Transformer: Natural Language Modeling for Game Play","version":3},"cited_work":{"arxiv_id":"2007.03500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.03500","snapshot_observed_at":"2026-08-11T15:04:39.626691Z","title":"The Go Transformer: Natural Language Modeling for Game Play","venue":"cs.CL","work_id":"abdc7f59-f308-4d84-acfe-b49fbd056da9","year":2020},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.078134Z"},"links":{"cited_paper":"/paper/2007.03500","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:2de5c7e9e4c09636b019a0889ee02f80bc8e804edc7823ed23acd659788a4884","observation_id":"f14aad39-85a5-426c-b5eb-cf77cd390c4c","resolution":{"observed_at":"2026-08-11T15:04:39.631742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.133250Z","title":"Generative ai in mafia-like game simulation,","venue":null,"work_id":"d3283473-1278-4940-8fcc-9528dc75dbbd","year":null},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.084726Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:80c1f5902688ac381c96a01950e118bfef30edc73e8f5f60d1568d3141ece1ad","observation_id":"512caf11-b5d6-49b4-931b-f5aecb328430","resolution":{"observed_at":"2026-08-11T15:04:40.138208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.118695Z","title":"Language-driven play: Large language models as game-playing agents in slay the spire,","venue":null,"work_id":"65755531-ac03-430e-a2da-68287e838d00","year":null},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.094186Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:b9923b122862056ca31f003723fb808977c08ba8c0133b5f86f565a090265edc","observation_id":"106e53a6-eeec-4e37-a680-d4e50b2c2278","resolution":{"observed_at":"2026-08-11T15:04:40.123563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06613","last_updated":"2024-07-22T14:32:33Z","snapshot_observed_at":"2026-08-17T18:13:25.300652Z","submitted_at":"2024-06-07T00:28:43Z","title":"GameBench: Evaluating Strategic Reasoning Abilities of LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06613","snapshot_observed_at":"2026-08-11T15:04:39.102857Z","title":"Gamebench: Evaluating strategic reasoning abilities of llm agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.102857Z"},"links":{"cited_paper":"/paper/2406.06613","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:797bacc51d7915d9fdf1b5583747bffad9124980f086ec8c8da9f2a1e0576949","observation_id":"fe3d006f-bf5b-41d4-a4ea-eb4c92a19531","resolution":{"observed_at":"2026-08-11T15:04:39.102857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.103534Z","title":"A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play,","venue":null,"work_id":"85abcac7-2964-413a-8e69-e167ddf93906","year":2018},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.107738Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:4ab398c6426ffa37116844ca469d5ce7a87be5fd85b338d55cfdfae68973b767","observation_id":"5780f2a0-c1ad-4f0e-aeb1-95b8f1a95ceb","resolution":{"observed_at":"2026-08-11T15:04:40.108499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.089689Z","title":"Mastering the game of Go without human knowledge,","venue":null,"work_id":"dd05aac7-f12d-40cb-9557-5c6c67f223c7","year":2017},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.112392Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:4da4ffed53f085e64aaac5361bd7f5f620906367cb67d09fd6f6ed6c7e0b2de0","observation_id":"958f0864-b30b-46df-81a4-5488638df476","resolution":{"observed_at":"2026-08-11T15:04:40.093948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.075554Z","title":"TAG: Pandemic Competition,","venue":null,"work_id":"fcd43f67-c74d-409e-8c70-78ad39d7100e","year":2022},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.117077Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:03204a01c462b83a8413835be605d9c91663c09135b5f08bd2587d9d5583a4b0","observation_id":"46e42308-dc23-4486-be9d-abf06c1d10d7","resolution":{"observed_at":"2026-08-11T15:04:40.080150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.062013Z","title":"Chv ´atil, Codenames","venue":null,"work_id":"8062baa6-a7ea-489f-aed2-08e57580ca18","year":2015},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.121622Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:9f3f110ec9e953b142e51359ba6ba2ecdbe6ae940a00f9c7529455159e8c5b9c","observation_id":"a02c347d-d6ce-4ffe-a0dd-e43c48bf2977","resolution":{"observed_at":"2026-08-11T15:04:40.066129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.047187Z","title":"The codenames ai competition,","venue":null,"work_id":"424fc252-39af-412d-a900-0f0adf2a6969","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.126199Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:a16df874fb601fdbb436dda87d2f500ac1f63fd0751d59b41e6137a9b55bcbd6","observation_id":"a0e76b01-32d9-4fbc-a544-abf71eec9020","resolution":{"observed_at":"2026-08-11T15:04:40.051931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.031048Z","title":"Cooperation and Codenames: Understanding Natural Language Processing via Code- names,","venue":null,"work_id":"9d32796c-d724-489b-844e-92eb30dd9510","year":2019},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.130669Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:f8236b8c2fe11ebe82ff5098e168d0d8674a3a951eb56749ff245f7cfce74cf7","observation_id":"e2c4dabd-82d5-4c9d-be51-7627e5fdcf9a","resolution":{"observed_at":"2026-08-11T15:04:40.036135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02083","last_updated":"2024-11-04T19:51:53Z","snapshot_observed_at":"2026-08-16T15:57:46.327821Z","submitted_at":"2023-02-04T03:50:01Z","title":"Evaluating Large Language Models in Theory of Mind Tasks","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.02083","snapshot_observed_at":"2026-08-11T15:04:39.135574Z","title":"Theory of mind may have spontaneously emerged in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.135574Z"},"links":{"cited_paper":"/paper/2302.02083","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:5481bd2b2e1caa7d2a208a566fcbfed53da92569d474af6384161fb72fc6ad26","observation_id":"3cd71485-9486-4e8d-8da2-36a8843fef01","resolution":{"observed_at":"2026-08-11T15:04:39.135574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-11T15:04:39.140371Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.140371Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:ad54b2657aa4c9625d862a2ad76697d6fd568ccf90f8ead6aafc572021fbecde","observation_id":"29feeb47-a770-45e3-9b1a-71fe8b55b244","resolution":{"observed_at":"2026-08-11T15:04:39.140371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-11T15:04:39.145384Z","title":"Hel- laswag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.145384Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:f047f5cf2d98c56afaf1b8acc9f2b73fe369775cd741a26ab7a793ce5eef37d0","observation_id":"6a898356-201a-4632-8634-32b466472bd5","resolution":{"observed_at":"2026-08-11T15:04:39.145384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-11T15:04:39.150171Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.150171Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:2bf710e69b0402c970f07eb57bb4c95da4e2b14e8e1539f2b7d5fd1dab71ca5c","observation_id":"5b93d489-5b7d-40f2-9c71-449c20c378d5","resolution":{"observed_at":"2026-08-11T15:04:39.150171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-11T15:04:39.155107Z","title":"Towards reasoning in large language models: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.155107Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:435c89139336bd57373ea84e3bd445532171b87c317ebc41fb6699dee636284c","observation_id":"f077eae6-4009-4986-b626-899bc7d7a8e9","resolution":{"observed_at":"2026-08-11T15:04:39.155107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01230","last_updated":"2024-04-01T16:50:54Z","snapshot_observed_at":"2026-08-18T02:14:48.925686Z","submitted_at":"2024-04-01T16:50:54Z","title":"LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01230","snapshot_observed_at":"2026-08-11T15:04:39.159692Z","title":"Llm as a mastermind: A survey of strategic reasoning with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.159692Z"},"links":{"cited_paper":"/paper/2404.01230","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:7e54f7dac72f0bd9447f7dc51fcc4f411028c0b669542176a3fa5c37ab729d7a","observation_id":"fa84398f-fb26-435b-a8aa-a1057377358d","resolution":{"observed_at":"2026-08-11T15:04:39.159692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.016290Z","title":"Tydi qa: A benchmark for information-seeking question answering in typologically diverse languages,","venue":null,"work_id":"c37cfcdb-66eb-4584-8bf0-1966257bb08c","year":2020},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.163755Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:c43eceafa3a75bd15d87a1693e20625ba2f8949b2e40cee37a9e129e2f51cae3","observation_id":"f6e0c79f-dd1f-409c-8eba-9e2633e7ea59","resolution":{"observed_at":"2026-08-11T15:04:40.021270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T15:04:39.167804Z","title":"Measuring mathematical problem solving with the math dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.167804Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:f4406c531fddb03025c970dd18d4914c1accd9e82479133fddef08f68bf88e34","observation_id":"84a0128e-a2e0-4d33-b1e1-a7365a0a209a","resolution":{"observed_at":"2026-08-11T15:04:39.167804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13312","last_updated":"2023-04-03T15:26:20Z","snapshot_observed_at":"2026-08-16T16:21:36.932426Z","submitted_at":"2022-10-24T14:58:58Z","title":"Neural Theory-of-Mind? On the Limits of Social Intelligence in Large LMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13312","snapshot_observed_at":"2026-08-11T15:04:39.172302Z","title":"Neural theory-of-mind? on the limits of social intelligence in large lms,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.172302Z"},"links":{"cited_paper":"/paper/2210.13312","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:149651777e6bf60049aaf679e942d213ba25bbcd036d4e7a602765c40368d388","observation_id":"42ed6593-d7f7-46eb-a0bb-90e0f5832853","resolution":{"observed_at":"2026-08-11T15:04:39.172302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:40.001080Z","title":"Large Language Models Fail on Trivial Alterations to Theory-of-Mind Tasks,","venue":null,"work_id":"8aa4a5ad-f770-4a42-b495-f91287cd476e","year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.177381Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:a1f3563ed0c4afcd3cdb8566c88a7cf5c93047f001b5418ddc92082c69726752","observation_id":"561e2d28-16b3-4733-b2b7-ae5cf74167e5","resolution":{"observed_at":"2026-08-11T15:04:40.006222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.986123Z","title":"Prompt Engineering ChatGPT for Co- denames,","venue":null,"work_id":"113a6a50-793c-4547-85de-9f202dd7eb7a","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.182207Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:502bcb2e2e4e45e0fbd096596100144ea5b41ad596b6fb65c442ccaf4bd876e5","observation_id":"5076321f-b35e-4b8f-9ecb-1623980f845f","resolution":{"observed_at":"2026-08-11T15:04:39.990849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19165","last_updated":"2023-05-30T16:09:19Z","snapshot_observed_at":"2026-08-19T07:02:36.987726Z","submitted_at":"2023-05-30T16:09:19Z","title":"Strategic Reasoning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19165","snapshot_observed_at":"2026-08-11T15:04:39.186524Z","title":"Strategic reasoning with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.186524Z"},"links":{"cited_paper":"/paper/2305.19165","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:7f86c13cdde397c4fa4d5024231d1df4de1b80fe7cf928be49854d93081cacf0","observation_id":"1445d912-3197-467c-8697-a92b6264b4b0","resolution":{"observed_at":"2026-08-11T15:04:39.186524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.971193Z","title":"Human-AI Collaboration in Cooperative Games: A Study of Playing Codenames with an LLM Assistant,","venue":null,"work_id":"ae05b121-d7f1-4d25-aced-bed118a615f8","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.191199Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:066d5431f66bcd4f0c8d86b275fa13a89428ade07cd5b5e7db6cdc0b169cc1c9","observation_id":"e5414ba8-bc6b-4770-bf81-bef79fc690ab","resolution":{"observed_at":"2026-08-11T15:04:39.976103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.955868Z","title":"LLMs achieve adult human performance on higher-order theory of mind tasks,","venue":null,"work_id":"72c65498-6c26-4cf1-923a-add6fc60243e","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.195587Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:9d8819fac6ecac2c3e75e9e047523f4751d17d569e1ec3b2d23170e9a5d8239e","observation_id":"818a5283-b747-4866-b203-b8079a4c805b","resolution":{"observed_at":"2026-08-11T15:04:39.961158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.941389Z","title":"Word autobots: Using transformers for word association in the game codenames,","venue":null,"work_id":"22ae66b7-c542-4825-b82d-cbfa701709fb","year":2020},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.200090Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:421aad8b77b84632485004658945f5595ce8db875833f779238bd862b8dba4fa","observation_id":"804c3586-7bb7-4d04-88ea-cf0bd26d0cf4","resolution":{"observed_at":"2026-08-11T15:04:39.946218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.927094Z","title":"Playing Codenames with Language Graphs and Word Embeddings,","venue":null,"work_id":"8aadda32-0d65-45d2-bd00-45722764710a","year":2021},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.204484Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:d638a14f5ed3880acc5e2dc88ac03861bd400c78f681cc336bea51ee7d8970bf","observation_id":"6cc3fe07-0614-46ac-afcb-4c5d7813cc24","resolution":{"observed_at":"2026-08-11T15:04:39.931713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.911480Z","title":"Adapting to teammates in a cooperative language game,","venue":null,"work_id":"9d950844-00f5-4ad7-a3e1-f119cd3938fe","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.208956Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:970b0f31c7ff4318a7d0b9108e48cf5580769b0eef1ad9e8ff5d5f54f7656c04","observation_id":"3e9de337-dff8-42b5-b725-c7918b2aafd6","resolution":{"observed_at":"2026-08-11T15:04:39.916655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.894456Z","title":"Noisy communication modeling for improved cooperation in codenames,","venue":null,"work_id":"cf03047e-c211-45a0-89d4-2da95f57d673","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.213267Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:7cf056666ba79fe5ef08cfa2d723ea2d987683ed0d93b7269c14a14496de31f3","observation_id":"279aa059-2e3c-4378-9d41-7da5308293e3","resolution":{"observed_at":"2026-08-11T15:04:39.899931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.880710Z","title":"ThinkSum: Probabilis- tic reasoning over sets using large language models,","venue":null,"work_id":"04843aab-87e0-499b-9082-652ccb5bbf1a","year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.217646Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:437849ce49e33a95f1f7d44369cc6feb4f175601d0b148d3f57e8bbedd3eaac6","observation_id":"09c2e3b7-51e6-4632-bf22-2ab2f559585b","resolution":{"observed_at":"2026-08-11T15:04:39.884924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.866493Z","title":"Large Language Models are Zero-Shot Reasoners,","venue":null,"work_id":"2767ec15-edb3-4db1-8e2f-858cfa759f14","year":2022},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.222073Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:38eff17f723a596befde499963b147a6c79a10f900d9228c2d2dce460926685f","observation_id":"7260ea2c-a4c9-452e-8af2-d17cc01ccf4a","resolution":{"observed_at":"2026-08-11T15:04:39.870893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.852387Z","title":"Self-Refine: Iterative Refinement with Self-Feedback,","venue":null,"work_id":"44c6f472-7c04-49cd-b788-037f3b5357e0","year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.226672Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:7ecb3d3f3d3d79d9253599802c3e458eb99b114e0a07546a1116107295628945","observation_id":"1930016f-fccd-4c5a-b3ff-8443e1df8264","resolution":{"observed_at":"2026-08-11T15:04:39.857002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.836704Z","title":"Unleashing the Emergent Cognitive Synergy in Large Language Models: A Task- Solving Agent through Multi-Persona Self-Collaboration,","venue":null,"work_id":"019ffa00-048c-4bd7-98a9-2538a8cb3b6d","year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.231054Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:8ef1d71aea2e08350b2e7bc23158a3e673a2ad9870339840027b796faf9af215","observation_id":"7ffcb101-ed85-44d5-83b5-dc3d4b45f3c0","resolution":{"observed_at":"2026-08-11T15:04:39.842119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-11T15:04:39.236693Z","title":"Efficient estimation of word representations in vector space,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.236693Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:fe9294f5f8eb40819e41f44313dad95fa9679665584acefee00a37e630b3d73b","observation_id":"d1edced3-fcdd-4898-b7c7-b6051bd8cee2","resolution":{"observed_at":"2026-08-11T15:04:39.236693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.240994Z","title":"GloVe: Global vectors for word representation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.240994Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:9a8c579ad93776449d2588a6a72bc55833bac8576e844e606d6851b76450e3ee","observation_id":"7a47810d-927f-4ff0-bb75-89fb5f625ade","resolution":{"observed_at":"2026-08-11T15:04:39.240994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.810038Z","title":"Concatenated power mean word embeddings as universal cross-lingual sentence representations,","venue":null,"work_id":"ca9d2565-ad6a-496e-bb08-f2e895513251","year":2018},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.246450Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:b7b89c6cc133929118684cda1656f49f79c86a9969d875e0c818d523185d0c4e","observation_id":"cd9f6a45-853d-4e21-a771-bdd9cd0eb6fd","resolution":{"observed_at":"2026-08-11T15:04:39.814965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.250962Z","title":"Human-ai collaboration in cooperative games: A study of playing codenames with an llm assistant,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.250962Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:5cae0e2e6483e2988202e5bdf6852068d21f5703d5917ea71c49bb8508306508","observation_id":"6a2722be-1261-4bf6-87c7-ae39d0a705b8","resolution":{"observed_at":"2026-08-11T15:04:39.250962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.794556Z","title":"Semantic Priming Effects In Visual Word Recognition: A Selective Review Of Current Findings And Theories,","venue":null,"work_id":"9b6f06cc-b55d-46cb-b604-6256178ee9c6","year":1990},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.256460Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:d228518de06798f21aa837b651ae24fb623570e1c0ec77f706780d56399a32eb","observation_id":"a9f0da6b-4d2d-483b-9394-80690c54fd50","resolution":{"observed_at":"2026-08-11T15:04:39.799558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.779835Z","title":"Prototypes Revisited,","venue":null,"work_id":"97fd7c59-58df-4ae0-aa00-1ebc961ca1e9","year":1991},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.261427Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:1a9b3f43689e401ae5315c6bf73574ebea1cd843f18f1c2a123eafa875875f5f","observation_id":"9f5d4445-7aba-46af-bbd3-3f0c3c8fee82","resolution":{"observed_at":"2026-08-11T15:04:39.784433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.765137Z","title":"Context-independent and context-dependent informa- tion in concepts,","venue":null,"work_id":"f1582506-b2b1-4ca1-9f51-63555a613236","year":1982},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.265579Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:588ded08fe6b83783fde9677ef3c082ccb60ce6c8938d2f38c9ef074c6a37dc8","observation_id":"f6cdfe12-e54f-4743-88a0-24a5f8cae024","resolution":{"observed_at":"2026-08-11T15:04:39.769921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.750110Z","title":"Human Learning from Artificial Intel- ligence: Evidence from Human Go Players’ Decisions after AlphaGo,","venue":null,"work_id":"0c2852e8-2e67-465c-aa7f-c251666b98bd","year":2021},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.270261Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:c7f9b5150aa72598f42974bb068df6bd373b72991e785c683c9f5da15e3c3e57","observation_id":"c46ee15c-2bcf-4864-ac5f-16a75f22cd1f","resolution":{"observed_at":"2026-08-11T15:04:39.755098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11672","last_updated":"2023-09-20T22:38:34Z","snapshot_observed_at":"2026-08-16T14:58:58.619625Z","submitted_at":"2023-09-20T22:38:34Z","title":"Generative AI in Mafia-like Game Simulation","version":1},"cited_work":{"arxiv_id":"2309.11672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11672","snapshot_observed_at":"2026-08-11T15:04:39.604115Z","title":"Generative AI in Mafia-like Game Simulation","venue":"cs.AI","work_id":"e42d4b04-f4d0-40f6-bd0b-61cc71c79098","year":2023},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.089343Z"},"links":{"cited_paper":"/paper/2309.11672","citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:f97e52f345438942c9ccdc1478a10f352bca8b217693b15289d4984e4629d45d","observation_id":"341c479d-6f9a-4f4a-aa8e-3fe80a6ca425","resolution":{"observed_at":"2026-08-11T15:04:39.610750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:04:39.098567Z","title":"Available: https://doi.org/10.1145/3649921.3650013","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T15:04:39.098567Z"},"links":{"citing_paper":"/paper/2412.11373"},"observation_digest":"sha256:44b25a23f109da33a334422f60868d22b73d2a67f9517dbaa731bed6f996959b","observation_id":"6de52024-8aaf-4918-b232-a21e783e1faa","resolution":{"observed_at":"2026-08-11T15:04:39.098567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11373","last_updated":"2025-04-21T22:53:07Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T11:44:20.037957Z","submitted_at":"2024-12-16T01:59:03Z","title":"Codenames as a Benchmark for Large Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2412.11373."}