{"as_of":"2026-08-08T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c51ef382189a0d306a1dde3f1b2c28b17de259662ef2b13040a7a0963f6e38df","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:39:44.824894Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20369/citation-record","integrity":"/paper/2507.20369/integrity","json":"/paper/2507.20369/citation-record.json","paper":"/paper/2507.20369"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.579938Z","title":"Clusters models, factors and characteristics","venue":null,"work_id":"57019937-dd71-48e0-9371-4a6960e90828","year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.234249Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:2e45503696ce9f899a3ec9de8d51bb80ddbd333a3034a9256298c3a9ee358a86","observation_id":"624beb39-a21f-4ffb-8a62-7a6ba5275d20","resolution":{"observed_at":"2026-08-06T13:39:48.716144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.277778Z","title":"Data mining: concepts, models, methods, and algorithms","venue":null,"work_id":"bb55389f-5dc5-448e-9675-b849f9bade39","year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.306413Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:c4c40191d091950c8b1b352a1fe109fd2a3c5be8e957c507cf439e6347bb5da8","observation_id":"ebd62e6f-67c4-4ac1-8697-45c567b4c870","resolution":{"observed_at":"2026-08-06T13:39:48.434748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.956352Z","title":"A novel clustering approach: Artificial bee colony (abc) algorithm","venue":null,"work_id":"46b34d95-5d2a-4506-9fee-f0369be74123","year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.524538Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:f48582df3b9cce662fe50e1dba1d40aa471d4b2aae2bd0345feed8c1b942dee3","observation_id":"e7f032c1-26e3-4c12-8147-3466266b6205","resolution":{"observed_at":"2026-08-06T13:39:48.114991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.625255Z","title":"Data clustering: a review","venue":null,"work_id":"ff712829-fc64-479b-8f7f-80b20e026230","year":1999},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.624925Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:03e5bd402e3e85936bad1f4892f3cbe39a1e9e8bbfc61b470acb6cfa70f309e5","observation_id":"f57b3f2b-d751-4e8f-a717-92b320a4d7fa","resolution":{"observed_at":"2026-08-06T13:39:47.741517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.315471Z","title":"Data mining and knowledge discovery handbook","venue":null,"work_id":"f666d82e-84c4-433d-9d6d-df7db8ffb9b3","year":2010},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.754830Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:31a5c2082cb4e7f11f0df3aebeb51a3befd8c5b5f2f1e3ac83d7df52ad46fd65","observation_id":"231ffbb1-23d6-4143-ade5-5ba16bca18af","resolution":{"observed_at":"2026-08-06T13:39:47.431864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.989160Z","title":"Mathematical classification and clustering, volume 11","venue":null,"work_id":"ff115a97-5042-4792-992c-38dc901c40b8","year":1996},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.846811Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:5e6e9462264785a06f2f4e78169e25554226b8045c59aa0c5d87e9720b757e72","observation_id":"f5de3ba1-04b6-4a15-a2ba-ddf70c3cba66","resolution":{"observed_at":"2026-08-06T13:39:47.152747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.710992Z","title":"Some methods for classification and analysis of multivariate observations","venue":null,"work_id":"6a54a367-8eff-4f08-aa93-7c7efc854d42","year":1967},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:42.954767Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:28286c069f550f8bc780a1e59cbf0c36fcc1326ab77a7f8831cb5af6a8170e49","observation_id":"1ee9454d-decd-4133-91cd-6e56438073f7","resolution":{"observed_at":"2026-08-06T13:39:46.810385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.110416Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.110416Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:f309b859358a0c79c02fc199f217826a337c05601452fbd62b1d6cc5886121fc","observation_id":"3d7bc5db-4254-4839-892e-a166c680c87d","resolution":{"observed_at":"2026-08-06T13:39:43.110416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10510","last_updated":"2024-08-13T09:58:44Z","snapshot_observed_at":"2026-08-08T12:08:58.086464Z","submitted_at":"2021-12-20T13:07:39Z","title":"Transformers Can Do Bayesian Inference","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10510","snapshot_observed_at":"2026-08-06T13:39:43.205319Z","title":"Transformers can do bayesian inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.205319Z"},"links":{"cited_paper":"/paper/2112.10510","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:5d4cb8065aaae57e4d42be048adab28a171af4974f36d83347fd30bb94993bb3","observation_id":"57b28469-b0ee-4162-9e42-04a59c6559df","resolution":{"observed_at":"2026-08-06T13:39:43.205319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.01848","last_updated":"2023-09-16T09:33:32Z","snapshot_observed_at":"2026-07-06T13:27:49.894090Z","submitted_at":"2022-07-05T07:17:43Z","title":"TabPFN: A Transformer That Solves Small Tabular Classification Problems in a Second","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.01848","snapshot_observed_at":"2026-08-06T13:39:43.344754Z","title":"Tabpfn: A transformer that solves small tabular classification problems in a second","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.344754Z"},"links":{"cited_paper":"/paper/2207.01848","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:5f3a25cee16028a2520dc0861596fd24a209c0c59b3029cd6560b5cbafac6b27","observation_id":"fa4d1807-ae3e-4c96-ab52-74b2803d825d","resolution":{"observed_at":"2026-08-06T13:39:43.344754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.434764Z","title":"u ller, Lennart Purucker, Arjun Krishnakumar, Max K \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.434764Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:47131c41b67dd5633e23586ddc5ffbabd3db6f7d72b0fe6ee910e2419e00b2ca","observation_id":"ab45d90e-3418-4f41-a911-8348974500bd","resolution":{"observed_at":"2026-08-06T13:39:43.434764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.324607Z","title":"Efficient bayesian learning curve extrapolation using prior-data fitted networks","venue":null,"work_id":"d90bafed-5061-42b7-91c1-e5c2a52292a2","year":2022},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.562421Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:1fac5d8991b43111e6a27f92e042ca0fb4daadbc749454f5378d6553142c503d","observation_id":"f98b30ca-9531-4995-bcac-28156b5a31ac","resolution":{"observed_at":"2026-08-06T13:39:46.494900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.187459Z","title":"Forecastpfn: Universal forecasting for healthcare","venue":null,"work_id":"190ba0cd-e567-492d-917a-c9c059d23847","year":2023},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.723685Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:5ae6933c65d97a1fffc08db87635677ba00058b4d6b9cfeb76c883ba9e00112a","observation_id":"c0a74c63-03b7-420e-8ca3-7773b915f269","resolution":{"observed_at":"2026-08-06T13:39:46.206527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11097","last_updated":"2023-05-18T16:34:21Z","snapshot_observed_at":"2026-08-05T03:37:32.587185Z","submitted_at":"2023-05-18T16:34:21Z","title":"Statistical Foundations of Prior-Data Fitted Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11097","snapshot_observed_at":"2026-08-06T13:39:43.874825Z","title":"Statistical foundations of prior-data fitted networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:43.874825Z"},"links":{"cited_paper":"/paper/2305.11097","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:680b27015e21efa936342931d7fb0148200a0661278aaf96262d1441f6b24d1d","observation_id":"c7b8b196-460e-42c4-8e7d-e6028c0a66b0","resolution":{"observed_at":"2026-08-06T13:39:43.874825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.053838Z","title":"On the method of bounded differences","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.053838Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:ba1a8fdbb720b6de8726700c0d9609ba50716bd9a9019766bc315eac3a6f7bd0","observation_id":"8ac28109-46c2-42cd-bffa-a6d07e52ba0a","resolution":{"observed_at":"2026-08-06T13:39:44.053838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.204760Z","title":"Pedregosa, G","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.204760Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:32ec1f4cf5c945c31a0b0b5dd26e15a5acf8ee0af34bf216e11e63c18016663c","observation_id":"85346a02-3eb2-414c-bb54-dfc73cf21cd7","resolution":{"observed_at":"2026-08-06T13:39:44.204760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.691674Z","title":"V-measure: A conditional entropy-based external cluster evaluation measure","venue":null,"work_id":"429c761a-47c6-4102-b80b-39c05d34c339","year":2007},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.335634Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:85a0a519cd36ad85ab677b65d09cd982b04f57a274aecb9673f0fe56195d4804","observation_id":"402e3a24-ea65-4dc6-aa3e-474810627230","resolution":{"observed_at":"2026-08-06T13:39:45.926891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.482194Z","title":"The mnist database of handwritten digit images for machine learning research","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.482194Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:86d79fcb6ce2e3152405db5bab71bce00e6266b743e61292780d11de45722c5d","observation_id":"128ee1d8-e2c7-4a70-a5e0-5da71b37bbc9","resolution":{"observed_at":"2026-08-06T13:39:44.482194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.614993Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.614993Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:b8d9cd7f2d5e3f81f48041d678f0f0b31f1908b301fedfdcabfebff398dd9f0a","observation_id":"92783d63-bab6-4f23-be67-e8dd252d2c11","resolution":{"observed_at":"2026-08-06T13:39:44.614993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T13:39:44.729315Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.729315Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:fe7599c006cba97b8b7fadc2099d7b90fac6d289365b60d69a7200dfd7766768","observation_id":"55c6f77e-c517-4ec0-ada9-391492931caf","resolution":{"observed_at":"2026-08-06T13:39:44.729315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.325809Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"92737b3c-d025-4735-a93b-f21f532d72c1","year":2020},"citing_paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T13:39:44.824894Z"},"links":{"citing_paper":"/paper/2507.20369"},"observation_digest":"sha256:4676fb38a284c925e35baa8b2c78253f8fc3025e1bab821e83050437b911e625","observation_id":"878e9435-62fd-4c8b-839f-bc645583b020","resolution":{"observed_at":"2026-08-06T13:39:45.444893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20369","last_updated":"2025-07-27T17:53:19Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T18:30:16.125632Z","submitted_at":"2025-07-27T17:53:19Z","title":"Clustering by Attention: Leveraging Prior Fitted Transformers for Data Partitioning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2507.20369."}