{"as_of":"2026-08-21T07:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f11f979ad269322e0efd7157251081eaf366defd6a71811c81899e1894ecb14","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:41:46.360097Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:52:07.409740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T07:54:02.721760Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2507.12771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12771","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Local representative token guided merging for text-to-image generation","venue":null,"work_id":"847b2240-a600-4ab5-bd98-f68673abad6d","year":2025},"citing_paper":{"arxiv_id":"2605.18736","last_updated":"2026-08-17T17:15:02Z","snapshot_observed_at":"2026-08-20T23:16:45.343747Z","submitted_at":"2026-05-18T17:55:39Z","title":"Spectral Progressive Diffusion for Efficient Image and Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T11:07:47.135336Z"},"links":{"cited_paper":"/paper/2507.12771","citing_paper":"/paper/2605.18736"},"observation_digest":"sha256:29f6be08409b5fbb99240ee13e86251ed7cd864dce5ef72d21cdaf046fabe527","observation_id":"71337787-e711-4a7e-9c9b-544f5c0f80f1","resolution":{"observed_at":"2026-05-20T11:08:13.341658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2507.12771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12771","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Local representative token guided merging for text-to-image generation","venue":null,"work_id":"847b2240-a600-4ab5-bd98-f68673abad6d","year":2025},"citing_paper":{"arxiv_id":"2605.18736","last_updated":"2026-08-17T17:15:02Z","snapshot_observed_at":"2026-08-20T23:16:45.343747Z","submitted_at":"2026-05-18T17:55:39Z","title":"Spectral Progressive Diffusion for Efficient Image and Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T07:52:07.409740Z"},"links":{"cited_paper":"/paper/2507.12771","citing_paper":"/paper/2605.18736"},"observation_digest":"sha256:49b84c3aceeb7f1036038483f934503b5c233fae370ce3a0ac81f66bde0258e5","observation_id":"a57a8fc6-dc45-4cf9-81a8-4ad6ced21735","resolution":{"observed_at":"2026-05-21T07:54:02.723410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12771/citation-record","integrity":"/paper/2507.12771/integrity","json":"/paper/2507.12771/citation-record.json","paper":"/paper/2507.12771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.947585Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"90ac9ac1-e729-44d3-b39a-7b4d5a16ddb1","year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.165204Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:ce2a0e13662ff8573125fc09a0989d8eb2944f73467557ccc55f7729a61064b7","observation_id":"1d7872ab-dc6c-4724-a118-f15ea54e47d3","resolution":{"observed_at":"2026-08-06T16:41:46.953424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.930160Z","title":"Generative adversarial networks,","venue":null,"work_id":"3f5f3cd1-e964-4bb9-93db-e69301cbf17e","year":2020},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.171243Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:3e59a8f59dd650ff5b7d90bebd8fe248770b8d124d8f236f7291d13246ea70e6","observation_id":"a1fa7be8-e31d-4b52-b104-41ac0f3f1140","resolution":{"observed_at":"2026-08-06T16:41:46.935459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.913207Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"18e79a21-8580-457a-966c-736c2bd60224","year":2020},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.176994Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:db7d0796fe2dec2ce86ecd1da5cef4bc510d67af476756c43c5b27eb348ffc48","observation_id":"7718fa70-ff6e-4644-8861-1e5a539f213c","resolution":{"observed_at":"2026-08-06T16:41:46.918507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.897080Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"eab5272d-738e-4339-9920-88c3d7497cb1","year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.182383Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:64df288954b95c709bc40f45fd1b77741eb2e356cd2a4a1c8b1f9cd3b0d672f8","observation_id":"a4a23888-660f-4494-a99d-270a77d518d4","resolution":{"observed_at":"2026-08-06T16:41:46.901886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.878735Z","title":"Abstract representations of associated emotions in the human brain,","venue":null,"work_id":"aa711bfb-bd8a-4f0a-aafd-243bbb2cca67","year":2015},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.188308Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:d96110dce3fb67484a988dda2052ccfd256f041da3e0dc0d0ead966afb4ce18f","observation_id":"0336f37c-4e42-42df-9a05-14873778d116","resolution":{"observed_at":"2026-08-06T16:41:46.883672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.861764Z","title":"Translation-, rotation- and scale-invariant recognition of hand-drawn symbols in schematic diagrams,","venue":null,"work_id":"98496bc0-fa99-45b5-9d5d-5b1a21160f37","year":1990},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.194474Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:24934bc5a756962214a859e100034941e51384bfc62208e9ec58654dda9c1431","observation_id":"6d984404-ddbf-40c6-aba9-8f0f666c8e52","resolution":{"observed_at":"2026-08-06T16:41:46.867178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.200373Z","title":"Accurate object contour tracking based on boundary edge selection,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.200373Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:de58f25399b9b339d622c26819b853a1d6227c58f0041d9438a8daeb2ccae474","observation_id":"6dae20e8-5d52-4159-be74-9a2d1cb1e753","resolution":{"observed_at":"2026-08-06T16:41:46.200373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.835223Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"1d753dcb-0042-4822-8043-1f18aed2b839","year":2015},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.206242Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:c88746c08504ef851e274367257f3f4916d317df370e972fa7665f5ef2545b71","observation_id":"5caac2d0-c6c9-4ce0-a45e-177d455e3d3d","resolution":{"observed_at":"2026-08-06T16:41:46.840058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.818958Z","title":"Attention is all you need,","venue":null,"work_id":"a7056cc6-4677-43a0-a314-db2d435ec535","year":2017},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.211492Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:d2081608156527082add9a628341c32ebec2fc8f4fadc16724542d7d692a937c","observation_id":"9634e320-b328-430d-8d2b-9502a76353ba","resolution":{"observed_at":"2026-08-06T16:41:46.823496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.803578Z","title":"On distillation of guided diffusion models,","venue":null,"work_id":"45f2e005-a936-4094-bac3-a2f455451b79","year":2023},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.216982Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:9581e6c93daa037955babe0a26a5871ed42691e3f5ec4f2203d65b7e1a585a01","observation_id":"7c2039c1-c1c8-4aa9-99c6-4670b6155313","resolution":{"observed_at":"2026-08-06T16:41:46.808374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-08-12T01:14:44.484432Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-08-06T16:41:46.222114Z","title":"Progressive distillation for fast sampling of diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.222114Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:60b18ac9337c03032fb72cbe4effc9a5722a127a89a88586722ec3c8a692479c","observation_id":"1030e73a-32f4-4219-b8df-78cd4acf582d","resolution":{"observed_at":"2026-08-06T16:41:46.222114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.786588Z","title":"A-vit: Adaptive tokens for efficient vision transformer,","venue":null,"work_id":"9b746062-7d91-48d7-8af5-de483dcb9e3f","year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.227723Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:50ff2c65bc4bd91efc9cc815a0bfaa6fc84994fa65f337b27c4b0c70a3053536","observation_id":"5aebc30a-5657-476a-9f42-0641d98fab96","resolution":{"observed_at":"2026-08-06T16:41:46.791736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.770293Z","title":"Learned token pruning for transformers,","venue":null,"work_id":"bfea4ac7-3320-41dc-9eb5-fb192f1b2b4c","year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.233732Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:f7448d5b8068da39f2d87863d486ff59cd379c17c2114c22ceb65ccb1578f278","observation_id":"7e61dab4-83a2-4e70-9eb7-38ad305393be","resolution":{"observed_at":"2026-08-06T16:41:46.775129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.755267Z","title":"Tokenlearner: Adaptive space-time tokenization for videos,","venue":null,"work_id":"2288e736-952d-476f-b82e-066b34c5ebe1","year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.239834Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:ed455e71353348df3a1471ad751d004e294e294787183e47ffcd2f4751251038","observation_id":"701f7033-1e2e-4a17-82f2-2c8f7ec639e3","resolution":{"observed_at":"2026-08-06T16:41:46.759834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.739264Z","title":"Tore: Token reduction for efficient human mesh recovery with transformer,","venue":null,"work_id":"be62a2af-66e9-44e7-9958-19e24614435c","year":2023},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.245085Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:d7bd38e51b456d362654b833a58510521a0bf5e6764dadf065148d3abd751bda","observation_id":"948de0ff-d048-448b-a1f6-f668edfa2195","resolution":{"observed_at":"2026-08-06T16:41:46.744625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.725043Z","title":"Only train once: A one-shot neural network training and pruning framework,","venue":null,"work_id":"e96799a0-a6e5-4281-927e-29aaac7dd18e","year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.250273Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:304a84d1801d3a9980b1423ec12b81bdb5cfbd4e0bfc9c7ee86dda84778c2c47","observation_id":"69aabf9f-4ffe-4849-a443-1b1f145747e6","resolution":{"observed_at":"2026-08-06T16:41:46.729307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.707711Z","title":"Text extraction in mpeg compressed video for content-based indexing,","venue":null,"work_id":"2ade321f-a531-401f-92db-e5b0db753bcf","year":2000},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.255259Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:88022b0ab4e3302fafc7e7cc46955bb1b4c880d0f8db93ae182e357c160c3a02","observation_id":"11c63503-73e3-4929-873a-c2a53ad022a0","resolution":{"observed_at":"2026-08-06T16:41:46.714252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.689022Z","title":"Structural pruning for diffusion models,","venue":null,"work_id":"21cc70c7-b91b-4aa9-850a-e67b57d315d4","year":2023},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.260257Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:9ad952cdcedb457b6383e3a9f4a06294f4ac7a5c52d7e5601c28c9a9542db423","observation_id":"b0786fdd-c240-40e5-88c8-2210b7fb3c15","resolution":{"observed_at":"2026-08-06T16:41:46.694756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.673241Z","title":"Token merging: Your vit but faster,","venue":null,"work_id":"1c1496ea-6317-40f7-b2da-30eec3e93008","year":2023},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.265291Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:4653fbf6832b14a11949ae7b6024f40eb44d4f52ea2b31ae034738351a8fa45f","observation_id":"036a7aaa-fc5f-48ea-a246-69a576408589","resolution":{"observed_at":"2026-08-06T16:41:46.677973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.656765Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"0c5e4076-8cdc-4d62-b90d-a4dcc2049fbc","year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.271574Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:521498a3a2ab0e1c13515cace3aa7905e74b02fc0699a49f216cc0b49022c250","observation_id":"be2a9938-e7b8-452b-bbbb-0855cec90c22","resolution":{"observed_at":"2026-08-06T16:41:46.661439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.640897Z","title":"Token merging for fast stable diffusion,","venue":null,"work_id":"ace0a040-6e42-4e24-a906-6af1f9e93ae4","year":2023},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.277134Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:e3dafa925545caa1985e0ede309aee48fa426ad9d72539b504832c68e084b87a","observation_id":"7ee38390-e63e-481e-af30-130cd2a2bc0d","resolution":{"observed_at":"2026-08-06T16:41:46.645286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.626170Z","title":"Focal attention for long-range interactions in vision transformers,","venue":null,"work_id":"12072899-bf17-4f06-b57b-abe2befd821b","year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.282385Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:a9a899bc7d22ab34e92da3d747dcc226e1cbff4e94bf98427a58af6b64635f3b","observation_id":"d142d751-84c0-409e-b3bb-2e732b4c8374","resolution":{"observed_at":"2026-08-06T16:41:46.630630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.610808Z","title":"Understanding the effective receptive field in deep convolutional neural networks,","venue":null,"work_id":"0a7a02e1-9c06-4fbc-b400-99859e771343","year":2016},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.289455Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:88d32a7231b12274cc79ee9924ade2c8bc9a29063e7ab7310abf1595766b649b","observation_id":"61c503ee-d7ed-421f-8564-418881d984f2","resolution":{"observed_at":"2026-08-06T16:41:46.615842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.594164Z","title":"Autodiffusion: Training-free optimization of time steps and architectures for automated diffusion model acceleration,","venue":null,"work_id":"3426af4b-0df8-4eda-8a56-ba1e27427709","year":2023},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.296230Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:120964b470d229695a8029cdba045858bc5a074d1af3e412390d3b8c94493577","observation_id":"94d9b39a-0b39-455c-8b0a-c63e4c38670e","resolution":{"observed_at":"2026-08-06T16:41:46.599399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-08-18T13:49:48.200480Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-06T16:41:46.303474Z","title":"Dpm-solver++: Fast solver for guided sampling of dif- fusion probabilistic models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.303474Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:f2955fb26d407bd3c16ed775da1e5ed9c8c3c6e90c0ebcc5b11e42e7276c5e96","observation_id":"633b6bec-c68b-40fc-8330-3da09a3e99b3","resolution":{"observed_at":"2026-08-06T16:41:46.303474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.575239Z","title":"Stand-alone self-attention in vision models,","venue":null,"work_id":"809d9acc-bd8b-4758-bdf0-94597471a4e4","year":2019},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.310908Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:25755c6dab9afb3efc73cfa740b5625a99f520abfc980d25b467340806b7c0be","observation_id":"0dc8a288-0169-47d3-a701-07eeaaceb913","resolution":{"observed_at":"2026-08-06T16:41:46.580853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-18T08:33:42.893303Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-06T16:41:46.317905Z","title":"Self-attention does not need o(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.317905Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:6cebbe7f0850bf2784d5663e3e3841df2e9f0a13bbc6e98a6bdf4f70e710a87e","observation_id":"7216fa82-e54e-4411-b98e-efde2995ecbb","resolution":{"observed_at":"2026-08-06T16:41:46.317905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07800","last_updated":"2022-04-13T23:46:08Z","snapshot_observed_at":"2026-08-16T17:20:59.591211Z","submitted_at":"2022-02-16T00:19:42Z","title":"Not All Patches are What You Need: Expediting Vision Transformers via Token Reorganizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07800","snapshot_observed_at":"2026-08-06T16:41:46.326936Z","title":"Not all patches are what you need: Expediting vision transformers via token reorganizations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.326936Z"},"links":{"cited_paper":"/paper/2202.07800","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:ce48fd8a49c6e5e8264807ef6512387adbdd918e7d7c5dbeb6a7ddb8959d4424","observation_id":"fa967624-1162-48ec-92f1-0ca80caea4f8","resolution":{"observed_at":"2026-08-06T16:41:46.326936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.556656Z","title":"Groupvit: Semantic segmentation emerges from text supervision,","venue":null,"work_id":"de49416a-5291-4f0e-bc92-7af0cc9c89f9","year":2022},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.337298Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:400fd458e52a2bffccd692f46bd64d05f633ce29868990d88a8dd7966b0239c5","observation_id":"3ac4b1ee-fc21-410e-a993-0c527d5bcc18","resolution":{"observed_at":"2026-08-06T16:41:46.562119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16720","last_updated":"2025-04-24T21:37:00Z","snapshot_observed_at":"2026-08-19T00:15:02.547227Z","submitted_at":"2024-11-23T02:01:49Z","title":"Importance-Based Token Merging for Efficient Image and Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16720","snapshot_observed_at":"2026-08-06T16:41:46.341931Z","title":"Importance-based token merg- ing for diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.341931Z"},"links":{"cited_paper":"/paper/2411.16720","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:0ef13950506633a675c54025877cff245071fdfe9213f8dd4ce67e93414bdfb5","observation_id":"9c34d7d6-1947-4e07-988b-d84d2cb26193","resolution":{"observed_at":"2026-08-06T16:41:46.341931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.539499Z","title":"Agglomerative token clustering,","venue":null,"work_id":"4a312da4-1618-4b49-a701-98cf403f1ec7","year":2024},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.346967Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:03b63021c0e0a3ff9e376ddc17724ded95f9fecd4494475c8db7fc78aafe2ca3","observation_id":"422072b8-52ac-439b-b39b-b6a96389cfba","resolution":{"observed_at":"2026-08-06T16:41:46.545095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.521485Z","title":"Multilayer cluster neural network for totally unconstrained handwritten numeral recognition,","venue":null,"work_id":"3b870516-260d-41e1-87e4-a52abbfa5b87","year":1995},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.351247Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:649948e15aa1113dab2c9a67ae17bc9915f62523de2d05e3fd47fc4ff3f9385e","observation_id":"295e4b3d-d9da-49ce-a88a-9f3b0ab74550","resolution":{"observed_at":"2026-08-06T16:41:46.527147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.505298Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":"b02147c8-c441-4868-af0a-ccfcd1b92531","year":2009},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.355503Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:c65daf4e0bc78b42a63db279bc3bdfdf68a550eb984adbd89d1eac3c3d6a288f","observation_id":"19719e06-3d3e-474a-8629-73168731f9a9","resolution":{"observed_at":"2026-08-06T16:41:46.509929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:41:46.486961Z","title":"Clip- score: A reference-free evaluation metric for image captioning,","venue":null,"work_id":"c25a046e-5e1f-47fc-a660-e5cccd129893","year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.360097Z"},"links":{"citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:137c9d524b066770ac9c03377fa5b10f21e78861e624151ed0d02515bad050aa","observation_id":"af8d8e66-c5e0-459f-bdc2-ba36e926d659","resolution":{"observed_at":"2026-08-06T16:41:46.493734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T22:27:14.135588Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2507.12771."}