{"as_of":"2026-08-07T20:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b3547d7ac578f6e78bab719699cda7d31a2634487375cf7c2efa8e1d3b9fb8d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:39:24.622157Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":119,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2302.11550","last_updated":"2023-02-22T18:47:51Z","snapshot_observed_at":"2026-08-05T16:16:51.134330Z","submitted_at":"2023-02-22T18:47:51Z","title":"Scaling Robot Learning with Semantically Imagined Experience","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T18:59:10.352342Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2302.11550"},"observation_digest":"sha256:d6cdc449aba1e81dd62415ecf559d86327ed123d9866a4ea9ec0fdf5932083bf","observation_id":"9232872e-81f2-4cf9-80d4-dadf982e014b","resolution":{"observed_at":"2026-05-17T18:59:10.586456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:3ee60b22133c325417a4104acc23d4a30ad7ac7b0019a7789525f2b2fd60eb30","observation_id":"0f796b13-7c6f-4551-8c62-4e22c30ac520","resolution":{"observed_at":"2026-05-20T13:03:57.973110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T18:34:13.439993Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2309.15505"},"observation_digest":"sha256:d8cc74d6056676016e80e44de21806a0532c4ebae3dbff16c869ad554fd8b62b","observation_id":"a694b0ae-382a-41c6-b127-2f87bba00510","resolution":{"observed_at":"2026-05-16T18:34:13.478920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":173,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:ff539390b0584d01ad00709aaff961c83469faa4302ee394cd593e7b20728ac7","observation_id":"c77dcd03-48dd-492f-9de5-fdf451d90738","resolution":{"observed_at":"2026-05-16T02:15:18.633063Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2310.19512","last_updated":"2023-10-30T13:12:40Z","snapshot_observed_at":"2026-08-07T10:15:15.859263Z","submitted_at":"2023-10-30T13:12:40Z","title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:43.956642Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2310.19512"},"observation_digest":"sha256:d9477a8c20c2b55aa96722bcbaa3e310ade0f54df02661dc8234b71b22b4cbda","observation_id":"a07e5ce6-1751-4c76-9b09-d8f18e2bd385","resolution":{"observed_at":"2026-05-14T21:40:44.012282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:3928020eb72ad89499dc1726eae57e97eb897e5e2cd3040773566cf271c2a368","observation_id":"c40f8024-858c-4265-a131-657112c79235","resolution":{"observed_at":"2026-05-15T17:51:05.648073Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2405.06535","last_updated":"2026-04-07T11:38:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-10T15:27:35Z","title":"Controllable Image Generation with Composed Parallel Token Prediction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T00:53:36.830943Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2405.06535"},"observation_digest":"sha256:24e69986af999ca721fb53cbfd01288ea13b7ac151cabb2ca85934c95fbf481d","observation_id":"5b3eb7f1-a16f-4980-8df3-66b9a26b42c7","resolution":{"observed_at":"2026-05-24T00:53:40.560109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:dfdd6bf56d1632891b72612f9e855ee0f4b457853dde5e7f087aeb9a8095bbec","observation_id":"53a8d595-7b89-4e86-9456-b2e176e8dd26","resolution":{"observed_at":"2026-05-11T22:09:16.842300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T21:03:33.427939Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2408.12528"},"observation_digest":"sha256:016d03e6c995095d6faa211c0962b8abf1ad91ddb3d926e7c4cf90a28cef0d60","observation_id":"131f433b-66db-4afd-a722-86e083c996f1","resolution":{"observed_at":"2026-05-11T21:03:33.528653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:c74b3f68dd52096d42e39628e92dc74a0700b805c1070e6be7b4fb0eb363e269","observation_id":"80dc1c22-9878-45d2-9c2a-0b0e873d3836","resolution":{"observed_at":"2026-05-15T22:09:16.400212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T15:07:39.718555Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2412.14169"},"observation_digest":"sha256:818ec5f37246462f6ce67528534bd00f7e9754df5d9f65fdfd204313f42fa926","observation_id":"66e0d9ea-dd01-44ae-baca-dd2d23af5fab","resolution":{"observed_at":"2026-05-17T15:07:39.770391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T01:42:54.279353Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2502.09992"},"observation_digest":"sha256:92786e33ad3cb1a1b4bd0fc099b8e6086249754c1eea349cb4fc906101d34ff9","observation_id":"e4c62dd1-97f8-43f1-b85b-6c6e62cec95a","resolution":{"observed_at":"2026-05-11T01:42:54.605300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2505.14202","last_updated":"2026-04-06T02:54:59Z","snapshot_observed_at":"2026-07-30T11:23:54.758846Z","submitted_at":"2025-05-20T11:01:36Z","title":"MSDformer: Multi-scale Discrete Transformer For Time Series Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T13:44:08.891339Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.14202"},"observation_digest":"sha256:68095e31aeb234a27c55e0f5548e10eabf774999f684a7485b341222800896cc","observation_id":"2a1143d1-7a46-454e-9f27-222bada2c9f2","resolution":{"observed_at":"2026-05-22T13:44:52.815486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-15T14:50:59.661153Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.15809"},"observation_digest":"sha256:d03e33dc8658e6530908ebe0ad3bc07e365804cfa4f87dddf13f04e3cac9d8b7","observation_id":"25db7335-c11d-44ce-a2bb-695de5c292dd","resolution":{"observed_at":"2026-05-15T14:50:59.789654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T15:09:57.486525Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16195","last_updated":"2025-07-17T19:01:00Z","snapshot_observed_at":"2026-08-07T16:55:17.995778Z","submitted_at":"2025-05-22T03:58:16Z","title":"SpecMaskFoley: Steering Pretrained Spectral Masked Generative Transformer Toward Synchronized Video-to-audio Synthesis via ControlNet","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:57.486525Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.16195"},"observation_digest":"sha256:4fa5f01915e56c35baa8c92601d0a4677fdc73a449f2c4d66af0287b9d10c551","observation_id":"e77c68c5-45da-461b-aeba-416f1234010b","resolution":{"observed_at":"2026-08-07T15:09:57.486525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T14:59:32.902329Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-07T14:52:06.219322Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:32.902329Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.16839"},"observation_digest":"sha256:f0d7f3d9c629d74ff8ebae4572bb40d78c91ef56bc524f49362aa3c6e8fb3d4b","observation_id":"9e99710c-9d77-427f-8763-c4e96e5bdcd7","resolution":{"observed_at":"2026-08-07T14:59:32.902329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T12:48:35.069080Z","title":"Chang, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-07T12:43:06.135305Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:35.069080Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:71a09ebe21104d673aee958c4b5195c005de3218a9f2ab4ca3d39b13cf8c1d33","observation_id":"f51b3af5-c512-4de2-977c-a437fe25ccf4","resolution":{"observed_at":"2026-08-07T12:48:35.069080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T12:03:23.180725Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00736","last_updated":"2025-05-31T22:51:36Z","snapshot_observed_at":"2026-08-07T11:56:46.448865Z","submitted_at":"2025-05-31T22:51:36Z","title":"IMPACT: Iterative Mask-based Parallel Decoding for Text-to-Audio Generation with Diffusion Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:23.180725Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.00736"},"observation_digest":"sha256:226f89373d4339740f56a97f3b74fd8e0494959cd742235626bf3c82f1a0a551","observation_id":"20a3d936-6f55-46db-9e63-6e5bf523bf11","resolution":{"observed_at":"2026-08-07T12:03:23.180725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T11:15:21.740312Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-07T11:05:47.576480Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:21.740312Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:151f519ebd9f3fc878e7fbffe181685f4b212ac3f9658c5cc2be67d94348ac0f","observation_id":"36887104-8b08-42f6-9869-9f24112971e3","resolution":{"observed_at":"2026-08-07T11:15:21.740312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T10:47:52.273933Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-07T20:35:26.253139Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.273933Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:9978ef1a09f6e5c3f40c26bfd0fe25c0a8249228b7bfb365fad27c25a1dd8aca","observation_id":"4b2b60c7-2598-43c8-ad79-1de3049e13ba","resolution":{"observed_at":"2026-08-07T10:47:52.273933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T05:59:47.443309Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06483","last_updated":"2025-06-06T19:17:37Z","snapshot_observed_at":"2026-08-07T05:53:21.416034Z","submitted_at":"2025-06-06T19:17:37Z","title":"Noise Consistency Regularization for Improved Subject-Driven Image Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:47.443309Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.06483"},"observation_digest":"sha256:24db930de5dc6f0d2febe809322ea7f65d4530253bf8c9e1594ac18251515389","observation_id":"c3712f10-5504-470b-a3ff-dff63c008640","resolution":{"observed_at":"2026-08-07T05:59:47.443309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T05:40:23.832417Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07350","last_updated":"2025-06-09T01:55:55Z","snapshot_observed_at":"2026-08-07T05:33:52.887442Z","submitted_at":"2025-06-09T01:55:55Z","title":"MapBERT: Bitwise Masked Modeling for Real-Time Semantic Mapping Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:40:23.832417Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.07350"},"observation_digest":"sha256:86a7a2f47219d4fd303cd6199bf7e6a7e870e48cd4cd443262946c2fdbdfb90b","observation_id":"c9c346ec-e6fd-49ab-adf8-2a271f52af36","resolution":{"observed_at":"2026-08-07T05:40:23.832417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T15:39:24.622157Z","title":"T., Rubinstein, M., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11029","last_updated":"2025-05-20T14:31:06Z","snapshot_observed_at":"2026-08-07T17:25:35.605499Z","submitted_at":"2025-05-20T14:31:06Z","title":"Output Scaling: YingLong-Delayed Chain of Thought in a Large Pretrained Time Series Forecasting Model","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:24.622157Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.11029"},"observation_digest":"sha256:ff8a7efce43744e2733a98cde36b5c39a55936d6a1eea362727e6eb314545a9b","observation_id":"ff38e35f-58a8-4028-8e43-25e4f3c590c4","resolution":{"observed_at":"2026-08-07T15:39:24.622157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T14:51:36.281876Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12035","last_updated":"2025-05-22T23:26:56Z","snapshot_observed_at":"2026-08-07T14:46:29.395685Z","submitted_at":"2025-05-22T23:26:56Z","title":"MARch\\'e: Fast Masked Autoregressive Image Generation with Cache-Aware Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:36.281876Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.12035"},"observation_digest":"sha256:9723501fbfff264f4c41671d56468b8448b6ce583a4df2968dd36df9b6bdb40e","observation_id":"93898f86-93a1-4007-bbe9-fd4ddcd0c70e","resolution":{"observed_at":"2026-08-07T14:51:36.281876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T23:35:33.442154Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17505","last_updated":"2025-06-20T22:57:59Z","snapshot_observed_at":"2026-08-06T23:28:17.388124Z","submitted_at":"2025-06-20T22:57:59Z","title":"Learning golf swing signatures from a single wrist-worn inertial sensor","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:33.442154Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2506.17505"},"observation_digest":"sha256:3e36d6fdac89a316f18542580464646de3bb5d4c077ef27d87ca568bbcd946d5","observation_id":"7f962a37-9a2e-400b-9a7d-5a0dbce28b9d","resolution":{"observed_at":"2026-08-06T23:35:33.442154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-07T04:52:09.670357Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00006","last_updated":"2025-06-11T08:02:40Z","snapshot_observed_at":"2026-08-07T04:44:38.114223Z","submitted_at":"2025-06-11T08:02:40Z","title":"MVGBench: Comprehensive Benchmark for Multi-view Generation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:52:09.670357Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.00006"},"observation_digest":"sha256:a2895d3ea0c2d726cc8c6f562227c5eeab459827075d45ef461340490bfa79b2","observation_id":"e8f6cd43-d7dc-455d-a05e-11b2a34633df","resolution":{"observed_at":"2026-08-07T04:52:09.670357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T21:12:05.800608Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00868","last_updated":"2025-07-02T09:16:31Z","snapshot_observed_at":"2026-08-07T11:30:47.074232Z","submitted_at":"2025-07-01T15:32:23Z","title":"Is Visual in-Context Learning for Compositional Medical Tasks within Reach?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:05.800608Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.00868"},"observation_digest":"sha256:5ee06f5498ccbf122da6063b5b148585fc829a377ce997fcef0d05dfe1e45369","observation_id":"53d434c6-451e-4728-bb7a-2559e37af9e4","resolution":{"observed_at":"2026-08-06T21:12:05.800608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T20:43:53.858179Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01938","last_updated":"2025-07-02T17:48:01Z","snapshot_observed_at":"2026-08-06T20:37:34.091982Z","submitted_at":"2025-07-02T17:48:01Z","title":"CI-VID: A Coherent Interleaved Text-Video Dataset","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:43:53.858179Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.01938"},"observation_digest":"sha256:81b1b380a2162870d0084bc6e1fe25671920934ee3d67fb294d5781b62e2822e","observation_id":"dc6d1286-0035-4aa1-9ff1-5e25eab8a452","resolution":{"observed_at":"2026-08-06T20:43:53.858179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T19:41:23.621281Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04947","last_updated":"2025-07-07T12:45:23Z","snapshot_observed_at":"2026-08-07T20:39:28.423628Z","submitted_at":"2025-07-07T12:45:23Z","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:23.621281Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.04947"},"observation_digest":"sha256:7c43a55d0b00905749d0e80e323e877849b2638b5b9624ccce56bb2456501990","observation_id":"0757d32b-5882-4aac-a7ab-e83195aef7f6","resolution":{"observed_at":"2026-08-06T19:41:23.621281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T16:58:28.623018Z","title":"Muse: Text-to- image generation via masked generative transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12136","last_updated":"2025-07-16T11:09:50Z","snapshot_observed_at":"2026-08-06T16:50:28.555352Z","submitted_at":"2025-07-16T11:09:50Z","title":"Room Impulse Response Generation Conditioned on Acoustic Parameters","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:58:28.623018Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.12136"},"observation_digest":"sha256:36c00fe1b8fc9f1d166bfb9081e125fcfb492d08f6821a2aed0c85c1db74a878","observation_id":"ed205e6c-4d82-4db4-bc82-fb3e72b207a6","resolution":{"observed_at":"2026-08-06T16:58:28.623018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T16:48:29.960911Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13401","last_updated":"2025-07-16T20:56:57Z","snapshot_observed_at":"2026-08-06T16:40:31.286737Z","submitted_at":"2025-07-16T20:56:57Z","title":"MADI: Masking-Augmented Diffusion with Inference-Time Scaling for Visual Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:29.960911Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.13401"},"observation_digest":"sha256:b3949d5e9bd6d3bad9ee8e7c191abde72e1932e82fce708ddea0a8c815d403b0","observation_id":"07764351-64d3-4d07-9710-39ec82cf5df2","resolution":{"observed_at":"2026-08-06T16:48:29.960911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T14:28:45.675804Z","title":"URL: https://arxiv.org/abs/2301.00704, arXiv:2301.00704","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19372","last_updated":"2025-07-25T15:24:56Z","snapshot_observed_at":"2026-08-07T03:09:58.031141Z","submitted_at":"2025-07-25T15:24:56Z","title":"Learning neuro-symbolic convergent term rewriting systems","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:28:45.675804Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2507.19372"},"observation_digest":"sha256:efc2664a5eba3a6d91ceb59abefa2dff6d26d1a23bd933cb9637da14f3e7765a","observation_id":"3469a9a0-887f-4059-ad72-6d7dc63615e5","resolution":{"observed_at":"2026-08-06T14:28:45.675804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-06T00:04:32.077010Z","title":"Muse: Text-to-image gen- eration via masked generative transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04472","last_updated":"2025-08-06T14:19:32Z","snapshot_observed_at":"2026-08-06T00:04:30.410604Z","submitted_at":"2025-08-06T14:19:32Z","title":"Zero-Residual Concept Erasure via Progressive Alignment in Text-to-Image Model","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T00:04:32.077010Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2508.04472"},"observation_digest":"sha256:6b0dd684321b8e370de376a9ac5d061c7413db459fd3141f693f09b8894a8c17","observation_id":"7235f01d-ba09-49de-a38a-6496680f10d2","resolution":{"observed_at":"2026-08-06T00:04:32.077010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T18:37:17.815731Z","title":"Muse: Text-to-image generation via masked generative transform- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14441","last_updated":"2025-08-20T05:53:05Z","snapshot_observed_at":"2026-08-05T18:37:15.366913Z","submitted_at":"2025-08-20T05:53:05Z","title":"FBI: Learning Dexterous In-hand Manipulation with Dynamic Visuotactile Shortcut Policy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T18:37:17.815731Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2508.14441"},"observation_digest":"sha256:2ee4c9b21c2ec03ae3a669540337ab7b1979286755e893d5bcf59a401c27baa1","observation_id":"c0233a12-2300-4dcf-8ad9-faf649f90181","resolution":{"observed_at":"2026-08-05T18:37:17.815731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-04T16:43:49.262777Z","title":"T.; Rubinstein, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.12046","last_updated":"2026-07-04T12:10:43Z","snapshot_observed_at":"2026-08-06T10:47:51.701860Z","submitted_at":"2025-09-15T15:27:29Z","title":"Layout-Conditioned Autoregressive Text-to-Image Generation via Structured Masking","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T16:43:49.262777Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2509.12046"},"observation_digest":"sha256:7254efb723681402588429dceec26a3022a6d6fdb749f76b6c67aba416e51647","observation_id":"03f319a0-c123-4471-9679-1616fb66726a","resolution":{"observed_at":"2026-08-04T16:43:49.262777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-04T15:39:34.022747Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-04T15:39:16.754746Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:34.022747Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:c0a0ea7b7ad60f40fe851e7b50f94a06656bfa1e6935593ac46eb708b1c55615","observation_id":"a3eeabf2-40d5-4655-b1f5-f0bdfb7aee7c","resolution":{"observed_at":"2026-08-04T15:39:34.022747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-04T11:08:02.386459Z","title":"Muse: Text-to-image generation via masked generative trans- formers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.06928","last_updated":"2026-05-27T05:34:49Z","snapshot_observed_at":"2026-08-04T11:07:55.834219Z","submitted_at":"2025-10-08T12:08:21Z","title":"IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T11:08:02.386459Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2510.06928"},"observation_digest":"sha256:19baf4d0e97624185832d071d3c1131daf0334bb5fb063c0a75841b524cae840","observation_id":"5b9524c7-760c-40a4-b39b-46c5de90dd0f","resolution":{"observed_at":"2026-08-04T11:08:02.386459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T20:15:25.700535Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20651","last_updated":"2026-07-21T00:23:00Z","snapshot_observed_at":"2026-08-04T02:39:13.955398Z","submitted_at":"2025-11-25T18:59:55Z","title":"RubricRL: Simple Generalizable Rewards for Text-to-Image Generation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:25.700535Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2511.20651"},"observation_digest":"sha256:fd9b36bed04c82207a8070ce6d254a20a0614a827740fc59c671f66cd0428cd2","observation_id":"71063a29-1ae8-45a6-87fa-202e586ea3d0","resolution":{"observed_at":"2026-08-03T20:15:25.700535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T16:21:31.725029Z","title":"Muse: Text-to-image generation via masked generative transform- ers.arXiv preprint arXiv:2301.00704, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-04T04:44:58.323566Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:31.725029Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:45b774df2971f8ce4711f03f9541f2bda7c59d12a77870a327d4a75e8bff757d","observation_id":"ab85a340-a5c4-4404-a48d-c2a01f7d38e5","resolution":{"observed_at":"2026-08-03T16:21:31.725029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-03T08:16:22.354776Z","title":"Muse: Text-to-image generation via masked generative transformers.arXiv preprint arXiv:2301.00704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.17737","last_updated":"2026-05-27T06:53:57Z","snapshot_observed_at":"2026-08-07T17:02:56.952261Z","submitted_at":"2026-01-25T08:10:28Z","title":"The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T08:16:22.354776Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2601.17737"},"observation_digest":"sha256:e49973efc4e9b6a5a61b495ac05ddc5b420d2f15505f34acc795ff3fdac7f202","observation_id":"e823a537-1fdc-4c00-bb45-09ecb3b07f47","resolution":{"observed_at":"2026-08-03T08:16:22.354776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2603.00918","last_updated":"2026-05-10T14:01:21Z","snapshot_observed_at":"2026-07-06T22:47:24.369805Z","submitted_at":"2026-03-01T04:39:09Z","title":"Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T18:40:18.940889Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2603.00918"},"observation_digest":"sha256:3fea57e48a8951a65cf0a4be73afbbcc772bede8bbd20fa583e87c6432a94c80","observation_id":"e8362087-437c-4cbf-a03b-83b1d4e73e9b","resolution":{"observed_at":"2026-05-15T18:41:28.773088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2603.02667","last_updated":"2026-05-17T06:09:20Z","snapshot_observed_at":"2026-07-06T22:47:37.679205Z","submitted_at":"2026-03-03T06:54:19Z","title":"Unifying Contrastive and Generative Objectives for Visual Understanding and Text-to-Image Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T12:15:57.019720Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2603.02667"},"observation_digest":"sha256:7ded6fb04dd131603ce05fde7e578a12f45f782bba4143944e787d2f86336f4d","observation_id":"a83873ff-e267-4133-8856-ff170a96f15b","resolution":{"observed_at":"2026-05-21T12:20:06.998166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2604.05730","last_updated":"2026-04-07T11:33:52Z","snapshot_observed_at":"2026-08-05T07:50:50.379461Z","submitted_at":"2026-04-07T11:33:52Z","title":"Controllable Image Generation with Composed Parallel Token Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:33:03.066564Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2604.05730"},"observation_digest":"sha256:848ddd0d50095b7fd2c8a785c2c6e91978f38c7d423271831ea0321d4552fdec","observation_id":"ef4784c5-9a87-4b1d-9891-5fb6a6b4e38f","resolution":{"observed_at":"2026-05-10T22:50:48.709020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:54.235578Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:d89ba4beb64fd25b711b9fb2d90ce5e32a256eb786641e278a48bcd4ca2e39a8","observation_id":"14212172-9d6b-4810-9261-eae613d889da","resolution":{"observed_at":"2026-05-10T05:36:01.840743Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2604.18518","last_updated":"2026-05-28T03:18:18Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:16:50Z","title":"UDM-GRPO: Stable and Efficient Group Relative Policy Optimization for Uniform Discrete Diffusion Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-05T11:32:38.636335Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2604.18518"},"observation_digest":"sha256:162d37606ad6e057d90506aaac5d6ec1cf1f2517fa671170cfd53613153daf2b","observation_id":"7d97494e-1a26-412c-a643-e19525e82873","resolution":{"observed_at":"2026-07-05T11:41:02.733153Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.07193","last_updated":"2026-05-08T03:40:39Z","snapshot_observed_at":"2026-08-02T09:51:08.410161Z","submitted_at":"2026-05-08T03:40:39Z","title":"Coupling Models for One-Step Discrete Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-11T02:58:10.909499Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.07193"},"observation_digest":"sha256:bbf5389f3d6624f9eccab4060c9b21e20ebdd5bcb71d8e9d75fd9a912e98dc51","observation_id":"83ed988c-ef11-45c2-a602-6aad93d637dc","resolution":{"observed_at":"2026-05-11T03:00:55.161047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.15661","last_updated":"2026-05-15T06:32:49Z","snapshot_observed_at":"2026-07-06T23:26:56.013191Z","submitted_at":"2026-05-15T06:32:49Z","title":"VAGS: Velocity Adaptive Guidance Scale for Image Editing and Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T18:33:47.573164Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.15661"},"observation_digest":"sha256:da512415016561cd115a04ec0511cfc83f184e9a10b654660259003571763200","observation_id":"9d6ce223-0082-4686-ae56-d033d04f4f12","resolution":{"observed_at":"2026-05-20T18:33:53.079392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.17232","last_updated":"2026-07-22T19:34:37Z","snapshot_observed_at":"2026-08-02T13:52:45.590847Z","submitted_at":"2026-05-17T03:00:23Z","title":"Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-20T14:47:33.474443Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.17232"},"observation_digest":"sha256:d03bbb6d563a5ba5cdd4cd2da15351cf174b6c24c94158bce8ba9a32fd6a7f44","observation_id":"609ca211-2bb8-4d53-b578-5bbb2630e701","resolution":{"observed_at":"2026-05-20T14:48:23.247806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.17232","last_updated":"2026-07-22T19:34:37Z","snapshot_observed_at":"2026-08-02T13:52:45.590847Z","submitted_at":"2026-05-17T03:00:23Z","title":"Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T19:13:35.794787Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.17232"},"observation_digest":"sha256:377f5ffa7b7b7a53d0fa52cd04e6dc61852eafca8b43b27ce92f16e849c63ecb","observation_id":"04ea7e06-9606-4226-9f00-13106dcbd614","resolution":{"observed_at":"2026-06-30T19:15:00.171208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-02T13:53:01.557172Z","title":"Muse: Text-to-image generation via masked generative transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.17232","last_updated":"2026-07-22T19:34:37Z","snapshot_observed_at":"2026-08-02T13:52:45.590847Z","submitted_at":"2026-05-17T03:00:23Z","title":"Dimension-Free Convergence of Discrete Diffusion Models: Adjoint Equations Induce the Right Space","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T13:53:01.557172Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.17232"},"observation_digest":"sha256:bd0d4d6036c14208a2046e924c8eec0390d13afd9e56571df02262e337dec9ab","observation_id":"281bbec6-d233-4b26-9316-e46384d8f824","resolution":{"observed_at":"2026-08-02T13:53:01.557172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.19190","last_updated":"2026-05-18T23:34:53Z","snapshot_observed_at":"2026-08-02T02:36:37.244109Z","submitted_at":"2026-05-18T23:34:53Z","title":"Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T07:06:57.555070Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.19190"},"observation_digest":"sha256:c4875d333b1c2a9c03aade69f5bfd89d84716d6765fc33f093c36a1c31595403","observation_id":"bc82891e-2ef2-4cef-886d-9807b393be94","resolution":{"observed_at":"2026-05-20T07:08:07.000756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2605.25751","last_updated":"2026-05-25T12:02:43Z","snapshot_observed_at":"2026-08-03T08:41:58.471008Z","submitted_at":"2026-05-25T12:02:43Z","title":"SplitAvatar: One-shot Head Avatar with Autoregressive Gaussian Splitting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T23:02:13.380306Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2605.25751"},"observation_digest":"sha256:a97b9487da8394e42d00f7ce45809d982e2e6afd3197222e7911992c74ebd46b","observation_id":"41295a1b-dadb-4525-8144-73c64613c3ba","resolution":{"observed_at":"2026-06-29T23:04:00.978197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.03578","last_updated":"2026-06-02T12:47:14Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T12:47:14Z","title":"Diffusing in the Right Space: A Systematic Study of Latent Diffusability","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T10:44:24.318786Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.03578"},"observation_digest":"sha256:ecb6776e114f7aeb5e40066c1da303bc84b82fbf9ee32f6e972014581bddbe0c","observation_id":"98eb01a1-65d2-4d36-b016-935ee963d365","resolution":{"observed_at":"2026-07-02T02:36:27.646872Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.04935","last_updated":"2026-07-07T17:04:28Z","snapshot_observed_at":"2026-08-06T13:56:30.086076Z","submitted_at":"2026-06-03T14:24:53Z","title":"What Type of Inference is Active Inference?","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T06:45:53.233544Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.04935"},"observation_digest":"sha256:b8e2cd392c21b40f998620c7432e7d865b9e3474adcea2b0b5cc86dce5632ee0","observation_id":"b7772da1-d62b-4175-b2b5-9909ce03c38b","resolution":{"observed_at":"2026-06-28T06:51:44.836825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.11188","last_updated":"2026-06-09T17:59:28Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:59:28Z","title":"ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:29:11.526106Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.11188"},"observation_digest":"sha256:9d316193b84c9b688301d1c089b29353e9c92931b61acf952e169b5bd58d2406","observation_id":"05d80a24-c1eb-495f-8d8c-cf224c716547","resolution":{"observed_at":"2026-07-03T05:07:38.441534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.20658","last_updated":"2026-06-09T08:09:48Z","snapshot_observed_at":"2026-08-01T16:26:27.186003Z","submitted_at":"2026-06-09T08:09:48Z","title":"Expected Free Energy-based Planning as Variational Inference","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:28.078342Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.20658"},"observation_digest":"sha256:fcb3cd9e985266f4bda4035a33e7edf395f4433b26b73ab89ff1e3faec935240","observation_id":"5a832f26-c88c-40e4-81b6-d31f4a969b93","resolution":{"observed_at":"2026-06-27T13:40:57.096595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.24192","last_updated":"2026-06-23T06:22:00Z","snapshot_observed_at":"2026-08-06T06:51:13.657171Z","submitted_at":"2026-06-23T06:22:00Z","title":"Co-occurring associated retained concepts in Diffusion Unlearning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T00:50:58.689718Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.24192"},"observation_digest":"sha256:94b8206baea7aab66c97f266c5af68d91c28413840e72d90fb7f0d2af5946ece","observation_id":"4e6b0e0c-9da9-4d51-bef2-c9129619da42","resolution":{"observed_at":"2026-07-04T16:09:57.475269Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":"2301.00704","doi":"10.48550/arxiv.2301.00704","metadata_source":"pith","pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muse: Text-to- image generation via masked generative transformers","venue":"cs.CV","work_id":"ad8925f8-72d8-4ac4-88b8-027e08b46103","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":153,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:a3485302b00071ad3826a167eb9d74e5f0b6e693fb25a709ac1c5cee88f46741","observation_id":"7d4417cc-c09e-40ff-9e0e-29344603c31c","resolution":{"observed_at":"2026-07-01T11:55:42.259206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00704","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2301.00704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2301.00704","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:fc0dd580ac9c4d295d40f1646a7d5032078ce29f0d8eaefc1eea5c5cdc259076","observation_id":"bda92eb2-a1ff-4c83-8505-db6d71b2ede1","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2301.00704/citation-record","integrity":"/paper/2301.00704/integrity","json":"/paper/2301.00704/citation-record.json","paper":"/paper/2301.00704"},"outbound":[],"paper":{"arxiv_id":"2301.00704","last_updated":"2023-01-02T14:43:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T00:33:47.397969Z","submitted_at":"2023-01-02T14:43:38Z","title":"Muse: Text-To-Image Generation via Masked Generative Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 59 inbound Pith citation observations for arXiv:2301.00704."}