{"as_of":"2026-08-03T08:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d6d8c474bf742aa0b66580443cd60140b74aed6da5bff0b7f6da7060d88af2e","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:16:58.323955Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:07:28.254518Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04746","snapshot_observed_at":"2026-08-01T21:07:28.254518Z","title":"Think in strokes, not pixels: Process-driven image generation via interleaved reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16401","last_updated":"2026-07-17T18:00:05Z","snapshot_observed_at":"2026-08-02T23:36:27.285941Z","submitted_at":"2026-07-17T18:00:05Z","title":"Apple-$\\pi$: Benchmarking Thinking with Video Towards Law-Grounded Physical Intelligence","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:28.254518Z"},"links":{"cited_paper":"/paper/2604.04746","citing_paper":"/paper/2607.16401"},"observation_digest":"sha256:a8da36c950173f6eb1773fe8a20336750576eb3b01bdcca9a317c923898c0bc1","observation_id":"7281173a-0a6c-4164-a079-ad1a89d19ed4","resolution":{"observed_at":"2026-08-01T21:07:28.254518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.04746/citation-record","integrity":"/paper/2604.04746/integrity","json":"/paper/2604.04746/citation-record.json","paper":"/paper/2604.04746"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.09712","last_updated":"2022-05-19T17:25:28Z","snapshot_observed_at":"2026-07-06T13:11:46.425668Z","submitted_at":"2022-05-19T17:25:28Z","title":"Selection-Inference: Exploiting Large Language Models for Interpretable Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2205.09712","doi":"10.48550/arxiv.2205.09712","metadata_source":"arxiv_reference","pith_arxiv_id":"2205.09712","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"16 Solving math word problems with process- and outcome-based feedback A","venue":null,"work_id":"5048437d-7d3e-4084-b687-32eb103350b9","year":2022},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2205.09712","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:ed1c92470ec79be43e321f0bd9279e691feaebaced5c6411dc2da4a5624d055f","observation_id":"c48b0112-00ed-4818-9745-dc8d6737318e","resolution":{"observed_at":"2026-05-10T23:10:53.823287Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-07-06T16:21:25.401345Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":null,"work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:b73f681acdcb115cec66398062736b5d0e203bebc7f3b1c060a4fa5da79606f4","observation_id":"122e0cea-d14a-401c-9c97-0662210c0192","resolution":{"observed_at":"2026-05-10T23:10:53.745000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2403.03206","doi":"10.48550/arxiv.2403.03206","metadata_source":"pith","pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-07-11T01:57:49.843312Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"4dc55d76-271e-42dd-878f-c20546599c69","year":2024},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:86235248bbf46ef302ec589be937eb745eea621473d95b8b81d74f4ed94263ae","observation_id":"f87889a0-6e2c-4247-a13e-21de85e6ef2e","resolution":{"observed_at":"2026-05-12T08:27:54.173931Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T11:19:49.764146+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":"2310.11513","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-07-04T13:19:50.698021Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","venue":null,"work_id":"39e1cc77-c682-4e20-bc57-ee5498213f92","year":2023},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:14c6850173891edd9530a87f5dbbfbd87b51d2a025498b1ebcbe0c7416b305d1","observation_id":"fe7b2ad6-500a-4de1-bdef-44db87f0268f","resolution":{"observed_at":"2026-05-10T23:10:53.793691Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:07720a3a565141455a3b52f8cca2bac9bd613734c778fa15580b93e5f0f19bd1","observation_id":"9c2a2f93-6c03-460c-b878-df31db549271","resolution":{"observed_at":"2026-05-10T23:10:53.770009Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16761","last_updated":"2025-03-29T09:24:00Z","snapshot_observed_at":"2026-07-06T19:56:48.086175Z","submitted_at":"2024-11-24T15:07:47Z","title":"Is 'Right' Right? Enhancing Object Orientation Understanding in Multimodal Large Language Models through Egocentric Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2411.16761","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.16761","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is’ right’right? enhancing object orientation understanding in multimodal language models through egocentric instruction tuning","venue":null,"work_id":"d75495f4-481a-4ec1-a4b5-31d7d825951b","year":2024},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2411.16761","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:5d3e31674642aee2fb2e36113f2ae817b00b9a5c8260a8ea5ba89526b36ba179","observation_id":"390e76f5-04cc-4123-aafa-e0252ab906b1","resolution":{"observed_at":"2026-05-10T23:10:53.787696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-07-06T19:49:17.129421Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2411.07975","doi":"10.48550/arxiv.2411.07975","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"2025.doi:10.48550/arXiv.2411.07975","venue":null,"work_id":"57d73d19-7fb3-40ec-aa67-42c6d678ec43","year":2024},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:6bc7734d7a170bd9a67d4a5d1ae14c149e14d1483d6e3f6abf92614ec1250625","observation_id":"cf9c15bd-dda4-4d12-bb6b-89ed2ba72ab1","resolution":{"observed_at":"2026-05-10T23:10:53.779102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":"2305.15021","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought","venue":null,"work_id":"c6649c65-8cc1-4f03-9b0d-fe81390ba1cc","year":2023},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:bef8f3cae0171660a7f8686afd0e18d8b3ab8b5b065f00675aa7cf85066b5b9d","observation_id":"b922f013-e444-4eac-bea0-709163224b4c","resolution":{"observed_at":"2026-05-10T23:10:53.736351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2503.07265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-07-04T13:19:50.710913Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","venue":"cs.CV","work_id":"604c1ae0-368d-49bf-8117-d688ac59f305","year":2025},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:f78eb3139e1e15b6844af8281630b17478fba6c81d8a012dfb5f596085b1627c","observation_id":"4243c24a-2608-44c6-bb20-c55d35749a40","resolution":{"observed_at":"2026-05-15T16:24:27.819650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-07-06T20:01:23.373458Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2412.03069","doi":"10.48550/arxiv.2412.03069","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.03069","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Tokenflow: Unified image tokenizer for multimodal understanding and generation","venue":null,"work_id":"6a964215-761a-438d-b579-a2699f32913f","year":2024},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2412.03069","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:201ccff8daa4f5f2a9bfbf17a8cc3003fba9c0a30f75e00176115a53cc01c19c","observation_id":"211c994b-f3f4-45f2-a9ff-72e6f011aac3","resolution":{"observed_at":"2026-05-10T23:10:53.714152Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2412.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-07-04T10:09:44.713840Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","venue":"cs.CV","work_id":"cc1e25c3-90c2-4e87-9268-d28d48c546a1","year":2024},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:26fcae9acdbe4eb952b09af958730afc2193e7402a08a1596d44d4bf6696d0af","observation_id":"c9bb5c41-7094-4727-b2ce-cf082f638fbd","resolution":{"observed_at":"2026-05-17T07:51:13.882527Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":"2408.11039","doi":"10.48550/arxiv.2408.11039","metadata_source":"pith","pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","venue":"cs.AI","work_id":"c2bb4d2d-29de-4bf2-9150-3d6373ff358f","year":2024},"citing_paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T19:16:58.323955Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2604.04746"},"observation_digest":"sha256:f975c3cfdcbbd81fe8c21bb07a17f7bf0d46b11881ae7434911eab6cb905f468","observation_id":"1f819ba7-250d-49e9-8d67-6f4ce8e40496","resolution":{"observed_at":"2026-05-13T05:57:27.005672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-03T06:30:56.289259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.04746","last_updated":"2026-04-08T01:34:51Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:53:37.357996Z","submitted_at":"2026-04-06T15:11:57Z","title":"Think in Strokes, Not Pixels: Process-Driven Image Generation via Interleaved Reasoning"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2604.04746."}