{"as_of":"2026-08-07T06:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d886ee05c61fe0b6ab8c73df7ec615cf984367380cdbcc7b077aecc48e5791d","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T08:04:12.949075Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:38.987981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:09:57.573753Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-03T13:18:34.276013Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T09:37:57.120779Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:e62c5a839c1f5ee7a4456ecc463d43a7b90157b64d2af5843b654c722d4992d4","observation_id":"5bc87f17-5a4e-4882-8373-20ec8e90cca4","resolution":{"observed_at":"2026-05-16T09:40:49.001525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-03T13:18:34.276013Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:167952bd62603364482e75d0e6c2826141b37410d7a70e36c71cb4c37bfa093e","observation_id":"2f636823-3802-4b33-bad4-320f77a7a7d2","resolution":{"observed_at":"2026-05-21T14:10:13.506735Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-03T05:57:49.524269Z","title":"arXiv preprint arXiv:2512.07584 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.00813","last_updated":"2026-07-01T09:09:00Z","snapshot_observed_at":"2026-08-06T05:03:36.580231Z","submitted_at":"2026-01-31T16:42:55Z","title":"Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T05:57:49.524269Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2602.00813"},"observation_digest":"sha256:00efa1107eca7b4353025b39625bff827748d3773c18c37e95e5efc27c86ef13","observation_id":"14559017-f7d2-4222-9cb0-6ca298e98113","resolution":{"observed_at":"2026-08-03T05:57:49.524269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-02T18:25:57.227130Z","title":"Longcat-image technical report.arXiv preprint arXiv:2512.07584, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.11593","last_updated":"2026-07-17T15:14:37Z","snapshot_observed_at":"2026-08-02T18:25:48.658946Z","submitted_at":"2026-03-12T06:25:09Z","title":"WeEdit: A Dataset, Benchmark and Glyph-Guided Framework for Text-centric Image Editing","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T18:25:57.227130Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2603.11593"},"observation_digest":"sha256:eae5ba41cf2a689cb66535c86436ccfdca91d77a49bda8d764ac70ac847db539","observation_id":"90ecf533-48e8-4a48-bf94-91fda535ab25","resolution":{"observed_at":"2026-08-02T18:25:57.227130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-03T00:57:56.689235Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27790","last_updated":"2026-07-30T18:37:19Z","snapshot_observed_at":"2026-08-05T23:10:26.419571Z","submitted_at":"2026-03-29T18:02:56Z","title":"Inference-time Trajectory Optimization for Structure-Preserving Manga Image Editing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T00:57:56.689235Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2603.27790"},"observation_digest":"sha256:f4904420d298a64b1c22c63475a9772c43a037fdf5537575b2686ab9d66ba4b9","observation_id":"4bcec20d-3e38-495e-9ea7-3d4b58c10b7b","resolution":{"observed_at":"2026-08-03T00:57:56.689235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-14T21:18:10.087258Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:e4c796e64d75c7499d7aa420289fd69eaaf0e8b0a8d8add3a9fb2a5664504bc0","observation_id":"00b2f9f7-1885-4fc2-8332-16bd102e6681","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2603.28767","last_updated":"2026-05-22T17:26:49Z","snapshot_observed_at":"2026-07-06T22:51:09.377351Z","submitted_at":"2026-03-30T17:59:56Z","title":"Gen-Searcher: Reinforcing Agentic Search for Image Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T06:31:13.232880Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2603.28767"},"observation_digest":"sha256:93a76a3ce9672f0ec3f0f157071339d3f907999f49b17508ae3cb51c657ec990","observation_id":"3c013827-5173-4366-b977-2bed29af7048","resolution":{"observed_at":"2026-05-25T06:35:25.116236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.04911","last_updated":"2026-04-08T04:54:06Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-04-06T17:54:42Z","title":"SpatialEdit: Benchmarking Fine-Grained Image Spatial Editing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T19:23:50.614589Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.04911"},"observation_digest":"sha256:82d817f7f39ac77d637b07feeffcbb1b4632194ae790f1ba01b61b9cc850775d","observation_id":"d181c44f-f871-46bb-bd22-7d60c268b957","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.09249","last_updated":"2026-04-13T09:14:45Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T12:03:55Z","title":"FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T18:09:27.385799Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.09249"},"observation_digest":"sha256:4c9b76268ddcb9585668876474757a2417a1c85da0f4045abccec47ffa1535e0","observation_id":"3d4f15aa-987c-4600-b718-ca68b24a34bc","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.10954","last_updated":"2026-04-13T03:50:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T03:50:56Z","title":"FineEdit: Fine-Grained Image Edit with Bounding Box Guidance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:15:23.578176Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.10954"},"observation_digest":"sha256:785011517307f809e1bac6741fba0f26a0be59fa7b4645f630130276a3d0344b","observation_id":"e373609a-e2ec-4b06-aae9-af7f325bfa47","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.20796","last_updated":"2026-04-22T17:20:42Z","snapshot_observed_at":"2026-07-06T23:07:31.559812Z","submitted_at":"2026-04-22T17:20:42Z","title":"LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T00:49:38.156237Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.20796"},"observation_digest":"sha256:9edd70c9a533bbc9b2a0572c36c1fcdb8289b6fef1190e82f5ebdaa81ed27284","observation_id":"9acdaa3c-c9a8-4c7b-9325-639c6719a7ed","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T04:31:26.325118Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:81d81bde01e929458197a39246e336d8fd00b4b71fa8f85fa5b09b09711a5b83","observation_id":"b86c029a-a496-4696-a796-f65e8e57c5b8","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.24763","last_updated":"2026-05-18T04:20:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:59:56Z","title":"Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T23:41:25.275207Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.24763"},"observation_digest":"sha256:b4b2ef3bf18ac8034563957dad26f5016a50f43e4cbfe3855c58e6d0f1d2edfc","observation_id":"0454ea17-2581-470b-a4cf-6ed4919cf638","resolution":{"observed_at":"2026-05-20T23:43:51.192137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2604.25477","last_updated":"2026-04-28T10:30:01Z","snapshot_observed_at":"2026-07-06T23:11:21.433834Z","submitted_at":"2026-04-28T10:30:01Z","title":"DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:44:23.162726Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2604.25477"},"observation_digest":"sha256:d2a00fdf536d8286d286092d8bd8ca769d2ea3fd717bab936abd44944de3a006","observation_id":"e6407dff-9705-4b86-afee-73f05f1833de","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-08T17:57:08.606559Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:13500162a7ac1cf8d616d0ce24e596657ff9bf1e8ded0a3834819e8b7d23df07","observation_id":"38adc94f-de51-42b7-a265-1707320edba9","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.04128","last_updated":"2026-05-20T08:56:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-05T15:49:47Z","title":"JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T08:15:58.020894Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.04128"},"observation_digest":"sha256:1da2972c03706931738b6e317903775ba77f47f40853cf3a09935cffec2da2be","observation_id":"8fb70b1c-f0f8-4f0f-9312-a5fdec7c5155","resolution":{"observed_at":"2026-05-21T08:19:52.745748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.04566","last_updated":"2026-05-06T07:11:50Z","snapshot_observed_at":"2026-08-06T10:06:55.489844Z","submitted_at":"2026-05-06T07:11:50Z","title":"Open-Source Image Editing Models Are Zero-Shot Vision Learners","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-08T16:44:53.286118Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.04566"},"observation_digest":"sha256:b3752b1de213c0e8668c5c36e498717d5b855e521ad93f9666e264acd586c9c0","observation_id":"aa3b25c3-3600-4fe8-a1f6-6b1426760956","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.06170","last_updated":"2026-05-07T12:53:51Z","snapshot_observed_at":"2026-08-03T02:25:15.814006Z","submitted_at":"2026-05-07T12:53:51Z","title":"DynT2I-Eval: A Dynamic Evaluation Framework for Text-to-Image Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T13:54:00.141439Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.06170"},"observation_digest":"sha256:f8cac15a8a63e03835f04e13f594e2cc5634872bdfb916a7f6f5d937f317d448","observation_id":"e69643e9-d56f-44ad-a19c-6c3c3eae8456","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.06376","last_updated":"2026-05-07T14:56:39Z","snapshot_observed_at":"2026-07-06T23:18:51.157048Z","submitted_at":"2026-05-07T14:56:39Z","title":"Continuous-Time Distribution Matching for Few-Step Diffusion Distillation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-08T13:28:42.083284Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.06376"},"observation_digest":"sha256:5c7751bc14a22f33ee14a5239178830c0e21bf58b6b64cd8de5e746558c12cd0","observation_id":"9ee769e6-9cdd-4907-8751-873dbd41fb10","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.10730","last_updated":"2026-05-11T15:34:56Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T15:34:56Z","title":"Qwen-Image-2.0 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:18.312613Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.10730"},"observation_digest":"sha256:d371ba6bc85834d4707b98370e28de119092d85fdd85d54cb2d49507e0fada35","observation_id":"ded175fd-62e5-46e6-b4de-cfdc1c52817d","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.11818","last_updated":"2026-05-12T09:09:01Z","snapshot_observed_at":"2026-08-02T21:46:06.216835Z","submitted_at":"2026-05-12T09:09:01Z","title":"RevealLayer: Disentangling Hidden and Visible Layers via Occlusion-Aware Image Decomposition","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-13T07:46:50.540528Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.11818"},"observation_digest":"sha256:66fb3c221a2d354b4f580c02f72ab726cea01c12f163550e37bbf225f070a127","observation_id":"189392aa-2111-449d-a3ab-864cc4d77966","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.11832","last_updated":"2026-05-12T09:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T09:21:29Z","title":"Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-13T05:25:18.120832Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.11832"},"observation_digest":"sha256:1100906ae0a1d5cccdd68f952237886d96b1e4a78249b87c8dd2cf0282083064","observation_id":"838d5c97-3ccb-4a72-aab0-da79130e38bc","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:53:21.851578Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:940e40fb30bcdca5091439e2cb3315053b99116f9928d133701171eb918a1f4c","observation_id":"7651314b-648e-4ae9-9270-1635c76699fa","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.12088","last_updated":"2026-05-13T15:41:37Z","snapshot_observed_at":"2026-07-06T23:23:48.960874Z","submitted_at":"2026-05-12T13:10:05Z","title":"UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T22:00:01.349754Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.12088"},"observation_digest":"sha256:d631db4361502d733fb2c972bdbe7fba0889e835a03cdc1cf2c038d00d3606d8","observation_id":"07e2ffac-9eff-4176-a52d-8a7b7afd1ed3","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:ba8e4fb2abdee3f349a84cb6ab6cf4bb84a70f84e52e02381d722de2f7ff179e","observation_id":"f49d02a3-453d-4aca-8187-80fd158c7b87","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.13062","last_updated":"2026-05-13T06:33:54Z","snapshot_observed_at":"2026-08-02T05:13:16.597072Z","submitted_at":"2026-05-13T06:33:54Z","title":"Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-14T20:22:20.464966Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.13062"},"observation_digest":"sha256:f6e240ce642e4eb2b124a8de8c46b18fc3abe7119e1304b329a41733b4a2e7ff","observation_id":"835d25a4-0e09-45a1-b499-f111c6765fde","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.13122","last_updated":"2026-05-13T07:48:05Z","snapshot_observed_at":"2026-07-06T23:24:42.799888Z","submitted_at":"2026-05-13T07:48:05Z","title":"Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T19:44:36.511647Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.13122"},"observation_digest":"sha256:3bd0086524583a7e071448f6ce6e11b5ab017a05f1cbbe0eb313e4d60dd586c1","observation_id":"79025296-9fa3-4001-bca5-0f8d4a175530","resolution":{"observed_at":"2026-05-16T08:04:13.097348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.14876","last_updated":"2026-05-15T05:10:39Z","snapshot_observed_at":"2026-08-02T23:16:15.609028Z","submitted_at":"2026-05-14T14:22:25Z","title":"Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T16:35:43.166697Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.14876"},"observation_digest":"sha256:02a1528189cc3fc6c5d20f43822300ab5168479336731e6918d8aedbb3224e0e","observation_id":"e02ce576-b94a-4e6b-94de-6e86c2a91a3b","resolution":{"observed_at":"2026-05-19T16:37:39.780535Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.15523","last_updated":"2026-05-27T02:31:06Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T01:44:17Z","title":"Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T15:09:47.549243Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.15523"},"observation_digest":"sha256:043243a30b2935194512f0e1b63321186a5f00e6d1aa70b2f05289f68e48fbe3","observation_id":"1e30b6f2-f8c7-4f24-9c66-166bed1bac8a","resolution":{"observed_at":"2026-05-19T15:12:37.557179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.15523","last_updated":"2026-05-27T02:31:06Z","snapshot_observed_at":"2026-07-06T23:26:46.595393Z","submitted_at":"2026-05-15T01:44:17Z","title":"Self-Prompting Diffusion Transformer for Open-Vocabulary Scene Text Editing via In-Context Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T19:56:16.026242Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.15523"},"observation_digest":"sha256:572f3fd7eaf6501b10d24ab5b6a9e5d6b88c84a91adca4db4ed45fa8b54114cc","observation_id":"28635ad3-7819-4d41-a568-50d118776764","resolution":{"observed_at":"2026-07-01T14:45:50.316447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.16842","last_updated":"2026-05-16T06:59:54Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T06:59:54Z","title":"Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T21:18:03.005508Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.16842"},"observation_digest":"sha256:19d2204a0fe23fd59f7123e3c01349744af25028b7f798ca5d3bcae595146524","observation_id":"c84aceb3-dec1-47a1-a36f-7825ee420759","resolution":{"observed_at":"2026-05-19T21:22:48.609181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.19660","last_updated":"2026-05-19T10:53:03Z","snapshot_observed_at":"2026-08-02T21:06:34.067413Z","submitted_at":"2026-05-19T10:53:03Z","title":"OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T07:57:51.032025Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.19660"},"observation_digest":"sha256:e1691de6d1a914a21c4fa267ca6af34ac6c3d472c4f0a1026aaa0c631fdf605e","observation_id":"4aadfc4a-679b-46cc-80cd-91613848ca31","resolution":{"observed_at":"2026-05-20T07:58:07.616421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.21090","last_updated":"2026-05-20T12:22:26Z","snapshot_observed_at":"2026-08-02T11:48:01.614885Z","submitted_at":"2026-05-20T12:22:26Z","title":"TextSculptor: Training and Benchmarking Scene Text Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T05:16:43.756525Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.21090"},"observation_digest":"sha256:f23211ffbccdbacf1819a3296173aa1ff14aa934227aca7d1e94bff3860c7296","observation_id":"ad4f41a2-5759-4c78-95e3-59860989fcc4","resolution":{"observed_at":"2026-05-21T05:19:39.364125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.21573","last_updated":"2026-05-20T17:59:58Z","snapshot_observed_at":"2026-08-02T08:45:09.575827Z","submitted_at":"2026-05-20T17:59:58Z","title":"Lens: Rethinking Training Efficiency for Foundational Text-to-Image Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T09:34:14.596976Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.21573"},"observation_digest":"sha256:d8cb86248bc962ffcf656f9577976b1c4eab50c68e63fc9d5cc1110deb1be8e6","observation_id":"b4d6b919-0d38-4796-b73d-596a3287f721","resolution":{"observed_at":"2026-05-22T09:34:46.693481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:29:05.360018Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.21605"},"observation_digest":"sha256:15ac2f46ccb37b5fff56c72eb8f73b4c8d55e59c1e28a11f953bffb4571b0246","observation_id":"678232cf-9163-4325-9864-dd1690ac849d","resolution":{"observed_at":"2026-05-22T09:31:22.978052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.21605","last_updated":"2026-05-22T02:16:59Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:12:29Z","title":"GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T05:38:33.676797Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.21605"},"observation_digest":"sha256:7b9e67a134e64c7b78a24f792742994ffc7b4f82da5192b28f1af18a29616656","observation_id":"c2e572b7-5a8b-4559-8e61-dadaf06faba9","resolution":{"observed_at":"2026-05-25T05:40:24.021806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2605.25569","last_updated":"2026-05-26T06:12:18Z","snapshot_observed_at":"2026-07-31T07:00:53.404747Z","submitted_at":"2026-05-25T08:23:56Z","title":"ControlLight: Towards Controllable, Consistent, and Generalizable Low-Light Enhancement","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T23:03:05.701686Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2605.25569"},"observation_digest":"sha256:b384142fe365e5fdfd221dd80a3961e42fd35650115d9bc77a8b1d1b4f55ee20","observation_id":"cf4d177e-c982-44f5-8e03-0615c9a0dbd7","resolution":{"observed_at":"2026-06-29T23:04:00.855811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.00188","last_updated":"2026-05-29T16:01:14Z","snapshot_observed_at":"2026-08-06T10:44:36.257317Z","submitted_at":"2026-05-29T16:01:14Z","title":"PaintBench: Deterministic Evaluation of Precise Visual Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T19:20:04.516202Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.00188"},"observation_digest":"sha256:8ef43912ac6f376a149b53b6dbff870c064073ca80098fe0b966b9bd4336c7ba","observation_id":"ff735590-a6e0-4e0c-924e-8ef88a703522","resolution":{"observed_at":"2026-06-28T19:22:34.344342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.05730","last_updated":"2026-06-04T05:43:24Z","snapshot_observed_at":"2026-08-02T13:55:48.184123Z","submitted_at":"2026-06-04T05:43:24Z","title":"TextWand: A Unified Framework for Scene Text Editing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T01:56:46.514177Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.05730"},"observation_digest":"sha256:4e03d88bfcb8df00fed09bdc0f28c487c5a01b5865feeceb3206d817d0024c6c","observation_id":"d4cb7013-3f61-4b2c-bebd-7d4c41ae19b9","resolution":{"observed_at":"2026-07-02T12:36:57.272474Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.05778","last_updated":"2026-06-29T06:50:49Z","snapshot_observed_at":"2026-08-07T02:29:37.120052Z","submitted_at":"2026-06-04T07:07:01Z","title":"Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T02:30:45.673752Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.05778"},"observation_digest":"sha256:7b189eb15fe5cb5301c0fa191397ac98842d7af3ae6ef31decf52eb255bbcef0","observation_id":"95202534-ad41-4254-b62c-cff68b38a66d","resolution":{"observed_at":"2026-07-02T12:06:55.947542Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.05778","last_updated":"2026-06-29T06:50:49Z","snapshot_observed_at":"2026-08-07T02:29:37.120052Z","submitted_at":"2026-06-04T07:07:01Z","title":"Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T11:11:21.975534Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.05778"},"observation_digest":"sha256:c0ab27a43e50a0d36eff8245215043d57b407d132136367b1605df7192c1bf4e","observation_id":"294d94fa-b3d2-49ff-9869-6e0b54006c27","resolution":{"observed_at":"2026-06-30T11:14:37.657074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.13679","last_updated":"2026-06-11T17:59:50Z","snapshot_observed_at":"2026-07-06T23:52:23.981568Z","submitted_at":"2026-06-11T17:59:50Z","title":"InterleaveThinker: Reinforcing Agentic Interleaved Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:42:34.126336Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.13679"},"observation_digest":"sha256:b722370af89026d7eb836838d8f67fecb6937be52ec04ff942120c2e42315193","observation_id":"e510f435-3329-41ab-bc78-655d6f61a217","resolution":{"observed_at":"2026-07-03T15:08:32.874817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.23221","last_updated":"2026-06-22T12:09:29Z","snapshot_observed_at":"2026-07-06T23:57:57.606047Z","submitted_at":"2026-06-22T12:09:29Z","title":"RS-Gen: A Multi-Stage Agentic Framework for Reasoning and Search-Augmented Image Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T08:59:40.467458Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.23221"},"observation_digest":"sha256:92fbd4b3d047bedb73cee9451959161dd71578cd0c81895e62ed1b4ec2fccc6a","observation_id":"cf3f6560-3849-4a3b-8fca-4f654ace8018","resolution":{"observed_at":"2026-07-04T10:19:47.379911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.24333","last_updated":"2026-06-23T09:11:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:11:24Z","title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T00:50:22.839005Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.24333"},"observation_digest":"sha256:c44509f4763185411a80e005e0260531a2296aad79d4f8439fc185cd31565e66","observation_id":"352d1d6b-bfa4-46c0-a239-11fb7f7bbd39","resolution":{"observed_at":"2026-07-04T16:09:57.575090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.27880","last_updated":"2026-06-26T09:23:25Z","snapshot_observed_at":"2026-07-07T00:02:04.432452Z","submitted_at":"2026-06-26T09:23:25Z","title":"OrthoTryOn: Geometric Orthogonalization for Conflict-Free Unified Fashion Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-29T04:29:09.130025Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.27880"},"observation_digest":"sha256:008704616c9ffb4c5391df37a1f3a3c2a641668e9a42e434f67a8e755361df4d","observation_id":"ae4fd954-3101-4971-9c0c-125f47c5121f","resolution":{"observed_at":"2026-07-01T16:55:50.942261Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.28144","last_updated":"2026-06-26T14:41:13Z","snapshot_observed_at":"2026-08-06T12:08:08.410087Z","submitted_at":"2026-06-26T14:41:13Z","title":"Monocular Avatar Reconstruction via Cascaded Diffusion Priors and UV-Space Differentiable Shading","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-29T04:30:34.811205Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.28144"},"observation_digest":"sha256:19a0a244b75b14c555db1598856600be668868820d6f17eb676e87e80f6d159f","observation_id":"86c0c891-9df9-4e99-b20c-ba012024ba53","resolution":{"observed_at":"2026-06-29T20:03:57.382354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2606.29308","last_updated":"2026-06-28T10:07:38Z","snapshot_observed_at":"2026-07-07T00:03:16.968118Z","submitted_at":"2026-06-28T10:07:38Z","title":"MirrorPPR: Exemplar-Based Portrait Photo Retouching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T07:50:25.117845Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2606.29308"},"observation_digest":"sha256:6931c245c666ccf60a1fc8adb05e2cee603d9f18411a3d44491c050abb081f20","observation_id":"ba7f2fb6-8123-4acb-84a8-afd2e07e67e0","resolution":{"observed_at":"2026-06-30T07:54:22.086899Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2607.00410","last_updated":"2026-07-01T04:12:45Z","snapshot_observed_at":"2026-08-05T21:00:12.416879Z","submitted_at":"2026-07-01T04:12:45Z","title":"MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-02T15:24:08.345483Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.00410"},"observation_digest":"sha256:171fadbcefcc62b073987152b75f2c52558c9ada6c404b7d73d3eda751cf767c","observation_id":"4eeb9ba2-7305-4c62-b722-c54a860c9905","resolution":{"observed_at":"2026-07-02T15:27:04.662699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2512.07584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-04T16:09:57.573753Z","title":"LongCat-Image Technical Report","venue":"cs.CV","work_id":"648d9514-ca31-4ba0-983a-1aba1057a97e","year":2025},"citing_paper":{"arxiv_id":"2607.01709","last_updated":"2026-07-02T05:00:40Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T05:00:40Z","title":"COMFYCLAW: Self-Evolving Skill Harnesses for Image Generation Workflows","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-03T14:22:25.280140Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.01709"},"observation_digest":"sha256:002bd92d04930563b5cb99a1455645ae1a063bf1f0bcdf7647a0ba7c1df13599","observation_id":"3ac297df-67f2-4219-9b1d-e80704ae7a2b","resolution":{"observed_at":"2026-07-03T14:28:31.237417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-12T01:35:43.979206Z","title":"Longcat-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03562","last_updated":"2026-07-03T18:52:42Z","snapshot_observed_at":"2026-08-07T06:14:13.409347Z","submitted_at":"2026-07-03T18:52:42Z","title":"XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T01:35:43.979206Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.03562"},"observation_digest":"sha256:8b76972735f9d8a356be1ac026413ce96277fb18699652ad313d4b8ddae3516b","observation_id":"741bf507-52ed-4f41-9e96-031c6dad2d31","resolution":{"observed_at":"2026-07-12T01:35:43.979206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-07-14T06:20:23.251121Z","title":"arXiv preprint arXiv:2512.07584 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11199","last_updated":"2026-07-13T07:50:54Z","snapshot_observed_at":"2026-07-16T23:19:15.382857Z","submitted_at":"2026-07-13T07:50:54Z","title":"DynEval: Holistic Evaluations of T2I Generative Models in the Wild","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-14T06:20:23.251121Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.11199"},"observation_digest":"sha256:8d22a15e7c1c85338ffb277b128ae51f1f95b6dca24b1e04978401d274784bcf","observation_id":"f3b5a891-e789-4d8e-aa27-55d9bce660f3","resolution":{"observed_at":"2026-07-14T06:20:23.251121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-02T06:14:03.536741Z","title":"Longcat-image technical report.arXiv preprint arXiv:2512.07584, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13125","last_updated":"2026-07-18T17:28:17Z","snapshot_observed_at":"2026-08-03T17:18:33.842709Z","submitted_at":"2026-07-14T17:52:05Z","title":"Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget","version":2},"reference_index":122,"source":"pdf_text","source_observed_at":"2026-08-02T06:14:03.536741Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.13125"},"observation_digest":"sha256:4e0a61dead341b2786f3d420cf3cf861438147c6ba764c849724473a6b32dfd7","observation_id":"94a09113-b191-4060-95e9-c4a64c3caf9a","resolution":{"observed_at":"2026-08-02T06:14:03.536741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-01T16:12:23.762958Z","title":"arXiv preprint arXiv:2512.07584 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18091","last_updated":"2026-07-20T15:55:33Z","snapshot_observed_at":"2026-08-05T15:24:58.642792Z","submitted_at":"2026-07-20T15:55:33Z","title":"SciForma: Structure-Faithful Generation of Scientific Diagrams","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T16:12:23.762958Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.18091"},"observation_digest":"sha256:266abd48ae7a1a105bf75e4d9276bbb4b25d06da6de0b8c80b018409cefd9d67","observation_id":"b7e2c99c-8ce9-4c0d-82f7-6fd3e7b8b8ea","resolution":{"observed_at":"2026-08-01T16:12:23.762958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-01T15:43:01.150238Z","title":"LongCat-Image technical report.arXiv preprint arXiv:2512.07584, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18237","last_updated":"2026-07-20T17:59:51Z","snapshot_observed_at":"2026-08-06T02:32:50.045651Z","submitted_at":"2026-07-20T17:59:51Z","title":"The Many Senses of Visual Similarity: A Text-Prompted Image Perceptual Metric","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T15:43:01.150238Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.18237"},"observation_digest":"sha256:99330a9bf68ff1b5f19aa71368bde0bb434d9a4d75ec9c70dd18fc896aec4e23","observation_id":"27429766-5990-48f7-bd3e-34c7de2fc427","resolution":{"observed_at":"2026-08-01T15:43:01.150238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-01T13:38:58.078447Z","title":"LongCat-Image technical report.arXiv preprint arXiv:2512.07584, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19064","last_updated":"2026-07-22T15:23:32Z","snapshot_observed_at":"2026-08-06T06:06:33.902183Z","submitted_at":"2026-07-21T12:55:34Z","title":"Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:38:58.078447Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2607.19064"},"observation_digest":"sha256:002ad850cbc7c9b5ff119585c69f47d72522379da8ba4a10cb3d7967cd27c027","observation_id":"2f36cf89-305f-4a2a-8bea-5aff780c04d2","resolution":{"observed_at":"2026-08-01T13:38:58.078447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-05T00:46:23.113783Z","title":"arXiv preprint arXiv:2512.07584 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00559","last_updated":"2026-08-01T09:42:45Z","snapshot_observed_at":"2026-08-06T23:17:27.466923Z","submitted_at":"2026-08-01T09:42:45Z","title":"Test-Time Curriculum for Open-Set AIGC Detection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T00:46:23.113783Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.00559"},"observation_digest":"sha256:1defc1cf32a9d9c3ceb6adb215833436372083a35543c71a68a1ceb648a780d9","observation_id":"af7ab97f-e70a-446b-aa4c-1a7a7b0cf8e3","resolution":{"observed_at":"2026-08-05T00:46:23.113783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-04T06:04:05.728155Z","title":"arXiv preprint arXiv:2512.07584 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02502","last_updated":"2026-08-03T17:04:43Z","snapshot_observed_at":"2026-08-07T02:32:45.381681Z","submitted_at":"2026-08-03T17:04:43Z","title":"CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:04:05.728155Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.02502"},"observation_digest":"sha256:d7d19f07a028160adb30b3bd33980b8321738d55842202fc845ae06551b57298","observation_id":"ba1db92a-2630-4efb-91ae-673c54486540","resolution":{"observed_at":"2026-08-04T06:04:05.728155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-04T04:09:51.542639Z","title":"Longcat-image technical report.arXiv preprint arXiv:2512.07584,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02589","last_updated":"2026-08-03T17:57:03Z","snapshot_observed_at":"2026-08-07T04:06:20.351418Z","submitted_at":"2026-08-03T17:57:03Z","title":"CAPEval: A Decoupled Caption Evaluation across Understanding and Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T04:09:51.542639Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.02589"},"observation_digest":"sha256:2c37bf05f99f31f678096ccc959fa6c71a54d1cc012208df13b294c40be93d8d","observation_id":"446143d6-f499-4551-b330-86af913451f2","resolution":{"observed_at":"2026-08-04T04:09:51.542639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07584","snapshot_observed_at":"2026-08-07T00:15:38.987981Z","title":"Longcat-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04436","last_updated":"2026-08-05T04:26:19Z","snapshot_observed_at":"2026-08-07T06:28:08.988644Z","submitted_at":"2026-08-05T04:26:19Z","title":"ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:38.987981Z"},"links":{"cited_paper":"/paper/2512.07584","citing_paper":"/paper/2608.04436"},"observation_digest":"sha256:3ba8e50017c40ad15b96a55155db66723169ef0fe5b931ffa9911a35d986f2f7","observation_id":"8691bc38-f3cb-4d90-83b1-b31ccbf23de2","resolution":{"observed_at":"2026-08-07T00:15:38.987981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.07584/citation-record","integrity":"/paper/2512.07584/integrity","json":"/paper/2512.07584/citation-record.json","paper":"/paper/2512.07584"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02324","last_updated":"2025-08-04T11:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-04T11:49:20Z","title":"Qwen-Image Technical Report","version":1},"cited_work":{"arxiv_id":"2508.02324","doi":"10.48550/arxiv.2508.02324","metadata_source":"pith","pith_arxiv_id":"2508.02324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Image Technical Report","venue":"cs.CV","work_id":"d06d7ecc-7579-4f89-a60b-4278a0f3c562","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2508.02324","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:8aff6d68983b2886629be369e84bb866f2fd8b7feb915e52593cb970aa80b89d","observation_id":"23dfbea6-8b83-493a-8bf9-53c6c78b86ca","resolution":{"observed_at":"2026-05-16T08:04:12.966785Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T15:23:05.016381+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-07-06T20:50:09.622181Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2503.07703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07703","snapshot_observed_at":"2026-07-03T17:18:43.965269Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","venue":"cs.CV","work_id":"e285b9d3-0bf4-4f98-ba3a-e545425ab960","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2503.07703","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:f2b9c5a90c0b5578b99a56abae2416d5d81b417a51d61ffd52fa63dea906d918","observation_id":"5d91a54c-1b76-4027-90f3-7dc99226459a","resolution":{"observed_at":"2026-05-17T08:27:36.473449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11346","last_updated":"2025-06-28T11:46:35Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T16:19:07Z","title":"Seedream 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2504.11346","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11346","snapshot_observed_at":"2026-07-04T07:29:38.429370Z","title":"Seedream 3.0 Technical Report","venue":"cs.CV","work_id":"013e56d0-7f47-4d0e-bbca-e9540fc0e0cc","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2504.11346","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:f76da2e14c1ef237fcbc96f7c2631ff52aaf025d7a39f0715b774b1135d8cd88","observation_id":"93e84043-04b9-4e44-9b3e-8a8b8f85733a","resolution":{"observed_at":"2026-05-16T08:04:12.974044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:d4d8d6cb3e88b69d6568ac1521f1fa161f9a51d91b64a4c9b24ec7bf6f963b80","observation_id":"17934025-b13e-4c04-8333-dd3f8fae2ef6","resolution":{"observed_at":"2026-05-16T08:04:12.977544Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13226","last_updated":"2025-04-17T11:57:41Z","snapshot_observed_at":"2026-07-06T21:11:10.415720Z","submitted_at":"2025-04-17T11:57:41Z","title":"Image Editing with Diffusion Models: A Survey","version":1},"cited_work":{"arxiv_id":"2504.13226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image editing with diffusion models: A sur- vey","venue":null,"work_id":"95cf95fb-4e54-4a77-8927-383d24d11972","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2504.13226","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:a1ae4b84ad61629f16f308c33b7d20b055a53ab4018cd350d6f3e63db58859d3","observation_id":"14ba40c0-04fa-4daa-81c9-fbd6ce3c0076","resolution":{"observed_at":"2026-05-16T08:04:12.981186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.23951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-07-04T16:59:57.981208Z","title":"HunyuanImage 3.0 Technical Report","venue":"cs.CV","work_id":"36511e33-8360-43dd-9407-dddf867c1d7c","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:b660de5698c8d1eeef6ff46b70a92174816a935a997e5df44415b8bd997d1e4a","observation_id":"ae853c10-6b92-432f-81b0-d340145314f6","resolution":{"observed_at":"2026-05-16T08:04:12.984226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:cce452df5acebb428d85ce204318ecc9454696e07c414588f9dfc802e7298a9a","observation_id":"793e525d-135a-4d65-873b-592e3d4f7f4d","resolution":{"observed_at":"2026-05-16T08:04:12.987492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":"2312.17090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-07-08T01:44:26.160588Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","venue":"cs.CV","work_id":"2a0ee74c-0c50-4cd3-91ce-b75cc297715e","year":2023},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:4f651a4b8a646ace02d375cef13cee1849f6249e1be32817281d89eec0b7eb1d","observation_id":"efae7ce4-c12c-4504-a690-d23a61462b1c","resolution":{"observed_at":"2026-05-16T08:04:12.990675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:cc9e8b690e1eda25e4d44d8af2164f9b409d633ed6632d1a0bfb77cba6a233f8","observation_id":"326de711-b8b6-4cf3-b850-786f6bf5f316","resolution":{"observed_at":"2026-05-16T08:04:12.994233Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:07.858539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":"2212.09748","doi":"10.48550/arxiv.2212.09748","metadata_source":"pith","pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scalable Diffusion Models with Transformers","venue":"cs.CV","work_id":"a3a05169-18b1-42bb-8775-eada50163437","year":2022},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:3d2a9e60dd611745a04b2b6b944454d46edefa8489689a070ce887dda4560902","observation_id":"0a7c3f98-7639-460a-8df8-06a00488590e","resolution":{"observed_at":"2026-05-16T08:04:12.997672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:30.266292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:f5b07a6396392b725fd78674a919172f73711d8c8148437be81c7204966eb11f","observation_id":"cd394c39-7167-421e-9a54-693af89a32d5","resolution":{"observed_at":"2026-05-16T08:04:13.000767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07818","last_updated":"2025-08-28T17:19:45Z","snapshot_observed_at":"2026-07-31T14:51:03.625964Z","submitted_at":"2025-05-12T17:59:34Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","version":4},"cited_work":{"arxiv_id":"2505.07818","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07818","snapshot_observed_at":"2026-07-09T03:05:55.316091Z","title":"DanceGRPO: Unleashing GRPO on Visual Generation","venue":"cs.CV","work_id":"7404dd36-8f9c-478f-b089-ef9f8189c711","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2505.07818","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:58b93b68044d07d9e356f0e147ec25e5652b3624ff93fa32c3bc5060ab56ff88","observation_id":"88b0bbfe-06b2-4378-986e-7363374a76c4","resolution":{"observed_at":"2026-05-16T08:04:13.004401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:9e4ec741129cdc82a51f00bc85d9b2dd15ab5966e0ba6473c4f53ad72907718a","observation_id":"fdbf2833-d313-4603-860e-ab0241fbcd07","resolution":{"observed_at":"2026-05-16T08:04:13.008387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":"2403.05135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-07-04T16:59:58.040795Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","venue":"cs.CV","work_id":"94248955-4bc5-4517-98a0-66224a36d865","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:bb2e9806acda3ee60e63d038aaed85a795c337d72dafcd8f387720b6e53ca01d","observation_id":"606ca2ea-c6fc-43fc-a781-1ced22ea0e5b","resolution":{"observed_at":"2026-05-16T08:04:13.012151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-07-06T20:49:51.505079Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":"2503.07265","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07265","snapshot_observed_at":"2026-07-04T13:19:50.710913Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","venue":"cs.CV","work_id":"604c1ae0-368d-49bf-8117-d688ac59f305","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2503.07265","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:3abef5bcccf329fe9f87ea337e80fb2b6051c4f2f2350c5cfc10638adcf76d89","observation_id":"535c9a8a-8236-4335-94ce-44ad55be1482","resolution":{"observed_at":"2026-05-16T08:04:13.015483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.047391Z","title":"Textcrafter: Accurately rendering multiple texts in complex visual scenes","venue":null,"work_id":"4d349026-15b1-433b-ace5-5104109b2bef","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:5fe7291127842aa4e302f5ab4e1ff3aae4fb077e2b342734e3f96d622f8818cf","observation_id":"99dbe40c-b6ef-44b9-b666-b35b8ad4fbe2","resolution":{"observed_at":"2026-05-16T08:04:13.019639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":"2408.12528","doi":"10.48550/arxiv.2408.12528","metadata_source":"pith","pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","venue":"cs.CV","work_id":"1393dc24-a6b2-44e1-b5d7-7009d1fa4811","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:1c98c826161cfd52fe3169fb143785342e513f77e65ac157091852957b358212","observation_id":"8f0d98cf-46d7-4bad-8cfd-9b92acfb633b","resolution":{"observed_at":"2026-05-16T08:04:13.022951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:9637ea853f5b2e308b31223b22c28f8ce83299a26910cb2bba4a2f16ed90d559","observation_id":"5e24c089-f2e5-4c0a-9ad6-b7a4b9798dff","resolution":{"observed_at":"2026-05-16T08:04:13.025983Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-05T11:15:36.366240Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":"2503.21758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-07-03T17:18:43.730046Z","title":"Lumina-image 2.0: A unified and efficient image generative framework","venue":null,"work_id":"4336fecf-1790-4c0a-ad5d-b2bde933d2b6","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:45d2b3af9fc3269c56ce5297664f106bf7cb43a648355280b086831d91ca419f","observation_id":"befe0f3a-7480-4cc3-aeec-63ec3f64f23f","resolution":{"observed_at":"2026-05-16T08:04:13.029742Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":"2501.17811","doi":"10.48550/arxiv.2501.17811","metadata_source":"pith","pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","venue":"cs.AI","work_id":"67d9e391-26d1-459e-ab56-07e60511c886","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:826489b1d562fc98caf012f5f44416a4a432843ba0e83112f1807acd3d4da998","observation_id":"c2697794-97c1-4072-94e0-0dc404fd7754","resolution":{"observed_at":"2026-05-16T08:04:13.033521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22705","last_updated":"2025-05-28T17:59:15Z","snapshot_observed_at":"2026-07-30T00:45:52.058972Z","submitted_at":"2025-05-28T17:59:15Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","version":1},"cited_work":{"arxiv_id":"2505.22705","doi":"10.48550/arxiv.2505.22705","metadata_source":"pith","pith_arxiv_id":"2505.22705","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HiDream-I1: A High-Efficient Image Generative Foundation Model with Sparse Diffusion Transformer","venue":"cs.CV","work_id":"68d4c0f7-3dfd-438d-a823-6a93fd0a835d","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2505.22705","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:f020b8494083e29cfb26505cbe4e2a7a151fc58ce13d31a8331001ae5aa1c4d6","observation_id":"64b9d707-55ac-4cd8-ae5c-d22d46fc6f9c","resolution":{"observed_at":"2026-05-16T17:13:39.137651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17245","last_updated":"2024-02-27T06:31:52Z","snapshot_observed_at":"2026-07-06T17:36:01.939242Z","submitted_at":"2024-02-27T06:31:52Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2402.17245","doi":"10.48550/arxiv.2402.17245","metadata_source":"pith","pith_arxiv_id":"2402.17245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playground v2.5: Three Insights towards Enhancing Aesthetic Quality in Text-to-Image Generation","venue":"cs.CV","work_id":"53c64fda-8566-434d-bc10-2fdfbc6a55ad","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2402.17245","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:c5f0381e14ed6692d6f3b4df4263750e38d5ebe64cc6b4f2b56ceaf0bc343103","observation_id":"88a82248-2399-4ae7-a684-b0439fe82d57","resolution":{"observed_at":"2026-05-16T08:04:13.040150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":"2504.06256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-07-04T16:39:58.250680Z","title":"Transfer between Modalities with MetaQueries","venue":"cs.CV","work_id":"a89f31c1-6a3f-451e-9971-692c11219ea3","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:4d7465ff2d1bb8e450fc3dab9c1758b9156cbc567e0974c8db5cf46328ba7201","observation_id":"8b49922d-90a5-4d28-a7c5-cd4fdbd2b3af","resolution":{"observed_at":"2026-05-16T08:04:13.044906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00127","last_updated":"2025-04-16T10:04:24Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T13:00:38Z","title":"Orthus: Autoregressive Interleaved Image-Text Generation with Modality-Specific Heads","version":2},"cited_work":{"arxiv_id":"2412.00127","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00127","snapshot_observed_at":"2026-07-03T14:38:28.877985Z","title":"Orthus: Autoregressive interleaved image-text generation with modality-specific heads","venue":null,"work_id":"26db0012-a10a-4cc5-b860-df81bb6df3ae","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2412.00127","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:9e9e1eb7331ad69a5b926467276ec9b75194f2eb39d5fb5bb62f4140fc3eb995","observation_id":"1527e277-ac0f-4309-a7ab-9b8de4a040af","resolution":{"observed_at":"2026-05-16T08:04:13.052686Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":"2507.05595","doi":"10.48550/arxiv.2507.05595.url:http://arxiv.org/","metadata_source":"pith","pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-07-11T02:17:46.362300Z","title":"PaddleOCR 3.0 Technical Report","venue":"cs.CV","work_id":"444c549c-1895-4cae-a2d3-c13d7ed5f462","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:d4802c4ddf4a672ad5031e933e346647fa0d488c38b33c22c7445753be204bdc","observation_id":"fe42d59f-827a-41ae-b6d3-51a38373493c","resolution":{"observed_at":"2026-05-16T08:04:13.056034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18871","last_updated":"2026-04-21T17:32:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-23T17:38:54Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","version":4},"cited_work":{"arxiv_id":"2506.18871","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18871","snapshot_observed_at":"2026-07-10T01:46:41.215139Z","title":"OmniGen2: Towards Instruction-Aligned Multimodal Generation","venue":"cs.CV","work_id":"d3153e5f-b6e2-4ab3-9f41-e24e24d64496","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2506.18871","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:e5924b35d15ea636746fc1f464b95e09d7bcd966b91639039dc61c8e5cfbf51d","observation_id":"de38a0ad-99a0-4b45-b251-06a9f1714c97","resolution":{"observed_at":"2026-05-16T08:04:13.062179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:5ec04a3d4c37fd2db90d963bb0f898f1ececbca469184fd18d4a6fd5a830d4f1","observation_id":"f8b6e2d7-fbe3-417f-b386-1e2656dc5bca","resolution":{"observed_at":"2026-05-16T08:04:13.080196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:4a8ba23ffb936e7403fd546909c82b0949eb7744f6262cb44ef9e6319566bddd","observation_id":"f941bc43-2b87-407e-adff-ac56ac07c517","resolution":{"observed_at":"2026-05-16T08:04:13.083861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:9483d7d955a3859505a7bc3520b1bab52c1ee477dc39b71348a8815123413cd6","observation_id":"8b1a26fe-947c-4a29-9dfe-23776f869600","resolution":{"observed_at":"2026-05-16T08:04:13.087014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:d4fbafc4fb2ce02d0514c838e0bb84866a6c892a6730b24de4f1513159408e32","observation_id":"b724bdf5-53e2-4771-980f-937035b540cc","resolution":{"observed_at":"2026-05-16T08:04:13.089941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:d6745b35d6d4b766386e86cdc0da2669a0585934eee4fedd48838b5c6263b17e","observation_id":"fe7def2a-3629-44e2-b76c-04308b5ee8fa","resolution":{"observed_at":"2026-05-16T08:04:13.093121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":"2504.20690","doi":"10.48550/arxiv.2504.20690","metadata_source":"pith","pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","venue":"cs.CV","work_id":"8cafd680-1279-4695-8156-9079db325469","year":2025},"citing_paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T08:04:12.949075Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2512.07584"},"observation_digest":"sha256:95e508c4684b8116259e9145dff9d8ba5139d357a20eab416cd30c9206cdf520","observation_id":"c5ceeaa4-67a1-4e87-a85a-966990a45f27","resolution":{"observed_at":"2026-05-16T16:07:53.247084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.07584","last_updated":"2025-12-08T14:26:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T14:26:40Z","title":"LongCat-Image Technical Report"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":28,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 59 inbound Pith citation observations for arXiv:2512.07584."}