{"as_of":"2026-08-18T13:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0008a9d2a8a40509225bbc22758502506a3e4cbc450f306b1deaa69ea78078d6","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:03:54.467262Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18139/citation-record","integrity":"/paper/2412.18139/integrity","json":"/paper/2412.18139/citation-record.json","paper":"/paper/2412.18139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:55.076380Z","title":"Improving end-to-end text image translation from the auxiliary text translation task,","venue":null,"work_id":"315671af-ef0e-4a08-a51f-31983565e291","year":2022},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.292536Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:f8203a300abd8353e8ab5d836d94aad5a19d2f83a15bfd34418589b3cbda3322","observation_id":"540aa9c0-18ca-47a2-b680-53ad53067529","resolution":{"observed_at":"2026-08-11T05:03:55.083444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:55.045218Z","title":"Exploring better text image translation with multimodal codebook,","venue":null,"work_id":"72b03aca-8a6b-409f-8728-0fc66c9cb8e8","year":2023},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.300375Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:afafa727688d653dee19e8f00ccf8d2abd442bea507aa45a735b2090d0fe793d","observation_id":"5529b5c2-af88-4070-9ff9-87d2c19c1d4e","resolution":{"observed_at":"2026-08-11T05:03:55.052167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:55.017999Z","title":"AnyTrans: Translate AnyText in the image with large scale models,","venue":null,"work_id":"a7315b33-60d3-4e97-857e-660e8aa93865","year":2024},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.309710Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:90343a088e725e497e2abbc368074296c6d5a8317f35a4378779d8a7386bb71b","observation_id":"96596f2f-59e4-4ba6-8204-46d66bc66ae4","resolution":{"observed_at":"2026-08-11T05:03:55.024849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03976","last_updated":"2016-09-13T18:46:03Z","snapshot_observed_at":"2026-08-14T21:40:01.713321Z","submitted_at":"2016-09-13T18:46:03Z","title":"Multimodal Attention for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03976","snapshot_observed_at":"2026-08-11T05:03:54.319388Z","title":"Multimodal atten- tion for neural machine translation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.319388Z"},"links":{"cited_paper":"/paper/1609.03976","citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:2ccadc318be9fb4ca345d89a3d4d45abde113a94482bb86e6ec79b6eab99ca7d","observation_id":"1e59014d-ac89-41e8-afe5-3310e879e4ca","resolution":{"observed_at":"2026-08-11T05:03:54.319388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.984782Z","title":"Multimodal transformer for multimodal machine translation,","venue":null,"work_id":"37093f20-69d5-4aec-a6c3-ce6e0a358482","year":2020},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.325719Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:7643e69ada4977f3dff5fa41dbc4483fb79c6c0539ece0b140732f4e52212609","observation_id":"e0fa98de-a123-4b1e-96d7-5d32f260f9ab","resolution":{"observed_at":"2026-08-11T05:03:54.993252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.962698Z","title":"A novel graph-based multi-modal fusion encoder for neural machine translation,","venue":null,"work_id":"b5b0c2fc-96b5-4cb2-96e5-f21a46644d3e","year":2020},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.352327Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:1ff2fee8aa45a3fbac0419c1b41f1d24c6591c2183b21f740f0a0ac21a835d6f","observation_id":"1d5a90be-4809-478f-b770-ea684f343596","resolution":{"observed_at":"2026-08-11T05:03:54.969853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.928504Z","title":"Cross-lingual visual pre-training for multimodal machine translation,","venue":null,"work_id":"6d186c61-41c0-4e82-984a-4bae7af08804","year":2021},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.362174Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:2a796086dfcf943a768020d2eb4501058b9c1bab736ee540bbc00178b0e278d9","observation_id":"f2d7c1f4-97b7-40be-b370-cf529087c966","resolution":{"observed_at":"2026-08-11T05:03:54.936677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.891267Z","title":"On vision features in multimodal machine translation,","venue":null,"work_id":"d8fd0f68-6b2d-4804-8cdc-f26d078f71bc","year":2022},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.374447Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:9c7e18ceb11dc150bf740091afda63eca11c5424f121010c3ab46256a5201427","observation_id":"16d6b8a6-734e-4d4c-addd-c92775bfe674","resolution":{"observed_at":"2026-08-11T05:03:54.901918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.861643Z","title":"Translation camera,","venue":null,"work_id":"6654efd3-481c-4f86-a182-0e19a37b31f8","year":1998},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.381348Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:98fc5259123edc05cf9fb48fc8af3002a6fdeae31b6d293871939bae25b73b14","observation_id":"acf58140-258a-4ae2-a4cd-6bf08b37e680","resolution":{"observed_at":"2026-08-11T05:03:54.868421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.823221Z","title":"Integrating natural language processing with image document analysis: what we learned from two real-world applications,","venue":null,"work_id":"cf383b6a-69a2-4ac4-a2da-a00720b1e591","year":2015},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.387985Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:c9fc5f4a07af4948745b1fd7f7ba18c6d493b7176377c1c01adce2f49879fbc8","observation_id":"ef95760e-c046-48ba-82c6-cccf1886492a","resolution":{"observed_at":"2026-08-11T05:03:54.835889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02894","last_updated":"2024-07-03T08:15:39Z","snapshot_observed_at":"2026-08-16T13:37:29.126504Z","submitted_at":"2024-07-03T08:15:39Z","title":"Translatotron-V(ison): An End-to-End Model for In-Image Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02894","snapshot_observed_at":"2026-08-11T05:03:54.393779Z","title":"Translatotron-v (ison): An end-to-end model for in-image machine translation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.393779Z"},"links":{"cited_paper":"/paper/2407.02894","citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:1832e5636fc06c05d6cbdcbadf486e17442efa0ade803964fe5e03aab68ba1db","observation_id":"ae5099a2-30ee-4183-9c8d-d7bad9d4bf6b","resolution":{"observed_at":"2026-08-11T05:03:54.393779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17870","last_updated":"2023-05-23T04:07:00Z","snapshot_observed_at":"2026-08-16T15:43:51.372858Z","submitted_at":"2023-03-31T08:06:33Z","title":"GlyphDraw: Seamlessly Rendering Text with Intricate Spatial Structures in Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17870","snapshot_observed_at":"2026-08-11T05:03:54.399942Z","title":"Glyphdraw: Learning to draw chinese characters in image synthesis models coherently,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.399942Z"},"links":{"cited_paper":"/paper/2303.17870","citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:4fcc7c561e1c80b484527567d8bac3b685256c3d58e004f9e5a66f9b78fbe2e3","observation_id":"b5cd09d5-f00a-49da-8b5e-7c4e94e522ba","resolution":{"observed_at":"2026-08-11T05:03:54.399942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.804085Z","title":"Glyphcontrol: Glyph conditional control for visual text generation,","venue":null,"work_id":"c6b089f6-84d4-48a2-b5bf-f4020e8b322e","year":2024},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.411774Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:bd295bf24a3c59aaa280a29dc7af9acb26d7b49d90a1689193470ca571e5bf70","observation_id":"add14aad-3b09-4479-937e-c9affa06234b","resolution":{"observed_at":"2026-08-11T05:03:54.809912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.784045Z","title":"Textdiffuser: Diffusion models as text painters,","venue":null,"work_id":"8e0e4282-1dff-4368-9df8-884948b0b84f","year":2024},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.417436Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:113226b5c9b505310a841355d937323c4132d1cd8ce9b9f30f8ce6e08011aa6a","observation_id":"507aa652-da70-46db-b170-4c85d101fd8a","resolution":{"observed_at":"2026-08-11T05:03:54.789794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16465","last_updated":"2023-11-28T04:02:40Z","snapshot_observed_at":"2026-08-17T15:15:34.831056Z","submitted_at":"2023-11-28T04:02:40Z","title":"TextDiffuser-2: Unleashing the Power of Language Models for Text Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16465","snapshot_observed_at":"2026-08-11T05:03:54.423474Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.423474Z"},"links":{"cited_paper":"/paper/2311.16465","citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:cd5b23b319419172684d50c209397983765b16555fdb785356a540b2b23d28bb","observation_id":"2629dee0-0c77-4e1e-9f2e-3bb3f5ca5dd3","resolution":{"observed_at":"2026-08-11T05:03:54.423474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.758758Z","title":"Anytext: Multilingual visual text generation and editing,","venue":null,"work_id":"a6377b31-7f65-410a-971f-54398e575428","year":2023},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.429120Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:187816e038cfedfa7b2ca35c15513c899304a55c8d8f72e213db754a97d4d8ca","observation_id":"6b70dae0-2f68-487a-93aa-7529c90adf78","resolution":{"observed_at":"2026-08-11T05:03:54.768362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05072","last_updated":"2024-10-21T15:19:41Z","snapshot_observed_at":"2026-08-16T14:28:34.641825Z","submitted_at":"2024-01-10T11:03:53Z","title":"Aligning Translation-Specific Understanding to General Understanding in Large Language Models","version":2},"cited_work":{"arxiv_id":"2401.05072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.05072","snapshot_observed_at":"2026-08-11T05:03:54.523576Z","title":"Aligning Translation-Specific Understanding to General Understanding in Large Language Models","venue":"cs.CL","work_id":"4f1514b9-c7f1-4ba4-be47-25a7c8c96080","year":2024},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.434855Z"},"links":{"cited_paper":"/paper/2401.05072","citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:fa0235374a99d27df56c1a98b317de3944682d47486e8c68d0963f3ee287442b","observation_id":"5ef5557f-d77a-43be-8837-c86f9e0fc5df","resolution":{"observed_at":"2026-08-11T05:03:54.533800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.723595Z","title":"Tackling ambiguity with images: Improved multi- modal machine translation and contrastive evaluation,","venue":null,"work_id":"b2e8d79c-acfb-4e14-9600-7087d5f70ac6","year":2023},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.446917Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:05e326fe01b91c3c536e54c2555bec38f76d5fb478956725af3b5e8f969675b6","observation_id":"df36bf29-a3ff-4695-b78e-458234e91703","resolution":{"observed_at":"2026-08-11T05:03:54.731858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.452195Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.452195Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:de121877ff943e6c1a3cdd8fcfe4043cecced631ab16431d27aeb5622a61a2c3","observation_id":"78a38dd7-94de-4d40-b4b4-fea41485d05b","resolution":{"observed_at":"2026-08-11T05:03:54.452195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.686278Z","title":"Comet: A neural framework for mt evaluation,","venue":null,"work_id":"a0116266-20f6-406e-b63c-94135fd2c87c","year":2020},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.458965Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:f593f4978cde9ce0560932bf2cda5c8da6570c431666c0849bea2461ca2cd609","observation_id":"835720b6-f851-4de6-b0db-2af92c89df8c","resolution":{"observed_at":"2026-08-11T05:03:54.693675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:03:54.665339Z","title":"Spatial attentive single-image deraining with a high quality real rain dataset,","venue":null,"work_id":"69413e1b-9f77-4d6e-8b8a-5a7358047379","year":2019},"citing_paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:03:54.467262Z"},"links":{"citing_paper":"/paper/2412.18139"},"observation_digest":"sha256:3ca9e7a4a31989bb1ce538ba9c962631886fea3f709110458c709300a6871681","observation_id":"90ff7a02-a74c-4178-8838-d4ef46a78ffa","resolution":{"observed_at":"2026-08-11T05:03:54.671517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18139","last_updated":"2024-12-24T03:50:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T03:50:58.487304Z","submitted_at":"2024-12-24T03:50:03Z","title":"Ensuring Consistency for In-Image Translation"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2412.18139."}