{"as_of":"2026-08-10T12:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:779363d882f062939011b716a9e9cc2812cf7e105f43db00a943297edd2ca5b3","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:05:18.226948Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T09:43:58.385814Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:05:51.109495Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"cited_work":{"arxiv_id":"2511.12449","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.12449","snapshot_observed_at":"2026-07-31T01:08:53.304372Z","title":"arXiv preprint arXiv:2511.12449 , year=","venue":null,"work_id":"628415ac-073e-4df7-80b3-91ae94e93c6a","year":null},"citing_paper":{"arxiv_id":"2606.28070","last_updated":"2026-06-29T06:29:34Z","snapshot_observed_at":"2026-08-03T01:30:11.337878Z","submitted_at":"2026-06-26T13:33:27Z","title":"JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T04:11:05.226043Z"},"links":{"cited_paper":"/paper/2511.12449","citing_paper":"/paper/2606.28070"},"observation_digest":"sha256:fc74db6bf13a5cf460a5f635f3e76c68525632d4ea7a6055e739975dc51e928c","observation_id":"31f70ad7-a02e-432e-b384-4c3dba80927f","resolution":{"observed_at":"2026-07-31T01:08:53.304372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"cited_work":{"arxiv_id":"2511.12449","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.12449","snapshot_observed_at":"2026-07-31T01:08:53.304372Z","title":"arXiv preprint arXiv:2511.12449 , year=","venue":null,"work_id":"628415ac-073e-4df7-80b3-91ae94e93c6a","year":null},"citing_paper":{"arxiv_id":"2606.28070","last_updated":"2026-06-29T06:29:34Z","snapshot_observed_at":"2026-08-03T01:30:11.337878Z","submitted_at":"2026-06-26T13:33:27Z","title":"JD Oxygen AI Item Center (Oxygen AIIC) V1: An Industrial-Scale LLM/VLM-Centric Solution for Item Understanding, Management, and Applications","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-30T09:43:58.385814Z"},"links":{"cited_paper":"/paper/2511.12449","citing_paper":"/paper/2606.28070"},"observation_digest":"sha256:e6e9b9dea5e23125ce1f55b8ec5064ad6f340d6e1dbb1e1d672f01c07d58680d","observation_id":"c896babc-7ec7-4c54-b0cf-9fd7798cfd10","resolution":{"observed_at":"2026-07-31T01:08:53.304372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.12449/citation-record","integrity":"/paper/2511.12449/integrity","json":"/paper/2511.12449/citation-record.json","paper":"/paper/2511.12449"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T22:05:14.995841Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:14.995841Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:cd887a74a59a2c38bf251ab466bd0ae500104863e0502f005bf99d233de68522","observation_id":"44bc2dc4-c9f7-42ad-a251-f5b0a39ffd79","resolution":{"observed_at":"2026-08-03T22:05:14.995841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.056733Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.056733Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:2d6d83c96ed913509e957de8c70b8e1925a5d1afef6a08d83cd4c0c4ecab94bc","observation_id":"ecf46e18-1751-4409-8ac9-32b2f6b5b370","resolution":{"observed_at":"2026-08-03T22:05:15.056733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T22:05:15.154011Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 1(2):3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.154011Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:2d6663d4f63663ff4c88c77663b3be1e878eb6b5600471bd14687105c4071cca","observation_id":"f8a362f0-f42c-4e09-81f9-ff34f561065b","resolution":{"observed_at":"2026-08-03T22:05:15.154011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T22:05:15.204752Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.204752Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:c18028b99d399ad1869d1883ad9b63fd3e27f87b0eecc8f5aba005e56283505c","observation_id":"c5af68f4-43e9-4efb-a582-b9ec21bd6692","resolution":{"observed_at":"2026-08-03T22:05:15.204752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.266357Z","title":"Product2vec: Leveraging representation learning to model consumer product choice in large assortments.NYU Stern School of Business, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.266357Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:dfb9f8e50e2f030735bfc9a31303b7e85fd480bae2270aef828a1cf2a7904ab0","observation_id":"1f656f4f-c477-4c25-bac1-1f816f1a2001","resolution":{"observed_at":"2026-08-03T22:05:15.266357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.288369Z","title":"On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.288369Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:51269ae191a24743907b877e01d904db47d88761fee7987bc90503ea9d229cf2","observation_id":"8b19d077-880a-4caa-b7d2-4a9a4d3efd52","resolution":{"observed_at":"2026-08-03T22:05:15.288369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.348036Z","title":"Contrastive language and vi- sion learning of general fashion concepts.Scientific Reports, 12(1):18958, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.348036Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:fc94c8116d290c72a6aa2d2e2fe3c5f580bc38c8f6306b5e36aaf204f4176b50","observation_id":"48231c95-b661-424c-8608-901e2d6745b0","resolution":{"observed_at":"2026-08-03T22:05:15.348036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.398261Z","title":"Unified generative and discriminative training for multi-modal large language models.Advances in Neural Information Processing Systems, 37:23155–23190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.398261Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:3faa57e8fbf74cb97abb678c8ec1878f87a74881c624146a424b3836cc645556","observation_id":"ab5b734d-329b-41ab-a5c8-c81e43452649","resolution":{"observed_at":"2026-08-03T22:05:15.398261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.455903Z","title":"Uniembedding: Learning universal multi- modal multi-domain item embeddings via user-view con- trastive learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.455903Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:bf6f692948418937dd2632849634d57aeaa22dcb9721cbf6fa34ec0418b50072","observation_id":"a2e06d79-121f-497d-85f3-a5de17b9f4af","resolution":{"observed_at":"2026-08-03T22:05:15.455903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.510395Z","title":"M5product: Self- harmonized contrastive learning for e-commercial multi- modal pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.510395Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:9525add1f0873a1ec368969ae744a8a901fbcc650537dfdd88655a2c20fe27e5","observation_id":"2cc89181-cee1-48ac-bbc6-6155603e95a5","resolution":{"observed_at":"2026-08-03T22:05:15.510395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.550600Z","title":"Pmr: Prototypical modal rebalance for multi- modal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.550600Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:3013e19ab522767190268fea1a570c05fe6c0f50481b981131ff0cd1e2348f14","observation_id":"0e3a5b04-9f49-45ee-bdea-59a3d82b2ffb","resolution":{"observed_at":"2026-08-03T22:05:15.550600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.614901Z","title":"Switch transformers: Scaling to trillion parameter models with sim- ple and efficient sparsity.Journal of Machine Learning Re- search, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.614901Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:95f5972ec7409d1b355c29b4612129aada4a59524e6c71285491ed35549ca7ce","observation_id":"b2df3855-9b10-49ff-80cc-28944bb1ef05","resolution":{"observed_at":"2026-08-03T22:05:15.614901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.662400Z","title":"Moon embedding: Multi- modal representation learning for e-commerce search adver- tising.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.662400Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:1a829f07e5574e9fe19aaa14944cfae13dc5715150ac493c28a2f74e5b15d442","observation_id":"7f30d795-c27b-44a5-baec-85091d690d87","resolution":{"observed_at":"2026-08-03T22:05:15.662400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.726776Z","title":"Fashionbert: Text and im- age matching with adaptive loss for cross-modal retrieval","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.726776Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:b84d187bb247f9e72a778d52e0faa04ffba5cd40e68ca4fffb86108d714dd329","observation_id":"3b8160c3-82df-436c-855c-b751003d5745","resolution":{"observed_at":"2026-08-03T22:05:15.726776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11916","last_updated":"2024-07-16T04:23:37Z","snapshot_observed_at":"2026-07-06T15:06:11.896701Z","submitted_at":"2023-03-21T15:06:35Z","title":"CompoDiff: Versatile Composed Image Retrieval With Latent Diffusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11916","snapshot_observed_at":"2026-08-03T22:05:15.793078Z","title":"Compodiff: Versa- tile composed image retrieval with latent diffusion.arXiv preprint arXiv:2303.11916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.793078Z"},"links":{"cited_paper":"/paper/2303.11916","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:2de55def4224667625724fd956453017d411ae04db22ffdcaaf7d17dcac54184","observation_id":"6b8a2bef-e14d-4263-a187-9d107f4b48ce","resolution":{"observed_at":"2026-08-03T22:05:15.793078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.900812Z","title":"Multi-modal preference modeling for product search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.900812Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:5114a3abd75592b0ffe033bbb81a199bca6debb25853eba3456ed9a2851f9f32","observation_id":"100c8f0d-78bb-4486-a9ac-1597c7aa4419","resolution":{"observed_at":"2026-08-03T22:05:15.900812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:15.957474Z","title":"Au- tomatic spatially-aware fashion concept discovery","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:15.957474Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:31fe33526a1cd4795f6a09c56c04a42272ff9c043cf57424226170ff852636f5","observation_id":"9ba20362-b828-4fd1-ac96-1bdd1b65a4d4","resolution":{"observed_at":"2026-08-03T22:05:15.957474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.003909Z","title":"Multimodal retrieval in e-commerce: From categories to images, text, and back","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.003909Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:dc822be064952e937c734cf24dd9a24daa40c23f7ef58e32b8c78d7c3a4f0735","observation_id":"c5cb3b9d-b876-4e97-8835-fe5ee40a06bd","resolution":{"observed_at":"2026-08-03T22:05:16.003909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.11226","last_updated":"2018-06-28T23:11:54Z","snapshot_observed_at":"2026-08-05T16:43:49.597071Z","submitted_at":"2018-06-28T23:11:54Z","title":"A Multimodal Recommender System for Large-scale Assortment Generation in E-commerce","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.11226","snapshot_observed_at":"2026-08-03T22:05:16.069327Z","title":"A multi- modal recommender system for large-scale assortment gen- eration in e-commerce.arXiv preprint arXiv:1806.11226,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.069327Z"},"links":{"cited_paper":"/paper/1806.11226","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:6a6d9bd8fe02010ba3d825a747808d685afe9f20206e6c8941173304e19dcaa3","observation_id":"597fb384-51fc-483e-b694-c6d6a17b7ab6","resolution":{"observed_at":"2026-08-03T22:05:16.069327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.127974Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.127974Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:769974d849e3454daf2e4c90a2fbf118231ba97d873ea157efd0c65b8c0c8e2a","observation_id":"7e984a8a-c35f-4888-8ad0-9a22a6d073f1","resolution":{"observed_at":"2026-08-03T22:05:16.127974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14968","last_updated":"2024-08-27T11:21:19Z","snapshot_observed_at":"2026-07-06T19:06:33.176704Z","submitted_at":"2024-08-27T11:21:19Z","title":"MRSE: An Efficient Multi-modality Retrieval System for Large Scale E-commerce","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14968","snapshot_observed_at":"2026-08-03T22:05:16.206059Z","title":"Mrse: An efficient multi-modality retrieval system for large scale e-commerce.arXiv preprint arXiv:2408.14968, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.206059Z"},"links":{"cited_paper":"/paper/2408.14968","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:b4600f305eace91c8e47960ae09e6ce7e91038ddf53714f76b4e240017c83d8d","observation_id":"0cd83f5e-0083-4b44-bc5f-ca5e5df421dc","resolution":{"observed_at":"2026-08-03T22:05:16.206059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-03T22:05:16.260894Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks.arXiv preprint arXiv:2410.05160, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.260894Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:d085a77eeee30d978ae7b211c1e962294452761a9a4ef9810e0b685ea8c2d129","observation_id":"d027f8d6-f9fd-478e-a2dd-95eed8408139","resolution":{"observed_at":"2026-08-03T22:05:16.260894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.371108Z","title":"Learn- ing instance-level representation for large-scale multi-modal pretraining in e-commerce","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.371108Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:575669003fa21bbfaa850edbd8a7fdbf59fe23f99d8c36ef518731929829aec6","observation_id":"b93b2c5d-0f84-41cd-a39e-6c316e2a0e4f","resolution":{"observed_at":"2026-08-03T22:05:16.371108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-03T22:05:16.428946Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.428946Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:aeeac1fd33876b1fac8b691f488fb51a2e4d1a392b6054e1c4d5fe9384373114","observation_id":"b54e816c-2572-4492-be4c-60f68ca312e9","resolution":{"observed_at":"2026-08-03T22:05:16.428946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.497586Z","title":"Align before fuse: Vision and language representation learn- ing with momentum distillation.Advances in neural infor- mation processing systems, 34:9694–9705, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.497586Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:acd2e87bfa2ccb004dd2c662402af0cff17245665ba22cd4c119ef5cf23ce5f1","observation_id":"370ec113-c91b-4d60-8a32-58d6043556f0","resolution":{"observed_at":"2026-08-03T22:05:16.497586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.507575Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.507575Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:e546514b5c5a2b93583cd534a0d92a12d0217d528208977338bcbd311a4fca5a","observation_id":"1584f7af-50de-4577-8626-11dc9d351081","resolution":{"observed_at":"2026-08-03T22:05:16.507575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.583725Z","title":"Embedding-based product retrieval in taobao search","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.583725Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:f4dec9a444e2ebeadb1e92fc23d6a494cc6af8578f8192ee120c247052aca251","observation_id":"1b1c03d3-f589-4ec0-bb3d-6273bafb12ee","resolution":{"observed_at":"2026-08-03T22:05:16.583725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.687532Z","title":"Adversarial multimodal representation learning for click-through rate prediction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.687532Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:0660f14c410d2825ba5de637c7c53feccd080686688fbb2e307f19a60c13394d","observation_id":"f627da08-5f6a-4fe3-a6f5-e657083d9352","resolution":{"observed_at":"2026-08-03T22:05:16.687532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13843","last_updated":"2025-08-19T14:06:13Z","snapshot_observed_at":"2026-08-05T18:49:38.852129Z","submitted_at":"2025-08-19T14:06:13Z","title":"UniECS: Unified Multimodal E-Commerce Search Framework with Gated Cross-modal Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13843","snapshot_observed_at":"2026-08-03T22:05:16.766061Z","title":"Uniecs: Unified multimodal e-commerce search framework with gated cross-modal fusion.arXiv preprint arXiv:2508.13843, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.766061Z"},"links":{"cited_paper":"/paper/2508.13843","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:0376936a89eb4e13e35cf0e3a082c12c58fc6972da42776a908dab3db6ba02c8","observation_id":"82057d68-8acd-4b26-9bd2-626f502d8b5e","resolution":{"observed_at":"2026-08-03T22:05:16.766061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-09T15:41:06.775086Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-03T22:05:16.854105Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms.arXiv preprint arXiv:2411.02571, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.854105Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:9cf733f5b94c617a8997ef3381dc2a7d6dddc203f344fcdb0bc42f1bb51e84a7","observation_id":"7602a1db-8b2f-45aa-be7e-5ab2a868d988","resolution":{"observed_at":"2026-08-03T22:05:16.854105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:16.940763Z","title":"Captions speak louder than images (caslie): Generalizing foundation models for e-commerce from high-quality multimodal instruction data.arXiv preprint arXiv:2410.17337, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:16.940763Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:6f4b4d300d08254ef258eab48b8bb4b6fe8f8756b5af67c7fe25c748876321b8","observation_id":"cebaba44-1bf5-4f9f-a63d-9180cc49d397","resolution":{"observed_at":"2026-08-03T22:05:16.940763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.030089Z","title":"Ecom- mmmu: Strategic utilization of visuals for robust multimodal e-commerce models.arXiv preprint arXiv:2508.15721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.030089Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:5b8bcbd6bd7821067cce58af7a1d183d029e8a0c611849e5501c9aaf8e00acf5","observation_id":"5fd4b171-9198-411f-9abc-867752dc8fe8","resolution":{"observed_at":"2026-08-03T22:05:17.030089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.119164Z","title":"Multimodal pretraining, adaptation, and generation for recommendation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.119164Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:a49a4dd62a9584982015efec182aa0b8021c9a0861297e10410d294a54fb9267","observation_id":"6f6c0ddf-bfd9-498e-8146-b02e12fe9759","resolution":{"observed_at":"2026-08-03T22:05:17.119164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.156959Z","title":"Multimodal pre-training with self-distillation for prod- uct understanding in e-commerce","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.156959Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:6c3b4e77f6c62246bcbce91098ce719cfb030963329b286603ace98c4156e213","observation_id":"6c659285-58e5-4c0f-bd44-97286fb1efc8","resolution":{"observed_at":"2026-08-03T22:05:17.156959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.191297Z","title":"Pretraining representations of multi-modal multi-query e- commerce search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.191297Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:137080f34d3fddc1c27741011dda83baa60ec791843d0ed401e81c5888acbe4c","observation_id":"092d6bf8-e64c-4167-b24b-df1e758f4588","resolution":{"observed_at":"2026-08-03T22:05:17.191297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.246464Z","title":"ecellm: generalizing large language models for e-commerce from large-scale, high-quality instruction data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.246464Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:8e0e744778740fc8ca5232eb4d2f11b37469bf25ff17883edd7d5a41bd99425c","observation_id":"a0cc48cb-4809-45c5-8421-98b3c28d9174","resolution":{"observed_at":"2026-08-03T22:05:17.246464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.281869Z","title":"Kosmos-2: Grounding multimodal large language models to the world, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.281869Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:9df8a0de0cc65bded5f86d43e2bfab9d934eb9c32bd53fae9837defed42e59cf","observation_id":"6c17d940-6d1b-465d-abe1-d63651156f28","resolution":{"observed_at":"2026-08-03T22:05:17.281869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.300953Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.300953Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:0e9257f073033b65759302d4a9489d02ba51352ff44cbe200331a5af9c28c3fa","observation_id":"c0dd4b5c-2a5b-44be-9250-1484fa1c70d9","resolution":{"observed_at":"2026-08-03T22:05:17.300953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-03T22:05:17.334918Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.334918Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:700e9d387befe92971e371552b105a10e3f6620e9d6a60ab9c9a92cffa839997","observation_id":"4b31a3c2-e34e-48a4-a4c8-8e53567e7035","resolution":{"observed_at":"2026-08-03T22:05:17.334918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04913","last_updated":"2024-06-11T02:14:06Z","snapshot_observed_at":"2026-07-06T16:04:22.434596Z","submitted_at":"2023-08-09T12:26:37Z","title":"LLaMA-E: Empowering E-commerce Authoring with Object-Interleaved Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04913","snapshot_observed_at":"2026-08-03T22:05:17.373059Z","title":"Llama-e: Empowering e-commerce authoring with multi-aspect instruction following.arXiv preprint arXiv:2308.04913, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.373059Z"},"links":{"cited_paper":"/paper/2308.04913","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:175aaf4f83b2b7c2b73ebe630a50e062cef6c30db19f5e1a40a858114f279718","observation_id":"139151d2-f2fc-41fd-a3dd-4b7533ffda38","resolution":{"observed_at":"2026-08-03T22:05:17.373059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T22:05:17.407008Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.407008Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:bd2036157823d8f5d4be9f2e5d5da3943c9e6ef9b660395f9e5a958a2216a350","observation_id":"9eefee5f-073d-4ef6-9d68-809e37c640e2","resolution":{"observed_at":"2026-08-03T22:05:17.407008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.445991Z","title":"Merlin: Multimodal & multilingual embed- ding for recommendations at large-scale via item associa- tions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.445991Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:b15286da97fc5ddfa676fbf352c0c1670021ddd1243532b2e8f7e34ff9e4fba4","observation_id":"13a1aea9-9593-44e1-a1a3-311ef52a1b7c","resolution":{"observed_at":"2026-08-03T22:05:17.445991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.490123Z","title":"Stablerep: Synthetic images from text-to- image models make strong visual representation learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.490123Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:726282b284dc0467a178e86521180b6231604f1b1fda96647b0f3dc720b70a57","observation_id":"e40ec159-b335-4811-9c04-420bfd016ecc","resolution":{"observed_at":"2026-08-03T22:05:17.490123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-03T22:05:17.608149Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.608149Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:88dfe44ceb857d27bfc80216b4eece73c5da48da7e351470dba05c1938bdf1f7","observation_id":"2082b2aa-7945-4c5d-94d1-9157b08985f6","resolution":{"observed_at":"2026-08-03T22:05:17.608149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.698070Z","title":"Missrec: Pre-training and transfer- ring multi-modal interest-aware sequence representation for recommendation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.698070Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:47bfb558e503e3acf5c94907dea7e5246698ebe6921a40ae0a1b665081e07358","observation_id":"81ce17bc-44ed-4f45-b5d7-b2e1d008edf1","resolution":{"observed_at":"2026-08-03T22:05:17.698070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00321","last_updated":"2025-02-23T15:40:03Z","snapshot_observed_at":"2026-08-09T19:24:30.248080Z","submitted_at":"2025-02-01T05:06:21Z","title":"MIM: Multi-modal Content Interest Modeling Paradigm for User Behavior Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00321","snapshot_observed_at":"2026-08-03T22:05:17.724142Z","title":"Mim: Multi-modal content interest mod- eling paradigm for user behavior modeling.arXiv preprint arXiv:2502.00321, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.724142Z"},"links":{"cited_paper":"/paper/2502.00321","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:b7c209c7c66383ab020163f9522a2592a09bbddced209cfd9f94b839ac34b2a1","observation_id":"bcf5f517-de33-482c-8f61-c9b19fbf1b32","resolution":{"observed_at":"2026-08-03T22:05:17.724142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.832740Z","title":"Commercemm: Large-scale commerce multimodal representation learning with omni retrieval","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.832740Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:08c41d5de321b0658c882cae1b9541136636d5bc262589f7e93a0903ee48d434","observation_id":"8bfecc26-a443-40af-a4df-ed6dadb46e5c","resolution":{"observed_at":"2026-08-03T22:05:17.832740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-03T22:05:17.860103Z","title":"Florence: A new foundation model for computer vision.arXiv preprint arXiv:2111.11432, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.860103Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:0c19049374d6fb7f463b1b992e00318420e86eb9fe49838cc2fc767b4705de2f","observation_id":"cdfc8ab6-21f0-4117-b4f9-373cb95d0849","resolution":{"observed_at":"2026-08-03T22:05:17.860103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.923111Z","title":"Prod- uct1m: Towards weakly supervised instance-level product retrieval via cross-modal pretraining","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.923111Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:b9ebc66aef32b84ae9e5e104122c3cb27084c4c8cf67729ac5957e215ad73e90","observation_id":"6f62f263-7380-4be1-a86e-d376852e06ae","resolution":{"observed_at":"2026-08-03T22:05:17.923111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:17.974836Z","title":"Moon: Generative mllm-based multimodal representation learning for e-commerce product understand- ing.arXiv preprint arXiv:2508.11999, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:17.974836Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:7330d1fcc5b7d1150c82608c4b6595c0046a53e3ccb513c9410100fbc89d2a31","observation_id":"cd6e71e7-b856-4e49-81ac-dbf3da804f14","resolution":{"observed_at":"2026-08-03T22:05:17.974836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:18.024821Z","title":"Sharper and faster mean better: Towards more efficient vision-language model for hour-scale long video understand- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:18.024821Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:47ccdb890019176dca14c4a9b4d1464cd69ba83df38563a0b3ec5dcf4c7f7dc7","observation_id":"3a63e761-c31d-4440-b1cb-7340d8fe431b","resolution":{"observed_at":"2026-08-03T22:05:18.024821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:18.033214Z","title":"Modality-balanced learning for multimedia recom- mendation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:18.033214Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:0bdfd3f6dcc2a2ee02542e5510f89007d43f7d950b28f6ccd06c5316f89e2e3d","observation_id":"600e39cd-c0b4-4bc7-97ce-9207fe377fb6","resolution":{"observed_at":"2026-08-03T22:05:18.033214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-03T22:05:18.066051Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms.arXiv preprint arXiv:2412.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:18.066051Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:dafaf4bbd33daaa3f746d98fe54526cf78a656ae085e0d69cc12c12dadf1f718","observation_id":"b8594a87-65de-468d-9c12-c0cb0cf06889","resolution":{"observed_at":"2026-08-03T22:05:18.066051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:05:18.114220Z","title":"Delving into e-commerce product retrieval with vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:18.114220Z"},"links":{"citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:c25ff59ddb688fb7d052c375d19f5f05e4eb37680ebb11e9cb1392b078150476","observation_id":"aad18658-13fe-448e-a68c-a2c41118e8fc","resolution":{"observed_at":"2026-08-03T22:05:18.114220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-08-03T22:05:18.174178Z","title":"Megapairs: Massive data synthesis for universal mul- timodal retrieval.arXiv preprint arXiv:2412.14475, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:18.174178Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:8694ed7c766152b5d5cd2406f2d1c85ecfc8843509c1c30db94ce6b5a85e0cfe","observation_id":"2590b86f-d365-48bd-8cb7-0945ba9214fc","resolution":{"observed_at":"2026-08-03T22:05:18.174178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T07:07:56.707005Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T22:05:18.226948Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T22:05:18.226948Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2511.12449"},"observation_digest":"sha256:11d02594e378c60af897af6c30d788f179e31e072f32206f51f0999a3be0efde","observation_id":"fcf9fca9-6c78-4a1a-b3fd-fac642c385ca","resolution":{"observed_at":"2026-08-03T22:05:18.226948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.12449","last_updated":"2026-07-29T13:03:53Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:09:09.199330Z","submitted_at":"2025-11-16T04:29:35Z","title":"MOON2.0: Dynamic Modality-balanced Multimodal Representation Learning for E-commerce Product Understanding"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2511.12449."}