{"as_of":"2026-08-18T00:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:56d806f5624c24ea3b681954accf0de59557b980e25a571f7e358ea2b44e3deb","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:18:57.661358Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15632/citation-record","integrity":"/paper/2412.15632/integrity","json":"/paper/2412.15632/citation-record.json","paper":"/paper/2412.15632"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:58.059107Z","title":"Crepe: Can vision-language foundation models reason compositionally?,","venue":null,"work_id":"933d59ed-84dd-4c4f-9163-52e42cc688d8","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.535883Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:12706c518e74947cd2880bd9ca3e1c79497edacb31bdd1a77bd97c11723ae9e5","observation_id":"37bb6e02-4aac-4a64-8cbe-564d83c5e0ac","resolution":{"observed_at":"2026-08-11T11:18:58.062691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:58.048516Z","title":"When and why vision-language models behave like bags-of-words, and what to do about it?,","venue":null,"work_id":"f83d8da8-dacd-471e-8146-e705cb82c80a","year":2022},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.541141Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:7db90c098f4bff6fd7ba294246ddf8ad68275595bd772fbea1d2f311705f6748","observation_id":"1788f531-0ce9-4c44-b93a-a7d6520b7a00","resolution":{"observed_at":"2026-08-11T11:18:58.052441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:58.037042Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision- language compositionality,","venue":null,"work_id":"92973c91-5dd8-4004-9927-26b8f5c57eb8","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.545117Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:3fe717d8abc9d29a1f4231734c775029345539d7a17fbf70c5d09c223bdc3832","observation_id":"db3469b1-70c0-4030-8bb6-2b39f234beea","resolution":{"observed_at":"2026-08-11T11:18:58.041156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:58.026640Z","title":"Winoground: Probing vision and language models for visio-linguistic compositionality,","venue":null,"work_id":"72e9c980-ab62-4656-a74c-b337f3de0e96","year":2022},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.549466Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:904177d429cb943950fa5b260b3ca22552d1e4c857863d9ddc536757fd1f92de","observation_id":"53ac6195-82bb-4ec6-9cb1-d71815a5b94f","resolution":{"observed_at":"2026-08-11T11:18:58.030314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03689","last_updated":"2023-11-03T03:54:28Z","snapshot_observed_at":"2026-08-16T21:53:25.386226Z","submitted_at":"2023-05-05T17:00:16Z","title":"COLA: A Benchmark for Compositional Text-to-image Retrieval","version":3},"cited_work":{"arxiv_id":"2305.03689","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.03689","snapshot_observed_at":"2026-08-11T11:18:57.784789Z","title":"COLA: A Benchmark for Compositional Text-to-image Retrieval","venue":"cs.CV","work_id":"70ec72cd-e99d-4ea6-a1e2-36f853a41f82","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.554111Z"},"links":{"cited_paper":"/paper/2305.03689","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:713e19a0d19a5d3a084b3286a17abdaaf25e123d5d98056d4ed58d327263ae62","observation_id":"25796259-1cb0-470d-82b7-a449dd88ce4d","resolution":{"observed_at":"2026-08-11T11:18:57.790881Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02545","last_updated":"2024-11-04T19:24:59Z","snapshot_observed_at":"2026-08-16T13:03:01.441466Z","submitted_at":"2024-11-04T19:24:59Z","title":"TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02545","snapshot_observed_at":"2026-08-11T11:18:57.558663Z","title":"Tripletclip: Improving compositional reasoning of clip via synthetic vision-language negatives,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.558663Z"},"links":{"cited_paper":"/paper/2411.02545","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:17436cd19e24de6c7e2471c020fc2a03da1dd1d0b39814f9c746368163e97133","observation_id":"05fe36df-6be9-46e5-877f-6dad7a267371","resolution":{"observed_at":"2026-08-11T11:18:57.558663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:58.016145Z","title":"Structure-clip: Towards scene graph knowledge to enhance multi-modal structured representations,","venue":null,"work_id":"3d524d5b-fdd2-49bc-aab0-d28290063ece","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.563573Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:43ad58394bf8c5661bfba6acc87f693772d3a3e080264d432328a7e54a514447","observation_id":"31006a19-18c7-4ed1-af96-16552750bdb6","resolution":{"observed_at":"2026-08-11T11:18:58.019850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06343","last_updated":"2023-10-24T21:40:00Z","snapshot_observed_at":"2026-08-16T15:34:04.790754Z","submitted_at":"2023-05-10T17:52:26Z","title":"Incorporating Structured Representations into Pretrained Vision & Language Models Using Scene Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06343","snapshot_observed_at":"2026-08-11T11:18:57.567117Z","title":"Incorporating structured representations into pretrained vision & language models using scene graphs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.567117Z"},"links":{"cited_paper":"/paper/2305.06343","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:d480d59c0f142dad9b7eb62d441b8eca479df86be12dc435019f104b2d65224b","observation_id":"b613d16e-7adb-4c98-bbc9-a6196b92e7a5","resolution":{"observed_at":"2026-08-11T11:18:57.567117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.570839Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.570839Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:dd21080f652391dcecef0f233288ec753dc0947cf9e1a008127878b589cda883","observation_id":"e2b8d73d-bf08-4953-994e-1bf9232eaef0","resolution":{"observed_at":"2026-08-11T11:18:57.570839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.998967Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion,","venue":null,"work_id":"1deda413-7802-428f-93fe-8dfda251b655","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.573849Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:9476c14cf741a1b9f11a9564a362067d8c0fd7623272a7eb9aba37ef2d9d8806","observation_id":"8f0ce826-e019-4799-bd27-4f8c3efcf2ac","resolution":{"observed_at":"2026-08-11T11:18:58.002876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20312","last_updated":"2024-03-29T17:33:42Z","snapshot_observed_at":"2026-08-16T14:05:08.303747Z","submitted_at":"2024-03-29T17:33:42Z","title":"Learn \"No\" to Say \"Yes\" Better: Improving Vision-Language Models via Negations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20312","snapshot_observed_at":"2026-08-11T11:18:57.576776Z","title":"Learn” no","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.576776Z"},"links":{"cited_paper":"/paper/2403.20312","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:d8b442b036657f131c6eeeb8eac4e5e8d998caf2792ecf628246acbcaebb22d3","observation_id":"60773a53-94d1-439e-9cca-7e6f2965f182","resolution":{"observed_at":"2026-08-11T11:18:57.576776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.989612Z","title":"Iterated learning improves compositionality in large vision- language models,","venue":null,"work_id":"815845e6-6c80-4eba-af3a-0f3355d25885","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.580037Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:f9688d2bb780ab0c709030cce742928c392bf35853ae6b22b05f8a2f51f6b7b4","observation_id":"ec736375-a958-41d4-a5f3-3504adbf91c4","resolution":{"observed_at":"2026-08-11T11:18:57.992874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.980393Z","title":"Teaching structured vision & language concepts to vision & language models,","venue":null,"work_id":"be964d6a-82f6-4c1b-97e4-9442efebc1e8","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.582717Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:bdccc68fd6fe4cde4d46a5d54f324d3bbd9d5a1889865f3c7f8046ba73e13e29","observation_id":"6367ebdf-2a54-4e1a-a946-85f400089516","resolution":{"observed_at":"2026-08-11T11:18:57.983542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-08-16T14:29:43.688786Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-11T11:18:57.585495Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.585495Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:b846535b84856dc076cf8445752651fa5d58e4520cdafed414ad3c9c90e6285a","observation_id":"8004868c-9524-4656-8781-6ecf5af4e3be","resolution":{"observed_at":"2026-08-11T11:18:57.585495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.971240Z","title":"What you see is what you read? improving text-image alignment evaluation,","venue":null,"work_id":"c117f1b8-38b0-45e8-8b53-3d5d73891644","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.588638Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:b77841893187035a00fcd24a724bc086e966a1f733d7ccba9f7b32708ad876d3","observation_id":"7586e22e-d738-467a-a41a-bb27528d1909","resolution":{"observed_at":"2026-08-11T11:18:57.974398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.962165Z","title":"Multi-concept customization of text-to-image diffusion,","venue":null,"work_id":"82254015-9781-4e55-a1d7-91cf23cce7e9","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.591574Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:34c06ee3b985aeaaf463548d2ca67da6b3b76a37642ba5442b1b2bb067be9632","observation_id":"dc631507-500a-4777-9dc2-5c53167b68bc","resolution":{"observed_at":"2026-08-11T11:18:57.965507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.953419Z","title":"“this is my unicorn, fluffy","venue":null,"work_id":"384f1dbc-6380-4927-a3da-b77be386bf55","year":2022},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.594637Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:73ed196415cadd253df5108f0e21b69607ba3e8337f2e65ec8fb1b86e8acf5ce","observation_id":"78b8c5c1-e5ff-4d9d-8569-71505f8d4367","resolution":{"observed_at":"2026-08-11T11:18:57.956312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.943702Z","title":"Zero-shot composed image retrieval with textual inversion,","venue":null,"work_id":"1183cf1a-d4d4-4561-b36a-4482e586a411","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.597686Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:3a9c8568ba27e68874851fd81a86d241e066f7ef903249f10d548bc0efb46cd2","observation_id":"f62df5e6-da21-48d9-af5b-d67c7f0d1c39","resolution":{"observed_at":"2026-08-11T11:18:57.947517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02951","last_updated":"2025-07-26T10:50:24Z","snapshot_observed_at":"2026-08-16T13:55:17.552458Z","submitted_at":"2024-05-05T14:39:06Z","title":"iSEARLE: Improving Textual Inversion for Zero-Shot Composed Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02951","snapshot_observed_at":"2026-08-11T11:18:57.601309Z","title":"isearle: Improving textual inversion for zero-shot composed image retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.601309Z"},"links":{"cited_paper":"/paper/2405.02951","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:0e6a3c5fda4838b9685e646bf9d198565b6b1bc60559cc70e3cf8419099197ad","observation_id":"2a8a207b-7ac2-4684-a505-9f6f1846edcd","resolution":{"observed_at":"2026-08-11T11:18:57.601309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.932621Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval,","venue":null,"work_id":"d12aa07f-f3cb-43c8-ad1b-8d7739b4f5cb","year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.605099Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:d6906093eed15492d54449946465d4cf74f2ed1ee07f36f60cee342338b3a1e4","observation_id":"a435dafd-da81-42b1-a77e-a6c09b3169af","resolution":{"observed_at":"2026-08-11T11:18:57.936721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.921872Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":"d89ffc2a-d343-4735-b8f3-86712840e7c5","year":2018},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.608072Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:9f3fdd18ec261f04c663763c262723fa7b852f9ce4cb6ec92a86d9d6efbda087","observation_id":"6bd0fe77-c636-4ffd-97b7-492e42619c17","resolution":{"observed_at":"2026-08-11T11:18:57.925960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-11T11:18:57.610992Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.610992Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:5f3e0e6a805142b7b545ffd8e76c5b9a6db0bd091c811992b34e16872d7f594e","observation_id":"073fccc2-f276-4bf8-b538-fbd48eb9c2c8","resolution":{"observed_at":"2026-08-11T11:18:57.610992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-08-17T13:50:40.586963Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-11T11:18:57.614664Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.614664Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:148823199250bc387dae19c00d13a923da0d046657a49400caacbd7dc527c15b","observation_id":"22ddab9d-f98c-4e18-94d1-b48c4df647a0","resolution":{"observed_at":"2026-08-11T11:18:57.614664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.911136Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":"40342103-3ac2-4d00-b1f4-b31a8d91ceca","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.618411Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:f62ff36400b89af2c3f8d41987d8726d9c32b724b5dac138b629a7dbd1579016","observation_id":"d5519a82-dcd4-434c-923e-40758c30a318","resolution":{"observed_at":"2026-08-11T11:18:57.915094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.899342Z","title":"Clip-kd: An empirical study of clip model distillation,","venue":null,"work_id":"a1cd5dde-c819-48af-b5ac-2a7578422fcb","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.621870Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:ef68944a76a3ef2633839499d3a61bbcea492d1a481eac5b380fb3c7fbd834ba","observation_id":"b141dfb6-7d6c-49e7-93f6-e2033813fe5b","resolution":{"observed_at":"2026-08-11T11:18:57.903039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.889128Z","title":"Laion-5b: An open large- scale dataset for training next generation image-text models,","venue":null,"work_id":"34858db2-7976-4a4a-b825-01de8a0b4f27","year":2022},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.625365Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:eef6dd3fc76b9c726cdb5a3edb3bc0a0e404a25359a252a6af4ac12da0624a5e","observation_id":"65dfa721-ce19-4a1f-90ee-9557804774f8","resolution":{"observed_at":"2026-08-11T11:18:57.892792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.878664Z","title":"ImageNet Large Scale Visual Recognition Challenge,","venue":null,"work_id":"93ce38c6-614e-4c3d-ba9f-be14409a6ee4","year":2015},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.628781Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:c7d4a7cde39200761b309dced6de1bb7777a5d0c0cdb9c6ecabad795700a5e2d","observation_id":"288107f5-27ff-4dbd-9dd6-d61e965cf183","resolution":{"observed_at":"2026-08-11T11:18:57.882735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.868857Z","title":"Language models are few-shot learners,","venue":null,"work_id":"02d3f8da-9f2e-47ae-a357-dd1e46008ace","year":1901},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.633436Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:e67821664a57fdf194ac3af73e9c78c4057792fdb5238985b4c07f8810bf57b6","observation_id":"c710def6-d9ed-48ce-9a1f-4e1e00f6905f","resolution":{"observed_at":"2026-08-11T11:18:57.872207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.858071Z","title":"Im- proved baselines with visual instruction tuning,","venue":null,"work_id":"424b4bf1-fedf-41f3-916d-b878958966ed","year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.638079Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:8d206b9d900b2143ebaa36381f81a6fceb83bd948ca4f1693d1178b71d83f6a8","observation_id":"fa58cf2b-edd1-4682-90eb-c81fe48fae97","resolution":{"observed_at":"2026-08-11T11:18:57.861448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:18:57.641777Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.641777Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:d4cd35a6c3e46c61ec5603827a72dbecc099e5301cc20e30d9b0b3f19da0e8f7","observation_id":"05fd301d-9e33-4f55-8e85-c8c628e07f38","resolution":{"observed_at":"2026-08-11T11:18:57.641777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.845573Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image anno- tations,","venue":null,"work_id":"3cf42939-72c8-406d-bba3-fb439ebd18a2","year":2017},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.645697Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:3ec9f7e69723c4c84b26dd09b69c959413e31320fc08122add8c288fe2122e5c","observation_id":"1a827271-5192-4cea-9f8b-a310bbdeefa2","resolution":{"observed_at":"2026-08-11T11:18:57.849579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.834387Z","title":null,"venue":null,"work_id":"480aede7-bccd-4574-bc53-b7864916ff7f","year":null},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.650102Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:c2f378670c33773b2907b41b53bff36988bc95bd0e4aae138d2ade57d23ad800","observation_id":"7f940723-8aba-41c2-b6a7-49928ded111f","resolution":{"observed_at":"2026-08-11T11:18:57.838069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.821959Z","title":"The batch size is set to 256, and loss weights λgpt are swept over {0.5, 0.75, 1} to determine the best model","venue":null,"work_id":"fd6306a3-1911-4670-82fc-4e9774322064","year":null},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.654083Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:259f310b1dbffa4331674bc85cbc08c55a63a0d20ef17b3781691169470e1e7b","observation_id":"c7371fb4-37cf-4302-9f3a-e2616b6e1c59","resolution":{"observed_at":"2026-08-11T11:18:57.826661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.798447Z","title":"A little girl sitting on top of a bed next to a lamp","venue":null,"work_id":"83f606f4-55e1-4a6d-a23f-eaa45fe769e5","year":null},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.661358Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:b4a6858d986beac6089080e062483eec77a6ac4802d930991383495b0d6003c4","observation_id":"251db144-0fd7-45b0-9ab5-32e91c7175d8","resolution":{"observed_at":"2026-08-11T11:18:57.802219Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:18:57.809973Z","title":"Training the textual inversion network Θ takes 18 hours in total on a single A6000 GPU","venue":null,"work_id":"88687ec3-bab6-4ba9-bb04-d14752bc4848","year":null},"citing_paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:57.657771Z"},"links":{"citing_paper":"/paper/2412.15632"},"observation_digest":"sha256:3bc43c9cf5d82484b5ec2f1a7f8f8b6956f28877fb77520829dbec97068ab795","observation_id":"f027e09c-400e-4ddb-9587-9f81e14c00ef","resolution":{"observed_at":"2026-08-11T11:18:57.813978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.15632","last_updated":"2024-12-20T07:48:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T12:21:03.377978Z","submitted_at":"2024-12-20T07:48:09Z","title":"A New Method to Capturing Compositional Knowledge in Linguistic Space"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2412.15632."}