add webui

2026-04-13 13:05:45 +00:00 · 2026-04-13 10:55:51 +08:00
parent 166e6d2d38
commit 224060c2a0
4 changed files with 291 additions and 8 deletions
--- a/diffsynth/models/dinov3_image_encoder.py
+++ b/diffsynth/models/dinov3_image_encoder.py
@@ -1,4 +1,4 @@
-from transformers import DINOv3ViTModel, DINOv3ViTImageProcessorFast
+from transformers import DINOv3ViTModel, DINOv3ViTImageProcessor
 from transformers.models.dinov3_vit.modeling_dinov3_vit import DINOv3ViTConfig
 import torch

@@ -40,7 +40,7 @@ class DINOv3ImageEncoder(DINOv3ViTModel):
            value_bias = False
        )
        super().__init__(config)
-        self.processor = DINOv3ViTImageProcessorFast(
+        self.processor = DINOv3ViTImageProcessor(
            crop_size = None,
            data_format = "channels_first",
            default_to_square = True,
@@ -56,7 +56,7 @@ class DINOv3ImageEncoder(DINOv3ViTModel):
                0.456,
                0.406
            ],
-            image_processor_type = "DINOv3ViTImageProcessorFast",
+            image_processor_type = "DINOv3ViTImageProcessor",
            image_std = [
                0.229,
                0.224,
--- a/diffsynth/models/siglip2_image_encoder.py
+++ b/diffsynth/models/siglip2_image_encoder.py
@@ -1,5 +1,5 @@
 from transformers.models.siglip.modeling_siglip import SiglipVisionTransformer, SiglipVisionConfig
-from transformers import SiglipImageProcessor, Siglip2VisionModel, Siglip2VisionConfig, Siglip2ImageProcessorFast
+from transformers import SiglipImageProcessor, Siglip2VisionModel, Siglip2VisionConfig, Siglip2ImageProcessor
 import torch

 from diffsynth.core.device.npu_compatible_device import get_device_type
@@ -90,7 +90,7 @@ class Siglip2ImageEncoder428M(Siglip2VisionModel):
            transformers_version = "4.57.1"
        )
        super().__init__(config)
-        self.processor = Siglip2ImageProcessorFast(
+        self.processor = Siglip2ImageProcessor(
            **{
                "data_format": "channels_first",
                "default_to_square": True,
@@ -106,7 +106,7 @@ class Siglip2ImageEncoder428M(Siglip2VisionModel):
                    0.5,
                    0.5
                ],
-                "image_processor_type": "Siglip2ImageProcessorFast",
+                "image_processor_type": "Siglip2ImageProcessor",
                "image_std": [
                    0.5,
                    0.5,
--- a/diffsynth/pipelines/z_image.py
+++ b/diffsynth/pipelines/z_image.py
@@ -95,7 +95,7 @@ class ZImagePipeline(BasePipeline):
    def __call__(
        self,
        # Prompt
-        prompt: str,
+        prompt: str = "",
        negative_prompt: str = "",
        cfg_scale: float = 1.0,
        # Image
@@ -109,7 +109,7 @@ class ZImagePipeline(BasePipeline):
        width: int = 1024,
        # Randomness
        seed: int = None,
-        rand_device: str = "cpu",
+        rand_device: Union[str, torch.device] = "cpu",
        # Steps
        num_inference_steps: int = 8,
        sigma_shift: float = None,