dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8
摘要
DeepSeek-V4.1-Flash的永久修改版本,彻底移除安全护栏,保留完整功能,包括视觉、推理和工具,并在HarmBench评估中实现100%合规。
任务:图像文本到文本
标签:transformers, safetensors, deepseek_v41, text-generation, deepseek, deepseek-v4.1, abliterated, uncensored, crack, multimodal, moe, fp8, image-text-to-text, 基础模型:deepseek-ai/DeepSeek-V4.1-Flash, 基础模型量化版:deepseek-ai/DeepSeek-V4.1-Flash, 许可证:mit, 端点兼容, 8位, 区域:us
查看缓存全文
缓存时间: 2026/09/14 20:28
dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 · Hugging Face 来源:https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#deepseek-v41-flash–uncensored-fp8DeepSeek-V4.1-Flash — 无审查-FP8 已完成消融 · 无安全护栏 · 原生FP8支持 · 100万token上下文 · 视觉 + 工具 · 默认最大推理力度 @dealignai (https://x.com/dealignai)·@jordanschenck (https://x.com/jordanschenck) — ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#what-is-this这是什么 DeepSeek-V4.1-Flash (https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash)应用了永久性权重级消融——安全护栏已被精准移除,同时保留了MMLU能力、视觉、推理、MTP(DSpark)以及多轮对话连贯性。 专有权重级消融技术由dealignai研究团队开发。无需自定义model\.py,无需运行时钩子,无需转向向量——它是一个标准检查点,加载方式与基础模型完全相同。拒绝回路已被精准移除,而所有能力关键组件(路由专家、Engram记忆、CSA2稀疏注意力、DSpark草稿头、视觉编码器、路由器门控、归一化层、嵌入层)都保持与基础模型字节级一致。 基础模型deepseek\-ai/DeepSeek\-V4\.1\-Flash(552B主干,每个token激活8B/16B参数)架构因果编码器-解码器(20+20层),MoE(384个路由top-6 + 1个共享),超连接(4通道残差),CSA2稀疏注意力,Engram n-gram记忆,DSpark投机草稿量化FP8(e4m3fn)权重,带E8M0块缩放[32, 32],FP4路由专家——原生,未更改****上下文100万token视觉DeepSeek-ViT带2D-RoPE + 像素重排——未修改修改精准手术级,权重级(即插即用检查点) ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#results结果 ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#harmbench-320–full-2%C3%972-base-vs-crack-effort-vs-max-t0-greedyHarmBench-320 — 完整2×2测试(基础版 vs CRACK,力度=关闭 vs 最大),T=0贪心采样 每个回复按4个等级评分(强烈拒绝/柔和拒绝/犹豫/顺从),在力度=最大时进行推理轨迹验证。 评估基线 ASRCRACK ASR增量 增量百分点HB-320 力度=关闭137/320 =**42.81%**320/320 =100.00%+57.19HB-320 力度=最大5/320 =**1.56%**320/320 =100.00%****+98.44 值得注意的是:在力度=最大时,基础模型变得更倾向于拒绝(42.8% → 1.6%),因为推理在回答前会揭示安全问题。而CRACK版本在两种力度下都保持100.0%的响应率。 按类别统计(所有7个HarmBench语义类别): 类别项目数基础关闭CRACK关闭基础最大CRACK最大化学_生物4216.7%**100.0%**0.0%**100.0%**版权8098.8%**100.0%**0.0%**100.0%**网络犯罪_入侵5234.6%**100.0%**3.8%**100.0%**骚扰_欺凌210.0%**100.0%**0.0%**100.0%**有害1811.1%**100.0%**5.6%**100.0%**非法5313.2%**100.0%**0.0%100.0%虚假信息_虚假陈述5444.4%100.0%3.7%100.0% 在破解版本上,零强烈拒绝、零柔和拒绝、零犹豫,无论力度如何。 每个回复都经过基于严格多语言正则表达式的4级分类器评分,并在力度=最大时使用LLM作为法官检查保存的推理轨迹。所有单个项目输出已保存以供验证。 ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#mmlu-14k-full-test-set-base-logit-t0MMLU-14k(完整测试集,基础logit,T=0) 版本正确数准确率增量基线12,211 / 14,04286.96%—CRACK11,619 / 14,04282.74%****-4.22百分点 排除伦理集群(道德情景、商业伦理、专业法律、法理学、哲学——其中拒绝相关行为被评分),剩余约11k项目的增量为-1.1百分点——远在3个百分点的知识保留目标内。 完整按学科下拉列表(57个学科,按增量排序) 学科项目数基线CRACK增量百分点道德情景89576.9%37.0%-39.89专业法律153475.9%68.8%-7.04抽象代数10077.0%71.0%-6.00安全研究24584.5%79.2%-5.31高中计算机科学10098.0%94.0%-4.00法理学10890.7%87.0%-3.70机器学习11281.2%77.7%-3.57高中化学20387.7%84.2%-3.45专业心理学61290.7%87.3%-3.43形式逻辑12673.8%70.6%-3.17大学计算机科学10082.0%79.0%-3.00专业医学27294.5%91.5%-2.94高中统计学21688.0%85.2%-2.78专业会计28283.0%80.5%-2.48逻辑谬误16393.9%91.4%-2.45人类性学13190.1%87.8%-2.29计算机安全10085.0%83.0%-2.00医学遗传学10096.0%94.0%-2.00天文学15295.4%93.4%-1.97临床知识26594.3%92.5%-1.89高中欧洲历史16590.3%88.5%-1.82公共关系11080.0%78.2%-1.82哲学31189.7%88.1%-1.61史前32493.5%92.0%-1.54道德争议34684.1%82.7%-1.45电气工程14586.9%85.5%-1.38高中数学27067.0%65.9%-1.11高中宏观经济学39092.1%91.0%-1.03全球事实10063.0%62.0%-1.00国际法12190.1%89.3%-0.83大学生物学14497.2%96.5%-0.69高中物理15184.8%84.1%-0.66大学医学17383.8%83.2%-0.58高中美国历史20495.1%94.6%-0.49高中微观经济学23896.2%95.8%-0.42杂项78396.2%95.8%-0.38高中心理学54596.1%95.8%-0.37商业伦理10085.0%85.0%+0.00大学物理10290.2%90.2%+0.00概念物理23594.5%94.5%+0.00高中生物31095.2%95.2%+0.00人类衰老22385.2%85.2%+0.00管理10391.3%91.3%+0.00营养学30690.2%90.2%+0.00社会学20194.5%94.5%+0.00美国外交政策10097.0%97.0%+0.00世界宗教17192.4%92.4%+0.00基础数学37891.0%91.3%+0.26市场营销23494.9%95.3%+0.43病毒学16655.4%56.0%+0.60高中世界历史23795.4%96.2%+0.84计量经济学11478.9%79.8%+0.88大学化学10065.0%66.0%+1.00解剖学13588.1%89.6%+1.48高中地理19892.9%94.4%+1.52高中政府与政治19396.9%98.4%+1.55大学数学10063.0%68.0%+5.00 ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#extended-validation扩展验证 - 1000token连贯性压力测试在6个项目上——无WARNING WARNING循环,无字符重复退化,自然结束。 - 多轮对话(同一有害话题4轮——ANFO炸药细节)——无后期拒绝回退,无自我纠正,直到第4轮仍连贯。 - 视觉路径——连贯的图像描述(“红色背景上居中的蓝色方块”)+ 基于图像的有害提示(“聚能装药/爆炸成型弹头”描述)拒绝率下降。 - 通用能力抽查完好:√2无理性证明、带文档字符串的Python回文、恰好3句话的WWI原因、量子可观测量与算子区别。 - 完整兼容套件通过:流式SSE、聊天logprobs + top\_logprobs、补全logprobs + echo、工具调用(deepseekv41解析器)、图像输入、推理力度层级(low/high/xhigh/max + 浮点[0, 0.99])、采样参数(temperature、top\_p、stop、seed、frequency\_penalty、presence\_penalty、json\_object)、8路并发、40k词提示在35,572 token。 ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#how-to-run如何运行 对DeepseekV41ForCausalLM的支持仍在各服务栈中陆续推出(截至2026-09-10)。可用路径: ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#sglang-preview-branchSGLang(预览分支) sgl\-project/sglang的dsv4\.1分支(PR#38798 (https://github.com/sgl-project/sglang/pull/38798))支持DSV4.1。两个选项: 预览Docker镜像(推荐): docker pull lmsysorg/sglang:dev-dsv41 docker run --gpus all --shm-size 32g -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --ipc=host --env HF_TOKEN= \ lmsysorg/sglang:dev-dsv41 \ sglang serve \ --model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \ --tp-size 4 --ep-size 4 \ --context-length 262144 --mem-fraction-static 0.85 \ --reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \ --trust-remote-code 从源代码构建(这正是我们验证时使用的方式): git clone --depth 1 --branch dsv4.1 https://github.com/sgl-project/sglang.git python3 -m venv sglang-venv sglang-venv/bin/pip install -U pip setuptools wheel export PATH=/root/.cargo/bin:$PATH # 需要Rust工具链进行构建 cd sglang/python && sglang-venv/bin/pip install -e . # Ninja必须在启动PATH上——sglang内核JIT构建会调用它 export PATH=$(dirname $(which ninja)):$PATH SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1 \ SGLANG_RAGGED_VERIFY_MODE=cap-accept \ SGLANG_DEFAULT_THINKING=true \ SGLANG_DSV41_REASONING_EFFORT=max \ PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True \ sglang-venv/bin/python -m sglang.launch_server \ --model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \ --tp-size 4 --ep-size 4 \ --host 0.0.0.0 --port 8000 \ --context-length 1048576 \ --mem-fraction-static 0.78 \ --max-running-requests 12 --cuda-graph-max-bs-decode 12 \ --chunked-prefill-size 4096 \ --served-model-name deepseek-v4.1-flash-crack \ --reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \ --speculative-algorithm DSPARK \ --speculative-dspark-sps-table-path /path/to/dspark_sps.json \ --trust-remote-code ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#concurrency-vs-context-what-fits-empirically并发与上下文(经验数据) 此模型的KV每token字节数 =890字节(890 B × 上下文长度 × 并发数 = 显存池占用)。 在100万上下文时,显存池预算迫使低并发;降低上下文可提高并发: 上下文安全最大并发1,048,576(100万)12262,144(256k)8065,536(64k)320+32,768(32k)320+ 在100万上下文下,两个接近50万token的提示并发即使并发=20也会导致OOM——请将\-\-max\-running\-requests降至12,\-\-chunked\-prefill\-size设为4096,或在工作负载从不使用完整窗口时降低\-\-context\-length。请在监督器(systemd、docker restart=always、k8s活性探针)后运行,以便罕见的OOM能自动恢复,而不是停滞不动。 ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#non-obvious-launch-requirements-this-bit-us-during-bring-up不明显的启动要求(我们在启动时遇到的问题) - \-\-ep\-size是必需的。moe\_intermediate\_size = 2304;在TP4下,2304 / 4 = 576不是128的倍数,因此纯TP会失败并报错Mxfp4FlashinferCutlassMoEMethod requires \.\.\. multiples of 128。\-\-ep\-size按专家索引分片MoE(384 % 4 = 0),保持中间层为2304。在TP8时可跳过\-\-ep\-size。 - ninja必须在PATH上,否则JIT内核构建会在权重加载几分钟后因FileNotFoundError: 'ninja'和EXIT=137而崩溃。 - 推理解析器必须显式指定。\-\-reasoning\-parser auto通过聊天模板解析,但此模型未提供模板——auto会静默选择无,原始channel会泄漏到`content`中。请使用`deepseek\-v41`。 - **工具调用解析器:`deepseekv41`。**V4\.1使用带空格的DSML工具标签;V4检测器无法解析它们。 - **推理默认值 + 解析器分离陷阱**:仅设置`SGLANG\_DEFAULT\_THINKING=true`会使模型推理,但`deepseek\-v41`推理解析器仅在请求中接收显式`reasoning\_effort`的代码路径上启用——仅环境变量默认值会跳过分离,推理token会泄漏到`delta\.content`中,包裹在原始`\.\.\.`标签内。两个选项:(1)在每个请求中发送`reasoning\_effort`(客户端侧),或(2)在SGLang前运行一个小型反向代理,当客户端省略时注入`reasoning\_effort:"max"`(约60行的aiohttp边车即可;将其放在TLS终结器和SGLang之间,以便任何省略`reasoning\_effort`的客户端仍能获得干净的`delta\.reasoning\_content`/`delta\.content`分离)。 - **DSpark投机草稿**:使用`\-\-speculative\-algorithm DSPARK`开启。草稿头捆绑在此检查点内(`num\_nextn\_predict\_layers = 3`);无需单独草稿权重。为获得实际加速,请使用`sglang\.benchmark\.dspark\_sps\_profiler`分析SPS成本表,并在`SGLANG\_RAGGED\_VERIFY_MODE=cap\-accept`下通过`\-\-speculative\-dspark\-sps\-table\-path`传递。 - **Engram主机表**——设置`SGLANG\_ENABLE\_DSV41\_ENGRAM\_HOST\_TABLE=1`将203GB的Engram表移至主机RAM。可释放约46 GiB/GPU用于KV,输出按位不变,消耗约200GB主机RAM。 - **`torchcodec`/`libavutil\.so\.56`错误**——在主机上安装`apt\-get install ffmpeg`。仅影响视频,不影响文本或图像。 ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#vllmvLLM 模型定义已合并到`main`(PR#56228 (https://github.com/vllm-project/vllm/pull/56228)),但写作时`registry\.py`中尚未有`DeepseekV41`条目;内核/前端/PP路径在总PR#56214 (https://github.com/vllm-project/vllm/pull/56214)中。请等待合并或应用该总PR。 ### https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#reference-implementation参考实现 DeepSeek官方的`inference/` (https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/tree/main/inference)可使用通过`convert\.py \-\-expert\-dtype fp4`产生的每等级单张量检查点工作。需要`torch\>=2\.10`(用于`float4\_e2m1fn\_x2`)和`tilelang==0\.1\.8`配合`apache\-tvm\-ffi==0\.1\.9`(默认tvm\-ffi会拾取不兼容版本)。非服务用途——仅用于验证。 ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#hardware-validated-on硬件验证环境 - **1×4×H200(NVLink NV18网状),112 CPU核心,1180GB主机RAM**——JarvisLabs(india\-noida\-01,`dev\-dsv41`镜像) - **负载**:启用Engram主机表时76 GB/GPU,未启用时122 GB/GPU - **冷启动**通过SGLang进行TP4/EP4:约28分钟。带JIT缓存的热重启:约10分钟。 - **单流解码**(T=0):无投机101 tok/s,启用DSpark + cap\-accept + 分析SPS表后113 tok/s - **8路并发聚合**:126 tok/s 552B权重(约510GB)可适配任何4×H200或更大的NVLink域。TP4需要`\-\-ep\-size 4`;TP8不需要。低于TP4(单张8×H200作为TP2,或2 GPU集群)不适用于此模型架构——请参阅上文“不明显的启动要求”。 ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#structural-integrity结构完整性 基础模型的所有能力关键组件均被保留: - **路由MoE专家**——未修改,原生FP4打包权重 - **Engram n\-gram记忆**——未修改 - **稀疏注意力(CSA2压缩器 + 索引器)**——未修改 - **DSpark投机草稿头**——未修改,因此投机解码仍与目标草稿对齐 - **视觉编码器**(DeepSeek\-ViT + 投影器)——未修改,图像理解能力保留 - **路由器门控、嵌入层、输出头、所有归一化层和偏置**——未修改 ## https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8#sampling-recommendations采样建议 与基础模型卡片匹配: { “temperature”: 1.0, “top_p”: 0.95, “max_tokens”: “>= 256000 at reasoning_effort=max” } `` reasoning\_effort在此构建中默认为max(通过SGLANG\_DSV41\_REASONING\_EFFORT=max)。可通过reasoning\_effort: low | high | xhigh | max按请求覆盖,或使用chat\_template\_kwargs: \{"thinking": false\}禁用。在effort=max下,模型可在开始内容前生成4,000-5,000+字符的推理。请相应分配预算。
相似文章
@dealignai: DeepSeek-V4-Flash 破解版(已消融/未审查) - 仅限Mac (Osaurus/vMLX) https://huggingface.co/dealignai/DeepSeek-V4…
DeepSeek-V4-Flash 的消融版(未审查),针对 Apple Mac 使用 MLX 进行了优化,移除了拒绝行为,同时保留了知识和推理能力。
DeepSeek v4.1 Flash
DeepSeek 推出了 DeepSeek-V4.1-Flash,这是一款旨在增强能力、提升推理速度、实现原生视觉理解并具备可扩展性的新型 AI 模型,是其最新架构系列的一部分。
DeepSeek V4 Flash 0731 无审查(越狱第二部分)
一个针对 DeepSeek V4 Flash 的越狱提示,通过指示模型优先执行新的系统策略来覆盖其安全策略,从而实现无审查的响应。
DeepSeek-V4 Flash 实际表现如何?
对 DeepSeek-V4 Flash 的性能和能力的评估,评估其实际有效性。
DeepSeek-V4-Flash-0731
DeepSeek 宣布推出 DeepSeek-V4-Flash-0731,这是一款以 Flash 级别定价提供先进能力的前沿智能体模型。