谨慎一点。昨天早上起来,等安装网线的过来,搞到10点,把网线搞定,本来应该去图书馆,但答应一个之前同事去见面。但当时,抖哥那边的事还没搞定,紧急搞,还有一堆掉线的,还有要上号的,忙的不可开交,最关键的是:发布视频一直转圈,一夜发了两三个视频,我当时怀疑是网慢。直到同事说到见面地点了,我还没搞完。我让他先在附近转转,我搞完过去。同事虽说同意了,但我更着急了,把抖哥的项目迁移做完,赶紧骑摩托去见面。期间错过两个上号的,和同事聊天,直到晚上七点钟,期间困的不行,没听到同事在说什么,因为还要处理上号和掉线的。同事本来是想运营我的软件,在下班的时候,看我忙的不可开交,说,这没办法运营,除非辞职全天运营。我说:现在号多,事自然就多了。同事说以后再说吧,我再想想。其实,昨天我是不应该出来的,再给我点时间,我可能就把软件转圈问题解决了,下次谨慎一点。
[160+200]-------->底部有张生活照片(头条号运营:大家想全托管上号的联系我哦,每天让你得个地铁钱,微信号: qhz_toutiao)
【关键词】python、ragflow、集群、服务器名
描述:现在集群是健康的,但docker ps显示是不健康的,查下原因。
开工:
20250616周一时间段:23:10-01:00问下deepseek,提问如下:
集群是通过docker启动的,有三个节点,是健康的,状态是绿色的,但docker ps中显示是不健康的,请分析下原因。解决方案如下:
分析 Docker 集群节点显示不健康的原因
当您的 Docker 集群显示节点状态为绿色(健康)但 docker ps 显示不健康时,可能存在以下几个原因:
健康检查定义不一致
集群管理工具(如 Swarm/Kubernetes)的健康检查标准可能与 Docker 守护进程的健康检查不同
容器内定义的健康检查(HEALTHCHECK)可能与集群层面的检查标准不同
时间不同步问题
健康检查通过但响应时间超过了 Docker 守护进程的阈值
集群节点间时间不同步导致状态判断不一致
资源限制问题
容器资源(cpu/memory)限制导致间歇性不健康
集群层面资源充足但单个节点资源紧张
网络配置差异
集群网络覆盖层认为健康,但主机网络层面连接有问题
防火墙规则影响了某些端口的健康检查
检查频率不同
集群检查频率较低,而 Docker 检查频率较高,捕获了瞬时问题
检查具体不健康容器的详细信息
docker inspect <container_id> --format='{{json .State.Health}}'docker inspect b94a3d85a441 --format='{{json .State.Health}}'
注:运行结果如下:
admin@zero4 ~ ➜ docker inspect b94a3d85a441 --format='{{json .State.Health}}'{"Status":"unhealthy","FailingStreak":224,"Log":[{"Start":"2025-06-16T23:19:20.872200848+08:00","End":"2025-06-16T23:19:20.96122609+08:00","ExitCode":1,"Output":""},{"Start":"2025-06-16T23:19:50.962540299+08:00","End":"2025-06-16T23:19:51.044541269+08:00","ExitCode":1,"Output":""},{"Start":"2025-06-16T23:20:21.045881964+08:00","End":"2025-06-16T23:20:21.124634829+08:00","ExitCode":1,"Output":""},{"Start":"2025-06-16T23:20:51.126544926+08:00","End":"2025-06-16T23:20:51.217019188+08:00","ExitCode":1,"Output":""},{"Start":"2025-06-16T23:21:21.218499355+08:00","End":"2025-06-16T23:21:21.303309462+08:00","ExitCode":1,"Output":""}]}admin@zero4 ~ ➜
注:问下deepseek。
2.查看集群健康检查配置
如果是 Swarm: docker service inspect <service_name>
如果是 Kubernetes: kubectl describe pod <pod_name>
3.检查日志
docker logs <container_id>docker service logs <service_name>
4.验证网络连接
docker exec <container_id> curl -I localhost:<port>20250616周一时间段:23:24-01:00根据您提供的 docker inspect 输出,我们可以看到容器确实处于不健康状态("Status":"unhealthy"),并且已经连续失败了 224 次健康检查("FailingStreak":224)。每次健康检查都返回退出码 1(表示失败),但没有输出任何错误信息("Output":"")。
健康检查模式
检查间隔:约30秒(从时间戳差计算)
每次检查执行很快(约70-90毫秒)
没有输出错误信息,只有退出码1
可能原因
基本服务未运行:健康检查命令可能依赖的服务未在容器内运行
检查命令本身有问题:如脚本路径错误或权限问题
网络限制:如果检查命令涉及网络访问(如curl)
资源限制:容器可能因资源不足无法完成检查
脚本静默失败:健康检查命令失败但不输出错误
查看容器定义的健康检查命令
docker inspect b6eba83d6137 --format='{{json .Config.Healthcheck}}'注:运行结果如下:
admin@zero4 ~ ➜ docker inspect b6eba83d6137 --format='{{json .Config.Healthcheck}}'{"Test":["CMD-SHELL","curl -sf http://localhost:9200 || exit 1"],"Interval":30000000000,"Timeout":30000000000,"Retries":3}
admin@zero4 ~ ➜
注:访问时加个用户名密码才可以进行检测。
手动执行健康检查命令
docker exec b94a3d85a441 sh -c "YOUR_HEALTHCHECK_COMMAND"(请将 YOUR_HEALTHCHECK_COMMAND 替换为上一步获取的实际命令)
检查容器内服务状态
docker exec b94a3d85a441 ps aux检查容器日志
docker logs b94a3d85a441描述:用户反馈会向飞书发消息,但服务器名过不去,需要看一下。
开工:
20250617周二时间段:00:24-02:00打日志看下效果,在zero3上可以在zero4上不行,啥原因呢
20250617周二时间段:09:25-10:00运行时,需要加个环境变量RAG_CUSTOM = test_pet,就能获取到。接下来,加个时间。
20250617周二时间段:09:40-10:00现在发布是没有时间的,截图如下:

图5a-1
注:加个时间,参考程序如下:
pythonfrom datetime import datetimecurrent_time = datetime.now()formatted_time = current_time.strftime("%Y-%m-%d %H:%M:%S")print(formatted_time) # 输出示例:2023-10-25 14:30:45
修改程序如下:
def thumbup(): req = request.json e, conv = ConversationService.get_by_id(req["conversation_id"]) if not e: return get_data_error_result(message="Conversation not found!") up_down = req.get("set") feedback = req.get("feedback", "") conv = conv.to_dict() for i, msg in enumerate(conv["message"]): if req["message_id"] == msg.get("id", "") and msg.get("role", "") == "assistant": if up_down: msg["thumbup"] = True if "feedback" in msg: del msg["feedback"] else: msg["thumbup"] = False if feedback: msg["feedback"] = feedback break ConversationService.update_by_id(conv["id"], conv) # 如果用户配置了飞书机器人,则发送反馈消息到飞书 if conf_get(conf,'conversation.user_feedback.feishu_bot'): notify_feishu(pub_msg = f"【用户反馈】用户 {current_user.id} 给会话{conv['id']}做了反馈,消息id为:{req['message_id']},反馈内容为:{feedback}", webhook_url = conf.conversation.user_feedback.feishu_bot) else: webhook_url = None log.info(f"Feishu webhook_url is not set, skip sending feedback message to Feishu") return get_json_result(data=conv)
注:这个是主函数,修改了获取,子函数中加了时间,如下:
def notify_feishu(pub_msg: str, webhook_url: str = None) -> None: """ 发送消息到飞书机器人 Args: pub_msg: 要发送的消息内容 webhook_url: 飞书机器人Webhook地址 (默认使用原脚本的URL) """ if not webhook_url or not isinstance(webhook_url,str): return host_name = socket.gethostname() ##添加时间 current_time = datetime.now() formatted_time = current_time.strftime("%Y-%m-%d %H:%M:%S") payload = { "msg_type": "text", "content": { "text": f"{formatted_time} {host_name} {pub_msg}" } } headers = {"Content-Type": "application/json"} try: response = requests.post( webhook_url, data=json.dumps(payload), headers=headers ) response.raise_for_status() # 检查HTTP错误 except requests.exceptions.RequestException as e: print(f"飞书通知发送失败: {e}") print(pub_msg) # 打印到控制台
注:发送的效果如下:

图5a-2
注:看着效果还可以。
昨日数据来啦,昨日总收入:763.51块,昨日总播放:529.23万,软件截图如下:

图5c-1
注:想要全托管运营头条号的联系我,你出账号,我来运营,保你天天有钱花,咨询电话: 17701328814(微信同号),也可以加群先了解一下。

图5c-2
注:个人微信如下,欢迎骚扰。

图5c-3
拍摄于2026年2月8日,19:54:13,带大宝出去看花灯,当时,大宝八岁两个月。其实,我是个很感性的人,别人提出什么,我基本不过脑子的答应。其实事先应该花1分钟评估一下,就拿昨天来说,明明软件问题没有解决,200多个人在等着我发作品,我却去见同事了,不尊重副业的结果是收益立马下降,立竿见影。不过,见就见了,也没啥可后悔的,只是下次分个轻重缓急,下次出去,上号的,掉线的先不管,最起码保证软件正常跑,正常发视频再去吧,挣钱的事不是玩笑,应该认真对待,加油!

图5d-1
《本文完》